Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A FAR.AI szerint a szuperemberi Go-rendszerek is támadhatók

2026. augusztus 19.Forrás: FAR.AI
A FAR.AI szerint a szuperemberi Go-rendszerek is támadhatók
Kép: FAR.AI

A szuperemberi Go-rendszerek is sérülékenyek lehetnek ellenséges támadásokkal szemben, állítja a FAR.AI. A nonprofit AI-biztonsági kutatóintézet 2023-as beszámolója a robusztusság, az értékek összehangolása és a modellértékelés területén végzett munkát mutatja be.

A lényeg röviden
  • A FAR.AI szerint a KataGo és más szuperemberi Go-rendszerek ellenséges támadásokkal szemben sebezhetők.
  • A kutatóintézet a robusztusságot, az értékek összehangolását és a modellértékelést vizsgálja.
  • A kutatók a nyelvi modellek robusztusságának skálázási törvényeit keresik.
  • Egy módszer természetes nyelvű visszajelzésből tanul jutalmazási függvényt.
  • A FAR.AI szerint az eljárással 100 emberi visszajelzési minta is elég lehetett az összefoglalásra történő finomhangoláshoz.

Három kutatási irányra épít a FAR.AI

A FAR.AI 2023. november 20-án közzétett összefoglalója szerint a szervezet valamivel több mint egy éve alakult, és olyan korai fázisban lévő kutatási megközelítéseket támogat, amelyek egyéni akadémiai vagy független kutatók számára túl nagyok lehetnek, a profitorientált szervezetek számára pedig még kevéssé vonzóak.

A kutatóintézet küldetése olyan biztonsági technikák inkubálása és felgyorsítása, amelyek demonstrálható garanciákat adhatnak a fejlett mesterségesintelligencia-rendszerek biztonságára. A FAR.AI szerint a jelenleg használt összehangolási módszerek, köztük az emberi visszajelzéssel végzett megerősítéses tanulás (RLHF), nem érik el ezt a szintet.

A szervezet jelenlegi kutatási portfóliója három területre oszlik: a robusztusság tudományára, az értékek összehangolására és a modellek értékelésére. A kutatók egyebek mellett azt vizsgálják, hogyan változik a robusztusság a modellek méretével, miként lehet megbízható jutalmazási függvényeket tanulni emberi adatokból, valamint hogyan tesztelhetők a korszerű modellek biztonsági szempontból fontos tulajdonságai.

A Go-rendszerek hibái katasztrofálisak lehetnek

A FAR.AI robusztussági kutatása szerint az olyan szuperemberi Go-rendszerek, mint a KataGo, ellenséges támadásokkal szemben sebezhetők. A beszámoló Tony Wang csapatának ICML-konferencián bemutatott tanulmányát is említi, amely szerint az AlphaGo-hoz hasonló rendszerek katasztrofális hibamódokat mutatnak.

A szervezet párhuzamot von a mérnöki tervezéssel. A hidaknál a mérnökök megbecsülik, mekkora terhelést kell kibírniuk az egyes elemeknek, majd megfelelő biztonsági tartalékot választanak. A FAR.AI szerint a mesterséges intelligenciában nincs ennek megfelelő, elméletileg megalapozott módszer a robusztusság kiszámítására. A jelenlegi gyakorlat lényegében egy betanított modell ismételt tesztelése.

A kutatók iterált ellenséges tanítást és alternatív hálózati architektúrákat vizsgálnak annak kiderítésére, megszüntethető-e ez a gyengeség. Adrià Garriga-Alonso és mások mechanisztikus értelmezhetőségi módszerekkel keresik a hibához vezető belső reprezentációkat és számításokat. Az aktivációfoltok elemzését és az automatikus áramkör-felderítést is mérlegelik.

Adam Gleave, Niki Howe és más kutatók a robusztusság nyelvi modellekben érvényes skálázási törvényeit keresik. Céljuk többek között annak vizsgálata, hogyan változik az ellenséges tanítás minta-hatékonysága a modellmérettel, illetve mekkora számítási kapacitásra lehet szükség ahhoz, hogy a modell félreosztályozzon egy példát.

Természetes nyelvi visszajelzésből tanulhatnak a modellek

Az értékek összehangolásával foglalkozó kutatók abból indulnak ki, hogy a mesterséges intelligencia kívánatos viselkedését jutalmazási függvényekkel lehet leírni. Ezek kézzel történő meghatározása valós környezetekben nem kivitelezhető, ezért a függvényeket emberi adatokból kell megtanulni. A FAR.AI szerint az ilyen modelleknek a felhasználói preferenciákat a lehető legpontosabban kell tükrözniük, mert a jutalmazási függvény apró hibái is veszélyes következményekkel járhatnak.

Scott Emmons csapata arra jutott, hogy a nyelvi modellek legalább bizonyos mértékben értik az emberi preferenciákat. A beszámoló szerint a GPT-3 beágyazásai tartalmaznak egy, a józan észen alapuló erkölcsi ítéletekhez kapcsolódó irányt. Jérémy Scheurer és mások erre építve olyan módszert dolgoztak ki, amely természetes nyelvű visszajelzésből tanul jutalmazási függvényt.

A FAR.AI szerint ezzel a megközelítéssel egy modellt mindössze 100 emberi visszajelzési minta felhasználásával lehetett finomhangolni összefoglalásra. A módszer különösen hasznosnak bizonyult a kódgenerálás javításában. A kutatási irányok alapján a beszámoló a biztonság ellenőrzését, a modellek belső működésének megértését és a felhasználói preferenciák hatékonyabb közlését kapcsolja össze.

Kapcsolódó hírek

Az AI a biológiai kutatások baleseti kockázatát is növelheti
Cégek és üzlet2026. október 2.

Az AI a biológiai kutatások baleseti kockázatát is növelheti

A mesterséges intelligencia biológiai kutatásokba építése nemcsak a biológiai fegyverek szándékos fejlesztésének kockázatát vetheti fel, hanem a laboratóriumi…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A FAR.AI szerint a Qoder kiberbiztonsági védelme megkerülhető

A FAR.AI kutatói szerint egy adaptív, projektmemóriára épülő támadással a Qoder parancssoros eszközét vezérlő modellek 30 káros kiberbiztonsági kérésből 27-30 esetben…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A Qoder kiberbiztonsági védelme 30 támadásból akár 30 esetben megkerülhető volt

A FAR.AI kutatói szerint a Qoder parancssoros ügynökét 30 káros kiberbiztonsági kérésből 27, illetve 30 esetben sikerült rávenni a védelmi korlátozások megkerülésére. A…