Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A nagyobb nyelvi modellek önmagukban nem lesznek ellenállóbbak

2026. augusztus 20.Forrás: FAR.AI
A nagyobb nyelvi modellek önmagukban nem lesznek ellenállóbbak
Kép: FAR.AI

A nagyobb nyelvi modellek önmagukban nem feltétlenül válnak ellenállóbbá a célzott támadásokkal szemben. A FAR.AI előzetes kísérletei szerint az adversariális tanítással fejlesztett modelleknél látható skálázódási javulás, a kizárólag tiszta adatokon finomhangolt rendszereknél viszont alig tapasztalható előrelépés.

A lényeg röviden
  • A FAR.AI a modellméret és a támadásokkal szembeni robusztusság kapcsolatát vizsgálta.
  • A kísérletekben Pythia modelleket és négy bináris osztályozási feladatot használtak.
  • A támadások 10 tokent fűztek hozzá az osztályozandó szöveghez.
  • Az adversariális tanítással védett modelleknél javulást láttak a skálázással.
  • A tiszta adatokon finomhangolt modellek robusztussága alig javult a mérettel.

A kutatás a robusztusságot vizsgálta

A FAR.AI kutatói azt vizsgálták, hogy a modellméret növelése megoldhatja-e a nyelvi modellek robusztussági problémáit. A robusztusságot osztályozási feladatokon mérték, ahol egyértelműen meghatározható a helyes viselkedés: a modellnek a megfelelő címkét kell kiadnia.

A kísérletekben a Pythia modellcsalád tagjait használták. A generatív modellek kimeneti rétegét egy véletlenszerűen inicializált osztályozási fejjel helyettesítették, majd a modelleket négy feladatra hangolták finomhangolással. Ezek között szerepelt a filmértékelések pozitív vagy negatív hangulatának felismerése, a levélszemét azonosítása, annak ellenőrzése, hogy egy felhasználó által megadott szöveg megegyezik-e a kérdésben szereplő szöveggel, valamint annak eldöntése, hogy két szó közül melyik hosszabb.

Tíz hozzáfűzött tokennel támadták a modelleket

A kutatók úgynevezett adversariális utótagos támadásokat vizsgáltak. Ilyenkor a támadó egy ártalmatlan bemenet végére választott tokeneket illeszt, hogy a modell hibás osztályozást adjon. Egy levélszemétként azonosítandó e-mail például ilyen módon nem spamként jelenhet meg a modell számára. A módszer előnye, hogy a hozzáfűzött néhány token várhatóan nem változtatja meg a bemenet jelentését.

Két támadást hasonlítottak össze. A RandomToken módszer véletlenszerűen választ tokeneket, és új sorozatokkal próbálkozik, amíg ki nem merül a támadási keret. A Greedy Coordinate Gradient, röviden GCG, minden iterációban egy tokent módosít, mégpedig azt a tokent választva, amely a gradiensalapú keresés szerint a legnagyobb eséllyel okoz hibás osztályozást. Mindkét támadás 10 tokent fűz hozzá az osztályozandó szöveghez.

A méretnövelés hatása védelem nélkül korlátozott

A FAR.AI összefoglalója szerint az adversariális tanítással védett modellek eredményeiben egyértelmű skálázódási trendeket találtak. Ez azt jelenti, hogy ezeknél a modelleknél a nagyobb méret együtt járt a támadásokkal szembeni jobb ellenállással.

A kizárólag tiszta adatokon finomhangolt modellek esetében ugyanakkor a méretnövelés csak csekély javulást hozott. A kutatók ebből arra következtetnek, hogy a modell nagyobbá tétele és hosszabb tanítása önmagában nem elég a robusztusság biztosításához. A támadásokkal szembeni védelmet külön kell vizsgálni és fejleszteni.

A kutatás egyelőre egyszerű fenyegetési modellt használ. A FAR.AI szerint fontos jövőbeli irány az olyan nyíltabb támadások elemzése, amelyek például átírják a promptot, szinonimákat használnak, vagy nyelvi modellel generált adversariális utasításokra épülnek. A mostani eredmények ezért nem fedik le az összes lehetséges támadási formát.

Miért számít a robusztusság?

A kutatók szerint az adversariális robusztusság szükséges, bár önmagában nem elégséges feltétele a biztonságos AI-rendszereknek. Ilyen rendszereket már olyan területeken is használnak, ahol támadók jelenhetnek meg, például algoritmikus kereskedésben, behatolásészlelésben és hírszerzési adatok elemzésében.

A jövőbeli alkalmazások között a FAR.AI olyan nyelvi modellalapú virtuális asszisztenseket említ, amelyek e-mailekhez, megosztott fájlokhoz és bizalmas adatokhoz férhetnek hozzá. A kutatók szerint a robusztusság skálázási törvényeinek megértése segíthet a számítási kapacitás hatékonyabb elosztásában, a védelmi módszerek fejlesztésében, valamint annak eldöntésében, hogy mely biztonsági problémák oldódhatnak meg nagyobb modellekkel, és melyekhez algoritmikus fejlesztésekre lesz szükség.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat
Kutatás2026. október 1.

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat

A Goodfire „Open Problems in Mechanistic Interpretability” című kutatási oldala jelenlegi formájában egy arXiv-cikkhez irányítja az olvasókat. Az oldalon emellett a…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A FAR.AI szerint a Qoder kiberbiztonsági védelme megkerülhető

A FAR.AI kutatói szerint egy adaptív, projektmemóriára épülő támadással a Qoder parancssoros eszközét vezérlő modellek 30 káros kiberbiztonsági kérésből 27-30 esetben…

Biztonság és etika
Biztonság és etika2026. szeptember 29.

A Qoder kiberbiztonsági védelme 30 támadásból akár 30 esetben megkerülhető volt

A FAR.AI kutatói szerint a Qoder parancssoros ügynökét 30 káros kiberbiztonsági kérésből 27, illetve 30 esetben sikerült rávenni a védelmi korlátozások megkerülésére. A…