A nagyobb nyelvi modellek önmagukban nem lesznek ellenállóbbak

A nagyobb nyelvi modellek önmagukban nem feltétlenül válnak ellenállóbbá a célzott támadásokkal szemben. A FAR.AI előzetes kísérletei szerint az adversariális tanítással fejlesztett modelleknél látható skálázódási javulás, a kizárólag tiszta adatokon finomhangolt rendszereknél viszont alig tapasztalható előrelépés.
- A FAR.AI a modellméret és a támadásokkal szembeni robusztusság kapcsolatát vizsgálta.
- A kísérletekben Pythia modelleket és négy bináris osztályozási feladatot használtak.
- A támadások 10 tokent fűztek hozzá az osztályozandó szöveghez.
- Az adversariális tanítással védett modelleknél javulást láttak a skálázással.
- A tiszta adatokon finomhangolt modellek robusztussága alig javult a mérettel.
A kutatás a robusztusságot vizsgálta
A FAR.AI kutatói azt vizsgálták, hogy a modellméret növelése megoldhatja-e a nyelvi modellek robusztussági problémáit. A robusztusságot osztályozási feladatokon mérték, ahol egyértelműen meghatározható a helyes viselkedés: a modellnek a megfelelő címkét kell kiadnia.
A kísérletekben a Pythia modellcsalád tagjait használták. A generatív modellek kimeneti rétegét egy véletlenszerűen inicializált osztályozási fejjel helyettesítették, majd a modelleket négy feladatra hangolták finomhangolással. Ezek között szerepelt a filmértékelések pozitív vagy negatív hangulatának felismerése, a levélszemét azonosítása, annak ellenőrzése, hogy egy felhasználó által megadott szöveg megegyezik-e a kérdésben szereplő szöveggel, valamint annak eldöntése, hogy két szó közül melyik hosszabb.
Tíz hozzáfűzött tokennel támadták a modelleket
A kutatók úgynevezett adversariális utótagos támadásokat vizsgáltak. Ilyenkor a támadó egy ártalmatlan bemenet végére választott tokeneket illeszt, hogy a modell hibás osztályozást adjon. Egy levélszemétként azonosítandó e-mail például ilyen módon nem spamként jelenhet meg a modell számára. A módszer előnye, hogy a hozzáfűzött néhány token várhatóan nem változtatja meg a bemenet jelentését.
Két támadást hasonlítottak össze. A RandomToken módszer véletlenszerűen választ tokeneket, és új sorozatokkal próbálkozik, amíg ki nem merül a támadási keret. A Greedy Coordinate Gradient, röviden GCG, minden iterációban egy tokent módosít, mégpedig azt a tokent választva, amely a gradiensalapú keresés szerint a legnagyobb eséllyel okoz hibás osztályozást. Mindkét támadás 10 tokent fűz hozzá az osztályozandó szöveghez.
A méretnövelés hatása védelem nélkül korlátozott
A FAR.AI összefoglalója szerint az adversariális tanítással védett modellek eredményeiben egyértelmű skálázódási trendeket találtak. Ez azt jelenti, hogy ezeknél a modelleknél a nagyobb méret együtt járt a támadásokkal szembeni jobb ellenállással.
A kizárólag tiszta adatokon finomhangolt modellek esetében ugyanakkor a méretnövelés csak csekély javulást hozott. A kutatók ebből arra következtetnek, hogy a modell nagyobbá tétele és hosszabb tanítása önmagában nem elég a robusztusság biztosításához. A támadásokkal szembeni védelmet külön kell vizsgálni és fejleszteni.
A kutatás egyelőre egyszerű fenyegetési modellt használ. A FAR.AI szerint fontos jövőbeli irány az olyan nyíltabb támadások elemzése, amelyek például átírják a promptot, szinonimákat használnak, vagy nyelvi modellel generált adversariális utasításokra épülnek. A mostani eredmények ezért nem fedik le az összes lehetséges támadási formát.
Miért számít a robusztusság?
A kutatók szerint az adversariális robusztusság szükséges, bár önmagában nem elégséges feltétele a biztonságos AI-rendszereknek. Ilyen rendszereket már olyan területeken is használnak, ahol támadók jelenhetnek meg, például algoritmikus kereskedésben, behatolásészlelésben és hírszerzési adatok elemzésében.
A jövőbeli alkalmazások között a FAR.AI olyan nyelvi modellalapú virtuális asszisztenseket említ, amelyek e-mailekhez, megosztott fájlokhoz és bizalmas adatokhoz férhetnek hozzá. A kutatók szerint a robusztusság skálázási törvényeinek megértése segíthet a számítási kapacitás hatékonyabb elosztásában, a védelmi módszerek fejlesztésében, valamint annak eldöntésében, hogy mely biztonsági problémák oldódhatnak meg nagyobb modellekkel, és melyekhez algoritmikus fejlesztésekre lesz szükség.
FAR.AI: Does Robustness Improve with Scale? | FAR.AI
