Az Apple LinEAS módszere kevés adattal irányítja a generatív modelleket

Az Apple kutatói a LinEAS nevű módszert mutatták be, amely a generatív modellek aktivációinak módosításával igyekszik biztonságosabbá és jobban irányíthatóvá tenni a modellek kimenetét. A megoldás kevés, párosítatlan mintával is működhet, és szöveges, valamint szövegből képet készítő modelleken is vizsgálták.
- A LinEAS a generatív modellek aktivációinak end-to-end vezérlését tanítja.
- A módszer néhány párosítatlan mintával is hatékonynak bizonyult.
- Az Apple szerint a LinEAS javított a toxicitás mérséklésén nyelvi modellekben.
- Szövegből képet készítő, egyetlen lépésben működő modelleken is tesztelték.
- A ritkító normák automatikus neuronválasztást tehetnek lehetővé.
Globális veszteségfüggvény az aktivációk vezérlésére
A LinEAS, vagyis a linear end-to-end activation steering olyan eljárás, amely a generatív modellek viselkedését közvetlenül a modell aktivációinak módosításával próbálja befolyásolni. Az Apple kutatói szerint erre szükség lehet például biztonságosabb tartalmak előállításához, illetve ahhoz, hogy a felhasználók különböző stílusokat fedezhessenek fel.
A módszer kiindulópontja, hogy a forrás- és célhalmazból származó felszólítások használatakor eltérő eloszlások jelenhetnek meg az aktivációkban. Korábbi, gyors eljárások ezeket a különbségeket helyileg kezelték. Az Apple leírása szerint ez nem vette figyelembe a beavatkozások későbbi rétegekre gyakorolt hatását, ezért a modellen kívüli példákon nem kívánt eltolódásokat okozhattak.
A LinEAS ezzel szemben globális veszteségfüggvényt használ, amely egyszerre számol az összes réteg eloszlásbeli eltérésével. A kutatók szerint ez robusztusabb beavatkozásokat tesz lehetővé. A tanítás során ritkító normák is alkalmazhatók, amelyek automatikusan kiválaszthatják a releváns neuronokat.
Kevés párosítatlan mintával is használható
Az Apple közlése alapján a LinEAS hatékonyságához mindössze néhány párosítatlan minta is elegendő lehet. A párosítatlan adatoknál nincs szükség egyértelmű preferenciajelölésre vagy olyan mintapárokra, amelyek megmutatják, hogy ugyanazt a bemenetet milyen kívánt kimenetre kell módosítani.
Ez a tulajdonság a módszer költségeit is érintheti, mivel a kutatók eleve olyan vezérlési megoldást kerestek, amely tanításkor és következtetéskor is olcsó, miközben megőrzi a kimenet minőségét. A LinEAS az Apple szerint a hasonló kiindulási módszereknél jobb eredményt ért el a nyelvi modellek toxicitásának mérséklésében.
A vállalat kutatói azt is közölték, hogy a LinEAS versenyképessé vált olyan módszerekkel szemben, amelyek erős felügyeletet, vagyis úgynevezett orákulumtól származó információt használnak. A forrás ezt a toxicitáscsökkentési kísérletek eredményeire vonatkozóan írja le.
Szövegből kép készítő modelleken is tesztelték
A LinEAS nem kötődik egyetlen modalitáshoz. Az Apple szerint a módszer modalitásfüggetlen, és a kutatók szövegből képet készítő, egyetlen lépésben működő modelleken is megvizsgálták.
Ezekben a kísérletekben a LinEAS felülmúlta a meglévő aktivációvezérlési módszereket az új fogalmak kimenetbe történő bevitelében és azok mérséklésében. A forrás nem közöl konkrét pontszámokat vagy részletes mérési eredményeket, ezért a teljesítménykülönbség nagysága nem állapítható meg belőle.
A tanulmány címe LinEAS: End-to-end Learning of Activation Steering with a Distributional Loss. Az Apple kutatói, Pau Rodríguez, Michal Klein, Eleonora Gualdoni, Valentino Maiorca, Arno Blaas, Luca Zappella, Marco Cuturi és Xavier Suau jegyzik. A dolgozat a NeurIPS konferenciához kapcsolódik, és 2025 novemberében jelent meg. A szerzők a forráskódhoz is hozzáférést biztosítanak a GitHubon.
Mit jelenthet ez a generatív modellek használatában?
A forrás alapján a LinEAS olyan vezérlési lehetőséget kínál, amelyhez kevés párosítatlan adat szükséges, és amely a modell belső aktivációinak módosítására épít. Ez a megközelítés a szöveges modellek toxicitásának mérséklését, valamint a szövegből képet készítő modellek fogalmi és tartalmi kimenetének alakítását is célozhatja.
Az Apple kutatási oldala a módszert az aktivációvezérlés fejlődésének részeként mutatja be. A kapcsolódó olvasmányok között szerepel egy 2025 áprilisában közzétett munka az aktivációk transzportálásáról nyelvi és diffúziós modellekben, valamint a 2026. szeptember 18-án ismertetett Dynamically Scaled Activation Steering. Utóbbi a forrás szerint azt választja külön, hogy mikor szükséges beavatkozni, és hogyan kell elvégezni a vezérlést.


