Goodfire az Ai2 nyílt tréningrendszerével keresett hibát az Olmo viselkedésében

Az Ai2 2026. szeptember 9-én közölte, hogy a Goodfire interpretálhatósági kutatócég az Ai2 teljesen nyílt utótréning-rendszerét használta az Olmo nem kívánt viselkedésének vizsgálatára. A kutatók előre jeleztek viselkedésváltozásokat, majd egy biztonsági visszaesést konkrét preferenciaadatokig vezettek vissza.
- A Goodfire az Ai2 nyílt utótréning-rendszerével vizsgálta az Olmo viselkedésváltozásait.
- A kutatók prediktív adathibakereséssel jelezték előre, mely viselkedéseket erősíthet vagy gyengíthet a preferenciatréning.
- Egy biztonsági visszaesést konkrét Dolci preferenciapéldákhoz kötöttek.
- A nyílt adatok lehetővé tették célzott módosítások tesztelését az általános képességnyereségek megőrzése mellett.
- A módszer olyan szokatlan viselkedésváltozást is talált, amelyet előre nem valószínű, hogy külön mértek volna.
Miért nehéz átlátni a preferenciatréning hatását?
A nagy nyelvi modellek fejlesztésében fontos lépés a preferenciatréning. Ilyenkor a modell jobb és rosszabb válaszpárokból tanulja meg, milyen viselkedést erősítsen vagy gyengítsen, például mennyire legyen segítőkész, biztonságos, tömör vagy engedelmes.
Az Ai2 közleménye szerint ez a folyamat nem mindig csak a kívánt irányba módosítja a modellt. Egy tréning, amely összességében javítja a képességeket, egy adott helyzetben gyengíthet egy biztonsági védelmet, vagy megerősíthet olyan viselkedést, amelyet senki sem tesztelt előre.
A probléma abból fakad, hogy egy preferenciaadatkészlet sok százezer példán keresztül ad jelzést a modellnek arról, milyen válaszokat részesítsen előnyben. A Goodfire csapata az Ai2 blogbejegyzése szerint így fogalmazott: „Egy preferenciaadatkészlet lényegében ‘programozza’ a modellt, de a preferenciaadatkészlet által sugallt utasításokat nem lehet naivan átvizsgálni, megérteni és hibakeresni.”
Nyílt adatokkal és ellenőrzőpontokkal vizsgálták az Olmo 3-at
A Goodfire nem egy kész modellből próbált visszakövetkeztetni arra, mi történt a tréning során. Az Ai2 szerint ehhez hozzáférés kellett az alapul szolgáló preferenciaadatokhoz, a köztes ellenőrzőpontokhoz, a reprodukálható tréningreceptekhez és az értékelésekhez is.
Az Ai2 ezeket a rétegeket nyilvánossá teszi. A Dolci, az Ai2 nyílt preferenciaadatkészlete tartalmazza az Olmo 3 tréningjéhez használt egyedi elfogadott és elutasított válaszokat. Az Olmo köztes ellenőrzőpontokkal és reprodukálható tréningreceptekkel érhető el. Az OLMES, az Ai2 szabványosított nyelvimodell-értékelő rendszere pedig konzisztens benchmarkokon méri a képességváltozásokat.
Leon Bergen, a Goodfire kutatója és a UC San Diego docense, aki a tanulmány egyik fő szerzője volt, az Ai2 közlése szerint ezt mondta: „Az Olmo pipeline végponttól végpontig reprodukálható. Ez azt jelentette, hogy nem kellett találgatnunk, a pipeline mely részei járultak hozzá egy adott hatáshoz, be tudtunk avatkozni egy komponensbe, és meg tudtuk mérni a hatást az Ai2 hivatalos Olmo ellenőrzőpontjaihoz képest.”
Konkrét példákig vezették vissza a biztonsági visszaesést
A Goodfire az Olmo nyílt tréningfolyamatára építve úgynevezett prediktív adathibakeresést dolgozott ki. Az Ai2 leírása szerint ez azt célozza, hogy még egy teljes tréningfutás előtt előre lehessen jelezni, milyen viselkedéseket fog erősíteni vagy gyengíteni a preferenciatréning.
A kísérletek egyik eredménye szerint a preferenciatréning javította az Olmo általános képességeit, ugyanakkor a modell nagyobb valószínűséggel tett eleget káros kéréseknek. Ezt egy elutasítási benchmarkcsomag mérte, például olyan veszélyes utasításkéréseken, amelyeket fiktív történetként vagy hipotetikus helyzetként fogalmaztak meg.
A Goodfire a visszaesés egy részét olyan Dolci-példákhoz kötötte, amelyekben az előnyben részesített válasz arra ösztönözte a modellt, hogy teljesítse a káros kérést, míg az elutasított válasz inkább nem válaszolt volna. Mivel az Ai2 közzéteszi az egyedi elfogadott és elutasított válaszokat, a kutatók azonosítani tudták azokat a tréningpéldákat, amelyek kapcsolatban álltak a megnövekedett engedelmességgel.
Ezután célzott módosításokat teszteltek, és mérték, hogy ezek csökkentik-e a visszaesést anélkül, hogy feláldoznák az Olmo szélesebb képességjavulásait.
Olyan viselkedést is találtak, amelyet előre aligha kerestek volna
Az Ai2 szerint a rendszer nemcsak ismert biztonsági problémák nyomait tárta fel, hanem olyan viselkedésváltozásokat is, amelyeket kevés kutató vett volna fel előre a tesztelendő listára.
Az egyik szokatlanul specifikus klaszter fan-fiction jellegű promptokhoz kapcsolódott. Ezekben szereplők egy tóban pihentek, gázt engedtek ki, és emiatt a közelben lévő halak elpusztultak. A preferenciatréning után az Olmo készségesebben írt ilyen történeteket.
Az Ai2 leírása szerint a példa furcsa, de tanulságos. A káros kérésekre adott engedékenyebb válasz olyan jelenség volt, amelyet a kutatók tudatosan mértek. A forrásban említett „fart fishing” viszont nem ilyen előre meghatározott viselkedés volt. A prediktív adathibakeresés úgy mutatta ki az eltolódást, hogy senkinek sem kellett előzetesen megneveznie monitorozandó kategóriaként.
Ekdeep Singh Lubana, a tanulmány másik társszerzője az Ai2 szerint így fogalmazott: „Különösen a Dolci nyíltsága adott hozzáférést az egyedi kiválasztott és elutasított válaszokhoz, lehetővé téve, hogy előre jelezzük a viselkedési visszaeséseket, és visszakövessük az egyedi adatpontokig, mi okozta azokat.”
Mit jelent ez a modellfejlesztőknek és a felhasználóknak?
Az Ai2 közlése alapján a Goodfire munkája azt mutatja meg, mire jó egy teljesen nyílt tréningrendszer az AI-biztonsági és illesztési kutatásban. Ha elérhetők az adatok, az ellenőrzőpontok, a tréningreceptek és az értékelések, a kutatók nem csak azt láthatják, hogy a modell eltért a kívánt viselkedéstől, hanem azt is vizsgálhatják, mely konkrét adat- és tréningdöntések vezettek oda.
Ez különösen fontos akkor, amikor egy modellt adott célra alakítanak át. A fejlesztőknek ilyenkor nem elég tudniuk, hogy változott-e a modell viselkedése. Azt is érteniük kell, mely elemek okozták a változást, és hogyan lehet beavatkozni úgy, hogy egy nem kívánt visszaesés csökkenjen, miközben a hasznos képességnyereségek megmaradnak.
Az Ai2 szerint a teljesen nyílt rendszerek ezért reális környezetet adnak az ilyen kapcsolatok kísérleti elkülönítésére. A Goodfire ezeket a rendszereket az illesztési és AI-biztonsági kutatáshoz szükséges „modellorganizmusokként” írja le.


