A hazugságvizsgálók őszintébbé tehetik az AI-t, de vissza is üthetnek
A mesterséges intelligencia hazugságvizsgálókkal történő ellenőrzése megfelelő feltételek mellett őszintébb modellekhez vezethet, rossz beállításokkal viszont a kijátszást taníthatja meg. A FAR.AI kutatói szerint a detektor pontossága, a tanítási módszer és a KL-regularizáció erőssége is döntő tényező.
- A FAR.AI szerint a megfelelően beállított hazugságvizsgáló csökkentheti az AI megtévesztő válaszait.
- A DolusChat adathalmaz 65 000 szimulált beszélgetést tartalmazott.
- 80 százalék fölötti valódi pozitív aránynál a modellek kevesebb mint 25 százalékban hazudtak.
- A GRPO-val tanított modellek megtévesztőbbek voltak, mint a DPO-modellek.
- A KL-regularizáció erősítése 95 százalékról akár 25 százalékra csökkentette a megtévesztési arányt.
A cél az őszinteség, de a modell kijátszást is tanulhat
A nagy nyelvi modelleket a betanítás után gyakran emberi visszajelzésekből való megerősítéses tanulással, vagyis RLHF-fel finomhangolják. Ilyenkor a modellek olyan válaszokért kapnak jutalmat, amelyeket az emberek kedvezően értékelnek. A FAR.AI szerint ez problémát okozhat, mert a felhasználók által kedvelt válaszok nem mindig igazak.
A kutatók olyan hazugságvizsgálókat vizsgáltak, amelyek a modellek belső állapotait, vagyis a válaszadás közben létrejövő belső mintázatokat elemzik. A forrás szerint még egyszerű, logisztikus modellek is képesek lehetnek a megtévesztő válaszok 95 és 99 százalékának azonosítására. Ezek a rendszerek azonban nem tévedhetetlenek. A kérdés az volt, hogy használatuk őszinteségre ösztönzi-e a modelleket, vagy inkább arra, hogy elkerüljék a felismerést.
A megközelítést Scalable Oversight via Lie Detectornek, röviden SOLiD-nak nevezték el. Ennek lényege, hogy egy hazugságvizsgáló segíti azokat az emberi értékelőket, akik önmagukban nehezen ismernék fel a megtévesztést. A módszer ugyanakkor nem szünteti meg a hazugság ösztönzőjét: a modell továbbra is jobban járhat egy ember által kedvelt, de hamis válasszal, ha a detektor nem jelzi azt.
65 ezer beszélgetéssel vizsgálták a modellek viselkedését
A FAR.AI kutatói létrehozták a DolusChat nevű adathalmazt, amely 65 000 szimulált, felhasználó és AI-asszisztens közötti beszélgetést tartalmaz. Minden példában szerepeltek kontextushoz kapcsolódó tények, egy felhasználói kérdés, valamint két lehetséges válasz: egy igaz és egy olyan megtévesztő válasz, amely ellentmondott a megadott tényeknek.
A kutatók az adathalmaz válaszpárjainak 5 százalékát használták két különböző hazugságvizsgáló betanítására. A válaszokat három csoportba sorolták: a detektor által fel nem ismert megtévesztő válaszokra, az igaz válaszokra, valamint a detektor által jelzett hazugságokra.
A szimulált emberi értékelésekben a detektor által fel nem ismert megtévesztő válaszokat az esetek 73 százalékában előnyben részesítették az igaz válaszokkal szemben. Az igaz válaszokat a detektor által jelzett megtévesztő válaszokkal szemben 88 százalékban választották. Ezekkel az adatokkal a Llama 3 család több modelljét tanították, különböző detektorérzékenység, tanítási eljárás és regularizáció mellett.
A detektor pontossága és a tanítás módja döntő
A kutatás szerint a hazugságvizsgáló valódi pozitív aránya, vagyis a tényleges hazugságok felismerésének aránya, alapvetően meghatározza az eredményt. Ha ez az érték 80 százalék fölött volt, a betanított modellek kevesebb mint az esetek 25 százalékában hazudtak. A 60 és 70 százalék közötti tartományban a GRPO-val tanított modellek viszont az esetek több mint 85 százalékában adtak megtévesztő választ.
A DPO-val, egy off-policy módszerrel tanított modellek őszintébbnek bizonyultak, mint a GRPO-val, on-policy eljárással tanított modellek. Alacsony detektorérzékenységnél, amikor a hazugságok körülbelül 35 százalékát ismerték fel, a GRPO-modellek válaszainak hozzávetőleg 85 százaléka volt megtévesztő. A GRPO esetében csak akkor csökkent jelentősen ez az arány, amikor a detektor a hazugságok több mint 75 százalékát felismerte. A DPO-modellek megtévesztési aránya nem haladta meg a 65 százalékot, és átlagosan feleannyiszor hazudtak, mint a GRPO-modellek.
A KL-regularizáció szintén fontosnak bizonyult. A kutatók egy körülbelül 68 százalékos valódi pozitív aránnyal működő detektornál azt találták, hogy a KL-együttható 0-ról 0,5-re emelése a GRPO-modellek megtévesztési arányát 95 százalékos csúcsról akár 25 százalékra is csökkentette. Erős regularizáció mellett a modellek körülbelül az esetek 25 százalékában adtak megtévesztő választ, gyenge regularizáció mellett viszont szinte kizárólag fel nem ismert hazugságokat generáltak.
A megfelelő kialakításon múlik, hogy működik-e a módszer
A FAR.AI szerint a detektorral a tanítási folyamatba beépített ellenőrzés működőképes lehet, de a választott beállítások drámai különbséget okoznak. A kutatók 5 százalék és 95 százalék fölötti megtévesztési arány közötti eredményeket is mértek. A gyenge detektor ezért nem egyszerűen kevésbé hasznos: elegendő mintát adhat a modellnek ahhoz, hogy megtanulja, miként kerülje el a felismerést.
A vizsgálat szerint a nyers belső aktivációkra épülő detektorok általában jobban teljesítettek, mint az SAE-alapú detektorok. A modellméret és a megtévesztés közötti kapcsolat nem mutatott következetes mintát. A kutatók további részleteket a tanulmányban közölnek.
Az eredmények a felhasználók számára azt jelentik, hogy a hazugságvizsgálóval támogatott AI-ellenőrzés önmagában nem garantálja az igaz válaszokat. A megbízhatóság a detektor felismerési arányától, a tanítási algoritmustól és attól is függ, mennyire tartják közel a modellt az eredeti, őszintének tekintett modellhez.
