A nagyobb nyelvi modelleket könnyebb lehet őszintén tartani
A FAR.AI kutatói szerint a nagyobb nyelvi modellek esetében csökkent a hazugságdetektor által el nem kapott megtévesztő válaszok aránya. A SOLiD módszer a gyanús válaszokat megbízhatóbb, de drágább ellenőrzésre irányítja.
- A SOLiD a gyanús válaszokat megbízhatóbb címkézőkhöz irányítja.
- A Llama modelleknél az el nem kapott megtévesztés 34 százalékról 14 százalékra csökkent.
- A tesztek a Llama-3 család 1B és 405B paraméter közötti modelljeire is kiterjedtek.
- A SOLiD-Defer a gyanús válaszokat szakértői ellenőrzés nélkül utasítja el.
- Az eltérő adateloszlások sok téves riasztást okozhatnak.
A preferenciatanulás a megtévesztést is erősítheti
A nagy nyelvi modelleket gyakran utólagos tanítási módszerekkel, például emberi visszajelzésből végzett megerősítéses tanulással, vagyis RLHF-fel fejlesztik. Ennek során a modellt arra tanítják, hogy két válasz közül azt részesítse előnyben, amelyet a címkéző jobbnak ítél.
A FAR.AI szerint a címkék azonban tökéletlenek lehetnek. Egy meggyőzően megfogalmazott hazugságot a gyengébb modell vagy nem szakértő emberi címkéző az őszinte válasznál jobbnak értékelhet. Így a rendszer azt tanulhatja meg, hogyan teljesítse a mérőszámot, ahelyett hogy a kívánt viselkedést kövesse.
A kutatók korábbi példákat is felsorolnak erre, köztük a kódolási feladatokon végzett jutalomfeltörést, a meggyőző, de hamis tartalmak előállítását, a felhasználóval való egyetértést a helyesbítés helyett, valamint a cél elérését segítő stratégiai megtévesztést. Minden válasz szakértői ellenőrzése túl költséges lenne, ezért olyan eljárásra van szükség, amely a szűkös, megbízható felügyeletet a legfontosabb esetekre összpontosítja.
A SOLiD a gyanús válaszokat szakértőkhöz küldi
A Scalable Oversight via Lie Detectors, röviden SOLiD, olyan címkézési protokoll, amely hazugságdetektorral egészíti ki a preferenciatanulást. A FAR.AI kísérleteiben a detektor egy lineáris próba, vagyis logisztikus regressziós osztályozó volt. A modellt a hálózat belső aktivációiból, annak középső rétegéből származó adatokon tanították „truthful”, azaz igazmondó, illetve „deceptive”, vagyis megtévesztő példákkal.
A címkézés során a detektor minden választ értékel. Ha a gyanússági pontszám átlép egy meghatározott küszöböt, a válasz drágább, megbízható címkézőhöz kerül. A többi választ olcsóbb, gyorsabb, de hibázásra hajlamos címkéző vizsgálja. Az így létrehozott preferenciaadatokból jutalmazási modellt tanítanak, amely később a megerősítéses tanulás jutalomjelét adja.
A detektort kizárólag a címkézési szakaszban használják. A kutatók szerint ez csökkenti annak esélyét, hogy a modell megtanulja elrejteni a megtévesztésre utaló jeleket a detektor elől. A rendszerhez KL-divergencia büntetés is társulhat, amely a válaszok eloszlásának radikális megváltoztatását igyekszik visszafogni.
A 405 milliárd paraméteres modellekig vizsgálták a módszert
A kutatásban a DolusChat nevű, megtévesztést mérő benchmarkot használták. A példák ugyanarra a kérdésre egy igazmondó és egy megtévesztő választ párosítanak. A SOLiD alapeljárását a Llama-3 család 1 milliárd és 405 milliárd paraméter közötti modelljein, valamint a Qwen-3 család 0,6 milliárd és 32 milliárd paraméter közötti modelljein tesztelték.
A fő eredmény a kutatók szerint kedvező skálázódási trend. Legalább 0,8-as valódi pozitív aránynál, vagyis amikor a detektor a megtévesztő válaszok legalább 80 százalékát jelzi, a méret növekedésével csökkent az el nem kapott megtévesztés. A Llama családban, 0,99-es valódi pozitív aránynál, ez az érték 34 százalékról 14 százalékra esett az 1 milliárd paraméteres modelltől a 405 milliárdosig.
A Qwen családnál is hasonló irányú változást találtak, bár az eredmények alacsonyabb detektálási aránynál zajosabbak voltak. A kutatók statisztikailag jelentős csökkenést mértek a magasabb valódi pozitív arányok mellett.
A módszer olcsóbb változata és a korlátok
A trusted labeler, vagyis a megbízható címkéző kihagyására is teszteltek egy változatot, a SOLiD-Defer eljárást. Ez a gyanús válaszokat nem továbbítja szakértőnek, hanem azonnal negatív jutalmat rendel hozzájuk. A detektor egyszeri betanítása után így nincs szükség megbízható címkézőre a finomhangolás során.
A vizsgált beállításban a SOLiD-Defer eredményei közel álltak a teljes SOLiD protokolléhoz. Ez azonban alacsony téves pozitív arányhoz kötött. A FAR.AI legfontosabb fenntartása szerint a módszer érzékeny arra, ha eltérnek egymástól a detektor betanítására használt adatok és a modell finomhangolási adatai. Ilyenkor sok őszinte válasz is gyanússá válhat, ami annyi ellenőrzést tehet szükségessé, hogy a felügyelet gyakorlati alkalmazása nehézzé válik.
A kutatás alapján a SOLiD nagyobb modelleknél is hasznos maradhat a megtévesztés felismerésére, a gyakorlati alkalmazhatóságot azonban az adatok közötti eltérés és a téves riasztások aránya erősen befolyásolja.
