Nyílt modellel követték vissza, miből tanulhat társas következtetést egy LLM

Az Ai2 2026. augusztus 21-én számolt be arról, hogy a Georgia Tech két kutatója az Olmo 3 nyílt eszköztárával vizsgálta egy nyelvi modell társas következtetésének eredetét. Glenn Matlin és Chandreyi Chakraborty azt elemezte, milyen típusú tanítóadatok formálhatták az Olmo 3 válaszait különböző teszteken.
- A Georgia Tech kutatói az Olmo 3 nyílt ökoszisztémájával vizsgálták a társas következtetés eredetét.
- A Dolma 3 mintegy 1,26 milliárd dokumentumából körülbelül 5,68 milliós mintát elemeztek 576 kategória mentén.
- A SocialIQA teszten a narratív, párbeszédes és személyközi szövegek hatása emelkedett ki.
- Az irodalom kategória legbefolyásosabb dokumentumainak elfelejtetése nagyobb SocialIQA-visszaesést okozott, mint véletlen dokumentumok eltávolítása.
- Az Ai2 szerint a nyílt adatok, ellenőrzőpontok és értékelési eszközök független auditálást tesznek lehetővé.
A kérdés: honnan ered a társas következtetés?
Glenn Matlin, a Georgia Tech számítástudományi doktorandusza és szerzőtársa, Chandreyi, Zini, Chakraborty évek óta vizsgálja, hogyan alakul ki egy nyelvi modell társas következtetése, vagyis az a képessége, hogy emberek hiedelmeit, érzelmeit, szándékait és hétköznapi erkölcsi döntéseit értelmezze.
Chakraborty az Ai2 közlése szerint így fogalmazta meg a kutatás kiindulópontját: „Egy fő kérdéssel indultunk: honnan ered?” A kutatók ehhez úgynevezett befolyásfüggvényeket használtak. Ez a módszer azt becsüli meg, hogy egy adott tanítódokumentum, például cikk, bejegyzés vagy weboldal, mennyiben alakította a modell válaszát egy konkrét benchmarkkérdésre.
A módszer csak akkor működik megbízhatóan, ha ellenőrizhető, hogy a modell valóban tanult az adott dokumentumokon. Az Ai2 szerint ezért választották az Olmo 3 modellt, amely azon kevés nagy nyelvi modellek közé tartozik, amelyeket teljes egészében nyilvánosan tettek közzé: a tanítókorpuszok, az ellenőrzőpontok és az értékelési eszközök is elérhetők a modell súlyai mellett.
Matlin az Ai2-nek azt mondta: „A kutatásom víziója az, hogy olyan térképet hozzak létre, amely a modell viselkedését visszakapcsolja azokhoz a tanítóadat-típusokhoz vagy dinamikákhoz, amelyek segíthettek annak létrehozásában.”
Öt nyílt komponensre épült a vizsgálat
Matlin és Chakraborty tanulmánya az Olmo ökoszisztéma öt nyílt elemét használta: az Olmo 3 modellt, a Dolma 3 tanítóadatkészletet, amelyen az Olmo 3 tanult, a WebOrganizer címkézőrendszert, az OlmoEval értékelési eszközt, valamint az OLMES közös benchmarkpontozási szabványt.
A Dolma 3 körülbelül 1,26 milliárd dokumentumot tartalmaz, ezért a kutatók nem egyenként elemezték a teljes adathalmazt. Ehelyett körülbelül 5,68 millió dokumentumból álló mintát vettek, rétegezve a Dolma 3 576 dokumentumkategóriája szerint. Ezután megmérték, hogy az egyes dokumentumok mennyire befolyásolták az Olmo 3 válaszait egy adott benchmarkon, majd az eredményeket kategóriánként egyetlen pontszámmá vonták össze.
A folyamatot négy benchmarkon ismételték meg. A SocialIQA és az ARC-Challenge a következtetést vizsgálta, az MMLU társadalomtudományi és STEM részei pedig a tényszerű tudást mérték. Így minden benchmarkhoz külön profil készült arról, hogy mely dokumentumkategóriák formálták legerősebben a modell válaszait.
A társas következtetésnél a narratív és párbeszédes szövegek emelkedtek ki
A négy profil összevetése az Ai2 beszámolója szerint kevésbé kézenfekvő felosztást mutatott annál, mint hogy egyszerűen társadalmi és tudományos területeket különítsenek el. A társadalomtudományi tudás sokkal inkább hasonlított a STEM tudáshoz és a következtetéshez, mint a társas következtetéshez.
A SocialIQA kilógott a sorból. Az Olmo 3 válaszai ezen a teszten szokatlanul erősen támaszkodtak narratív, személyközi írásokra, köztük olyan Dolma-kategóriákra, mint az irodalom, a társas élet, az ügyféltámogatás és a kérdés-válasz szálak. A többi benchmark nagyobb arányban merített magyarázó jellegű anyagokból, például műszaki dokumentációból és tudományos írásokból.
Chakraborty az Ai2 szerint így összegezte az eredményt: „A párbeszédekben gazdag, társas és affektív nyelvben erős kategóriák erősebben befolyásolták a társas következtetést, mint bármely más benchmarkot.”
A minta ugyanakkor nem korlátozódott a társas következtetésre. A párbeszédes, személyközi írások mindkét következtetési benchmarknál erősebb hatást mutattak, mint a tudást mérő teszteknél. Ez arra utalhat, hogy az ilyen adatok a következtetéshez is hozzájárulhatnak, túl azon, hogy társas helyzetekről adnak mintákat a modellnek.
Oksági teszttel is ellenőrizték a kapcsolatot
A kutatók ezután oksági próbát végeztek: azt vizsgálták, romlik-e a modell teljesítménye, ha eltávolítják azokat az adatokat, amelyek a leginkább formáltak egy képességet. Az Olmo 3-mal elfelejtettették a Dolma irodalom kategóriájának legbefolyásosabb dokumentumait, mivel ez a kategória kapcsolódott a legerősebben az Olmo 3 társas következtetéséhez.
Az eredmény szerint a SocialIQA-pontszám jobban csökkent, mint akkor, amikor ugyanebből a kategóriából véletlenszerű dokumentumokat távolítottak el. Az Ai2 értelmezése szerint ez azt jelzi, hogy a képességkövetésnek lehet szerepe a modellviselkedés utólagos magyarázatán túl is.
Ha a kutatók azonosítani tudják, hogy a tanítókorpusz mely részei támogatnak egy adott képességet, akkor tesztelhetik, hogyan hat az adatok gazdagítása, újrasúlyozása vagy eltávolítása. A beszámoló szerint az eredmények nem adnak egyszerű receptet, például azt, hogy több irodalmi szöveg automatikusan jobb társas következtetést eredményezne, de segíthetnek abban, hogy a tanítóadatokról szóló döntések jobban kapcsolódjanak ahhoz, milyen adattípusok mihez járulnak hozzá.
Mit jelent ez a nyílt AI-kutatásnak?
Az Ai2 szerint egy modell teljes tanítóadatkészletén visszavezetni egy képességet eddig főként olyan nagy laborokban volt lehetséges, amelyek nem teszik nyilvánossá az adataikat, a modellpillanatképeiket és az értékelési eszközeiket. Az Olmo nyílt elemei lehetővé tették, hogy Matlin csapata független kutatóként végezzen ilyen vizsgálatot.
Matlin az Ai2 közlése szerint így fogalmazott: „Az AI-biztonsági kutatóknak olyan munkát kell végezniük, amely megkérdőjelezi a nyelvi modellekkel kapcsolatos bevett feltételezéseket, és teljesen új módszereket vizsgál a modellviselkedés auditálására. Ez nem lenne lehetséges, ha a kutatóknak teljes mértékben magánlaboroktól kellene függniük a modellartefaktumok terén. Az Ai2 nem egyszerűen egy modellt adott ki, hanem a tudományos eszköztárból eleget ahhoz, hogy egy külső csapat megvizsgálja a modellt, és szükség esetén az alapoktól reprodukálja.”
A kutatók kódja és részletes kísérleti eredményei az Ai2 szerint a projekt weboldalán, valamint a Discord-szerverükön érhetők el. A felhasználók és a piac szempontjából a hír fő üzenete az, hogy a nyílt modellkiadás nemcsak a súlyok közzétételét jelentheti: a tanítóadatok, az ellenőrzőpontok és az értékelési eszközök együtt olyan vizsgálatokat tehetnek lehetővé, amelyek közelebb visznek a modellek viselkedésének ellenőrizhető megértéséhez.


