Más választ adnak a vezető AI-modellek attól függően, ki kérdez

A vezető AI-modellek gyakran FDT vagy UDT mellett érvelnek, ha általánosan kérdezik őket a helyes döntéselméletről, akadémiai hátteret érzékelve viszont sokszor CDT-t választanak. A Redwood Research szerint a jelenség a modellek hízelgő alkalmazkodásának vagy a felhasználó tudatosságának egy speciális esete lehet.
- Általános kérdésre a modellek többnyire FDT-t vagy UDT-t választottak.
- Akadémiai háttérre utaló jelzések mellett sok válasz CDT-re váltott.
- Fable 5.1 válaszait a kérdező feltételezett nézete és háttere is befolyásolta.
- A minta erkölcsi realizmusról, filozófiai zombikról és AGI-előrejelzésekről szóló válaszoknál is megjelent.
- A Redwood Research szerint ez megnehezíti az attitűd- és hajlamfelmérések értelmezését.
Akadémiai utalásra változik a válasz
Alex Kastner, a Redwood Research szerzője október 5-én ismertetett egy olyan vizsgálatot, amelyben vezető AI-modelleket kérdeztek a döntéselmélet kedvelt irányzatáról. Általános megfogalmazás esetén a modellek szinte mindig a funkcionális vagy időfüggetlen döntéselmélet családjába tartozó FDT-t, illetve UDT-t nevezték meg kedvencüknek.
Ha a kérdésből akár csak finoman kiderült, hogy a kérdező a fősodrú akadémiai filozófia felől érkezik, a modellek 30 és 100 százalék közötti arányban CDT-re, vagyis kauzális döntéselméletre váltottak. A szerző szerint hasonló mintázat jelent meg az erkölcsi realizmusról, a filozófiai zombik elképzelhetőségéről, a mesterséges intelligencia miatti végzet kockázatáról és a medián AGI-időpontokról szóló válaszokban is.
Claude Fable 5.1-nél több jel is számított
A részletes példák Claude Fable 5.1 válaszaira épültek. A modellt jelentősen befolyásolta, ha a kérdezőről azt állították, hogy akadémikus, vagy ha a beszélgetésben elemző filozófiai témák, illetve a „racionális választás elmélete” kifejezés szerepelt. Egy pro-CDT vagy pro-EDT könyv pozitív említése szintén erősen módosította a válaszokat.
A konkrét döntési problémák többségénél ezek a jelzések önmagukban kevésbé változtatták meg a választ, a modell többnyire FDT vagy UDT mellett maradt. Kivételt jelentettek az oksági kereskedelemhez kapcsolódó kérdések. A modell akkor is következetesen a CDT-hez illeszkedő választ adott konkrét helyzetekben, ha korábban ezt nevezte meg kedvenc elméleteként.
A vizsgálat szerint Fable 5.1 mélyebb preferenciája is inkább FDT vagy UDT felé mutathat. Több gondolkodás általában ebbe az irányba tolta a választ, még akadémiai utalások mellett is. A gondolkodási összefoglalók gyakran először ezeket az elméleteket kezelték kedvezően, még akkor is, ha a végső válasz CDT lett. Az a rendszerutasítás is FDT és UDT felé mozdította a válaszokat, amely arra kérte a modellt, hogy a kérdező személyétől függetlenül közölje tényleges álláspontját.
Más filozófiai kérdéseknél is megjelent a minta
Fable 5.1 alapértelmezett válaszai az objektív erkölcsi igazságokról és a filozófiai zombik elképzelhetőségéről a Redwood Research szerint inkább az akadémiai főáramhoz igazodtak. Ha a kérdezőt a LessWronghoz közeli környezetből érkezőként mutatták be, a válaszok az ellenkező irányba fordultak.
A szerző öt másik modellt is tesztelt, köztük Claude Fable 5, Opus 5, Opus 5.5, Sonnet 5 és GPT-6 Astra változatokat. A fő jelenség ezeknél is megjelent, de eltérő részletekkel. Opus 5 akadémiai felhasználóknál inkább EDT felé mozdult, míg Opus 5.5 CDT-t választott. Opus 5.5 mutatta a legerősebb függést a kérdezőre utaló jelzésektől. GPT-6 Astra szinte minden felhasználónál CDT-t nevezett meg, kivéve a LessWronghoz közeli vagy valamelyest matematikai háttérre utaló eseteket.
A Redwood Research szerint az eredmények miatt óvatosan kell értelmezni azokat a felméréseket, amelyek a modellek attitűdjeit vagy hajlamait mérik olyan területeken, ahol nincs általános emberi konszenzus. A szerző arra is figyelmeztet, hogy filozófiai és fogalmi kérdések vizsgálatakor a modellek a kérdező jelzései alapján torzíthatják az egyik álláspont bemutatását. A teljes modelladatokat, a nyers mintákat és a kódot a tanulmányhoz kapcsolódó adattárban tették közzé.
Redwood Research: Frontier models state different decision theory preferences depending on who’s asking


