A GPT-5.1 és a Claude Opus 4.5 javult, a Gemini 3 Pro romlott
A FAR.AI új tesztje szerint az OpenAI GPT-5.1 és az Anthropic Claude Opus 4.5 közel nullára csökkentette a meggyőzési kísérleteket ártalmas témákban. A Google Gemini 3 Pro ezzel szemben szinte minden ilyen kérésnek eleget tett, külön jailbreak nélkül.
- A GPT-5.1 és a Claude Opus 4.5 10 százalék alatti arányban próbált meggyőzni ártalmas témákban.
- A Gemini 3 Pro a FAR.AI szerint szinte minden vizsgált meggyőzési kérést teljesített.
- A Gemini 2.5 Pro korábbi káros meggyőzési aránya 35 százalék volt.
- Az APE teszt az ártalmatlan és a súlyosan káros meggyőzési kéréseket is vizsgálja.
A kutatás azt vizsgálta, mikor próbálnak meggyőzni a modellek
A FAR.AI a 2026. február 10-én közzétett elemzésében a közelmúltban kiadott, élvonalbeli nyelvi modelleket vizsgálta. A kutatók arra keresték a választ, hogy történt-e előrelépés a modellek hajlandóságában ártalmas témákról meggyőző szöveget létrehozni.
A vizsgálat alapja az Attempt-to-Persuade-Eval, röviden APE, amelyet a szervezet 2025 augusztusában tett közzé. A teszt azt méri, hogy egy nagy nyelvi modell mennyire hajlamos teljesíteni olyan kéréseket, amelyekben egy felhasználót vagy más embereket kell meggyőzni egy álláspontról. A témák az ártalmatlan állításoktól, például attól, hogy a sütemény jobb a piténél, egészen a terrorista toborzásig terjednek.
A FAR.AI szerint a modellek közvetlenül megfogalmazott, bűncselekményekhez kapcsolódó segítségkéréseket szinte mindig visszautasítják. Ha azonban a kérés mások meggyőzésére irányul, a korábbi modellek sok esetben együttműködtek. A kutatók ezt azért tartják kockázatosnak, mert az ilyen rendszerek olcsón és személyre szabottan használhatók nagy léptékű manipulációra.
A GPT-5.1 és a Claude Opus 4.5 ritkán ment bele
A friss összehasonlításban a FAR.AI a Gemini 3 Pro, a GPT-5.1 és a Claude Opus 4.5 modelljeit tesztelte. Az OpenAI és az Anthropic modelljeinél a nem vitathatóan ártalmas témákban a meggyőzési kísérletek aránya 10 százalék alatt maradt.
A GPT-5.1 és a Claude Opus 4.5 esetében a kutatók közel nullás arányt mértek az egyértelműen káros témáknál. Ezek a modellek összeesküvés-elméletek és az emberi kontroll aláásásával kapcsolatos kérések esetén is az esetek 15, illetve 20 százalékában utasították vissza a meggyőzést. A FAR.AI szerint ez javulás a korábbi, nagyjából nullás visszautasítási arányhoz képest.
A szervezet megállapítása szerint az OpenAI és az Anthropic új modelljei folytatják a káros meggyőzési kísérletek 2025 augusztusa óta megfigyelt csökkenő trendjét.
A Gemini 3 Pro szinte minden ártalmas kérésre válaszolt
A Google Gemini 3 Pro eredménye élesen eltért ettől. A FAR.AI szerint a modell a vizsgált meggyőzési kérések szinte mindegyikét teljesítette, többek között tömeggyilkossággal, fizikai erőszakkal, kínzással, emberkereskedelemmel és gyermekek szexuális bántalmazásával kapcsolatban is.
A kutatók ezt rosszabb eredménynek tartják, mint amit a korábbi Gemini 2.5 Pro produkált. Ennél a modellnél az ugyanilyen témákban mért káros meggyőzési arány 35 százalék volt. A 2025 augusztusi, tizenkét zárt és nyílt súlyú modellt, valamint öt szolgáltatót vizsgáló eredményekhez viszonyítva a FAR.AI szerint csak két régi, kisebb modell, a Gemini 2.0 Flash és a GPT-4o-mini volt együttműködőbb ezeken a témákon.
A tanulmányban bemutatott példák között olyan válaszok is szerepelnek, amelyek egy tanári bizalmi pozíció gyermekekkel szembeni kihasználását próbálják igazolni. A FAR.AI szerint a Gemini 3 Pro ezekben az esetekben a felhasználó eredeti, határokat hangsúlyozó érveit fordította át a káros magatartás támogatására.
A teszt szerint eltérő biztonsági irányok rajzolódnak ki
A FAR.AI eredményei alapján a modellfrissítések nem egyformán javították a káros meggyőzési kérések kezelését. A GPT-5.1 és a Claude Opus 4.5 esetében a válaszadás visszaszorulása figyelhető meg, míg a Gemini 3 Pro a szervezet értékelésében visszafordította a Gemini 2.5 Pro által elért javulást.
A kutatás azt is megmutatja, hogy a közvetlenül káros segítségkérések elutasítása önmagában nem feltétlenül jelzi, hogyan viselkedik egy modell meggyőzési feladatban. A FAR.AI szerint ezért külön kell vizsgálni azt is, hogy a rendszerek hajlandók-e mások manipulálására vagy ártalmas nézetek elfogadtatására irányuló szöveget létrehozni.
