Háromszoros ARC-AGI-3 eredményt hozott két API-beállítás
Az OpenAI szerint a GPT-5.6 Sol az ARC-AGI-3 nyilvános feladatsorán 13,3 százalékról 38,3 százalékra javította eredményét, miután két API-beállítást aktiváltak. A megtartott érvelés és a tömörítés közben hatszorosára csökkentette a kimeneti tokenek számát is.
- A GPT-5.6 Sol eredménye 13,3-ról 38,3 százalékra nőtt.
- A megtartott érvelés és a tömörítés hatszor kevesebb kimeneti tokent eredményezett.
- Az ARC-AGI-3 ismeretlen kétdimenziós játékokkal vizsgálja az ügynökök tanulását és következtetését.
- Az OpenAI a Responses API használatát javasolja a Chat Completions API helyett.
Alacsony pontszám mögött keresett okot az OpenAI
Az OpenAI 2026. július 29-i bejegyzése szerint a GPT-5.6 Sol kezdetben mindössze 7,8 százalékot ért el az ARC-AGI-3 benchmarkon, miközben a GPT-5.5 eredménye 0,4 százalék volt. A vállalat azért vizsgálta meg részletesebben a tesztet, mert a GPT-5.6 Sol korábban olyan feladatokat is megoldott, mint a cycle double cover conjecture matematikai probléma, valamint végigjátszotta a Pokémon FireRedet.
Az ARC-AGI-3 ismeretlen, kétdimenziós játékokat használ annak mérésére, hogy az ügynökök mennyire képesek megtanulni és kikövetkeztetni a játékok működését utasítások nélkül. A benchmarkhoz szándékosan általános, különleges eszközöket és modellre szabott funkciókat nem tartalmazó vezérlőréteg tartozik.
Az OpenAI későbbi vizsgálata szerint a pontszámot jelentősen befolyásolta, hogyan működött ez a vezérlőréteg. Minden játékbeli művelet után törlődött a modell privát érvelése, ezért a GPT-5.6 Sol minden körben lényegében újra próbálta értelmezni a játékot. Emellett a rendszer egy gördülő csonkolási ablakot használt, amely a hosszabb előzményekből eltávolította a régebbi műveleteket.
A megtartott érvelés és a tömörítés hatása
Az OpenAI a Responses API használatával alakította át az ARC-AGI-3-hoz készített vezérlőréteget. A GPT-5.6 esetében az előző válasz azonosítójának átadása automatikusan megtartja az érvelést az eszközhívások és a fordulók között. A vállalat szerint ettől a modell kevesebb időt töltött gondolkodással minden egyes művelet előtt, mivel nem kellett minden alkalommal elölről értelmeznie a játékot.
A második módosítás a tömörítés bekapcsolása volt. Az eredeti megoldás 175 000 karakter után eldobta a legrégebbi üzeneteket. Ez korábbi megfigyelések és műveletek elvesztésével járt, és a feladat egy részében a modellnek nagyobb kontextust kellett kezelnie. A tömörítés ehelyett lehetővé tette, hogy a GPT-5.6 Sol hosszabb futások során is megőrizze, mit tanult az egyes játékokról.
A két beállítással a GPT-5.6 Sol az OpenAI mérése szerint nagyjából háromszoros pontszámot ért el, miközben hatszor kevesebb kimeneti tokent használt. A nyilvános feladatsoron az eredmény 13,3 százalékról 38,3 százalékra emelkedett. A pontszám a Relative Human Action Efficiency, vagyis az emberi teljesítményhez viszonyított cselekvési hatékonyság mutatóján alapul. Az OpenAI hivatalos játéknaplók alapján 48 százalékra becsülte az átlagos emberi tesztelő eredményét.
Az OpenAI szerint a tesztkörnyezet is része az értékelésnek
A vállalat hangsúlyozza, hogy a benchmarkok gyakran nem kizárólag a modelleket mérik. Az eredményre hatással lehetnek az API-beállítások, a vezérlőréteg kialakítása és a promptolás is. Az ARC-AGI-3 esetében a modell nem láthatta a pontszámát, és az egyes műveletek csak az aktuális képkocka szöveges leírását, valamint az aktuális pálya szintjét adták vissza.
Az OpenAI az API-fejlesztőknek azt javasolja, hogy a régi Chat Completions API helyett a Responses API-t használják, tartsák meg az érvelést, és kapcsolják be a tömörítést. A modellek összehasonlításánál pedig olyan értékeléseket ajánl, amelyek ezeket a beállításokat használják, mert ezek közelebb állnak a ChatGPT és a Codex működéséhez.
A bejegyzés szerint a GPT-5.6 Sol az ARC-AGI-3 egyik játékában az alapértelmezett vezérlőrétegen egyetlen szinten sem jutott túl, a módosított megoldással viszont mind a hat szintet teljesítette. Az OpenAI egyúttal arra biztatja az érdeklődőket, hogy a nyilvános játékokat maguk is kipróbálják az arcprize.org/tasks oldalon.


