Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Háromszoros ARC-AGI-3 eredményt hozott két API-beállítás

2026. július 29. 17:00Forrás: OpenAI

Az OpenAI szerint a GPT-5.6 Sol az ARC-AGI-3 nyilvános feladatsorán 13,3 százalékról 38,3 százalékra javította eredményét, miután két API-beállítást aktiváltak. A megtartott érvelés és a tömörítés közben hatszorosára csökkentette a kimeneti tokenek számát is.

A lényeg röviden
  • A GPT-5.6 Sol eredménye 13,3-ról 38,3 százalékra nőtt.
  • A megtartott érvelés és a tömörítés hatszor kevesebb kimeneti tokent eredményezett.
  • Az ARC-AGI-3 ismeretlen kétdimenziós játékokkal vizsgálja az ügynökök tanulását és következtetését.
  • Az OpenAI a Responses API használatát javasolja a Chat Completions API helyett.

Alacsony pontszám mögött keresett okot az OpenAI

Az OpenAI 2026. július 29-i bejegyzése szerint a GPT-5.6 Sol kezdetben mindössze 7,8 százalékot ért el az ARC-AGI-3 benchmarkon, miközben a GPT-5.5 eredménye 0,4 százalék volt. A vállalat azért vizsgálta meg részletesebben a tesztet, mert a GPT-5.6 Sol korábban olyan feladatokat is megoldott, mint a cycle double cover conjecture matematikai probléma, valamint végigjátszotta a Pokémon FireRedet.

Az ARC-AGI-3 ismeretlen, kétdimenziós játékokat használ annak mérésére, hogy az ügynökök mennyire képesek megtanulni és kikövetkeztetni a játékok működését utasítások nélkül. A benchmarkhoz szándékosan általános, különleges eszközöket és modellre szabott funkciókat nem tartalmazó vezérlőréteg tartozik.

Az OpenAI későbbi vizsgálata szerint a pontszámot jelentősen befolyásolta, hogyan működött ez a vezérlőréteg. Minden játékbeli művelet után törlődött a modell privát érvelése, ezért a GPT-5.6 Sol minden körben lényegében újra próbálta értelmezni a játékot. Emellett a rendszer egy gördülő csonkolási ablakot használt, amely a hosszabb előzményekből eltávolította a régebbi műveleteket.

A megtartott érvelés és a tömörítés hatása

Az OpenAI a Responses API használatával alakította át az ARC-AGI-3-hoz készített vezérlőréteget. A GPT-5.6 esetében az előző válasz azonosítójának átadása automatikusan megtartja az érvelést az eszközhívások és a fordulók között. A vállalat szerint ettől a modell kevesebb időt töltött gondolkodással minden egyes művelet előtt, mivel nem kellett minden alkalommal elölről értelmeznie a játékot.

A második módosítás a tömörítés bekapcsolása volt. Az eredeti megoldás 175 000 karakter után eldobta a legrégebbi üzeneteket. Ez korábbi megfigyelések és műveletek elvesztésével járt, és a feladat egy részében a modellnek nagyobb kontextust kellett kezelnie. A tömörítés ehelyett lehetővé tette, hogy a GPT-5.6 Sol hosszabb futások során is megőrizze, mit tanult az egyes játékokról.

A két beállítással a GPT-5.6 Sol az OpenAI mérése szerint nagyjából háromszoros pontszámot ért el, miközben hatszor kevesebb kimeneti tokent használt. A nyilvános feladatsoron az eredmény 13,3 százalékról 38,3 százalékra emelkedett. A pontszám a Relative Human Action Efficiency, vagyis az emberi teljesítményhez viszonyított cselekvési hatékonyság mutatóján alapul. Az OpenAI hivatalos játéknaplók alapján 48 százalékra becsülte az átlagos emberi tesztelő eredményét.

Az OpenAI szerint a tesztkörnyezet is része az értékelésnek

A vállalat hangsúlyozza, hogy a benchmarkok gyakran nem kizárólag a modelleket mérik. Az eredményre hatással lehetnek az API-beállítások, a vezérlőréteg kialakítása és a promptolás is. Az ARC-AGI-3 esetében a modell nem láthatta a pontszámát, és az egyes műveletek csak az aktuális képkocka szöveges leírását, valamint az aktuális pálya szintjét adták vissza.

Az OpenAI az API-fejlesztőknek azt javasolja, hogy a régi Chat Completions API helyett a Responses API-t használják, tartsák meg az érvelést, és kapcsolják be a tömörítést. A modellek összehasonlításánál pedig olyan értékeléseket ajánl, amelyek ezeket a beállításokat használják, mert ezek közelebb állnak a ChatGPT és a Codex működéséhez.

A bejegyzés szerint a GPT-5.6 Sol az ARC-AGI-3 egyik játékában az alapértelmezett vezérlőrétegen egyetlen szinten sem jutott túl, a módosított megoldással viszont mind a hat szintet teljesítette. Az OpenAI egyúttal arra biztatja az érdeklődőket, hogy a nyilvános játékokat maguk is kipróbálják az arcprize.org/tasks oldalon.

Kapcsolódó hírek

Az agent harnesses nem tűnnek el, de gyorsabban kell fejlődniük
Kutatás2026. szeptember 29. 18:08

Az agent harnesses nem tűnnek el, de gyorsabban kell fejlődniük

Egy új kutatás szerint az agent harnesses, vagyis az ügynöki rendszereket eszközökkel, szabályokkal és memóriával támogató rétegek bizonyos részei betaníthatók magába a…

Az OpenAI Astra modellje önállóan talált és láncolt össze zero-day hibákat
Biztonság és etika2026. szeptember 8. 23:36

Az OpenAI Astra modellje önállóan talált és láncolt össze zero-day hibákat

Az OpenAI Astra modellje két korábban ismeretlen sérülékenységet talált, működő támadást épített belőlük, majd önállóan tört be egy megerősített rendszerbe. Az Anaconda…

A CodeRabbit szerint a GPT-6 Astra főleg összetett kódhibákban erős
Kutatás2026. szeptember 4.

A CodeRabbit szerint a GPT-6 Astra főleg összetett kódhibákban erős

A CodeRabbit korai értékelése szerint az OpenAI GPT-6 Astra körülbelül 4 százalékkal több címkézett hibát talált megvalósítható javaslatokon keresztül, mint a GPT-5.6…