Megérkezett a GPT-5.6, három modellel és új ultra móddal
Az OpenAI általánosan elérhetővé tette a GPT-5.6 modellcsaládot, amelynek tagjai eltérő teljesítményre és költséghatékonyságra készültek. A csomag része a csúcskategóriás Sol, a kiegyensúlyozott Terra és a költségtakarékos Luna, valamint az egyszerre több ügynököt koordináló ultra beállítás.
- Az OpenAI általánosan elérhetővé tette a GPT-5.6 családot.
- A Sol, Terra és Luna eltérő teljesítmény- és költségszintet kínál.
- Az ultra beállítás alapértelmezésben négy ügynököt koordinál párhuzamosan.
- A GPT-5.6 Sol 80 pontos eredményt ért el a Coding Agent Indexen.
- Az OpenAI csökkentette a Sol, Terra és Luna árazását.
Három modell, többféle felhasználás
Az OpenAI közlése szerint a GPT-5.6 Sol a család zászlóshajója, amely kódolásban, tudásalapú munkában, kiberbiztonságban és tudományos feladatokban is élvonalbeli eredményeket ér el. A vállalat szerint a modell kevesebb token felhasználásával és alacsonyabb becsült költség mellett múlja felül korábbi és versenytárs modelleket.
A Terra a mindennapi munkára szánt kiegyensúlyozott modell, míg a Luna a legköltséghatékonyabb változat. Az OpenAI szerint mindkét kisebb modell felülmúlja a Claude Fable 5-öt az Agents’ Last Exam értékelésén, nagyjából annak egytizenhatodnyi becsült költsége mellett.
Az Agents’ Last Exam 55 terület hosszú, professzionális munkafolyamatait vizsgálja. A GPT-5.6 Sol 53,6 pontos eredményt ért el, ami 13,1 ponttal magasabb a Claude Fable 5 adaptív gondolkodási eredményénél. Közepes gondolkodási beállításon a Sol 11,4 ponttal előzi meg a Fable 5-öt, hozzávetőleg az egynegyedére becsült költséggel.
Párhuzamos ügynökök és programozható eszközhasználat
A GPT-5.6 új, ultra nevű képességszintje a legösszetettebb feladatokra készült. Alapértelmezésben négy ügynököt koordinál párhuzamos munkafolyamatokban, így a modell több irányban dolgozhat egyszerre. Az OpenAI a BrowseComp, a SEC-Bench Pro és a Terminal-Bench 2.1 tesztjein azt vizsgálta, hogyan változik az eredmény és a késleltetés a párhuzamos ügynökök számának növelésével.
A max beállítás az xhigh szintnél is több időt biztosít a gondolkodásra, az alternatívák feltárására, az ellenőrzésre és a válasz javítására. A fejlesztők a Responses API többügynökös bétájával ultra jellegű megoldásokat építhetnek.
A modell könnyű programokat is írhat és futtathat, amelyek eszközöket hangolnak össze, feldolgozzák a köztes eredményeket, figyelik a folyamatot és kiválasztják a következő lépést. A Responses API Programmatic Tool Calling funkciója nagy mennyiségű köztes adatból kiszűrheti a lényeges információkat, majd a munkafolyamat közben módosíthatja a következő műveleteket.
Erősebb kódolás, tudásmunka és vizuális szerkesztés
Az OpenAI szerint a GPT-5.6 Sol a vállalat eddigi legerősebb kódolási modellje. Az Artificial Analysis Coding Agent Indexen, maximális gondolkodási beállítással, 80 pontos eredményt ért el, 2,8 ponttal megelőzve a Fable 5-öt. Ehhez kevesebb mint feleannyi kimeneti tokent és időt használt, költsége pedig körülbelül egyharmaddal volt alacsonyabb.
A modell új csúcsot állított fel a Terminal-Bench 2.1 és a DeepSWE teszteken is. A tudásalapú munkában a GPT-5.6 Sol 92,2 százalékot ért el a BrowseComp, és 62,6 százalékot az OSWorld 2.0 értékelésén. Az OSWorld 2.0 teszten az OpenAI szerint 85 százalékkal kevesebb kimeneti tokennel előzte meg az Opus 4.8-at.
A GPT-5.6 a prezentációk, dokumentumok és táblázatok készítését is javítja. A rendszer szerkeszthető prezentációkat hozhat létre, és a referenciafájlokból felismerheti a tipográfiát, az elrendezést, a térközöket, a színeket, valamint a Slide Masterbe ágyazott szabályokat. A vállalat szerint a modell a megjelenített eredményt is képes megvizsgálni és finomítani, így a kód létrehozása mellett vizuális és funkcionális hibákat is kereshet.
Kiberbiztonsági képességek és hozzáférés
Az OpenAI a GPT-5.6-ot eddigi legerősebb kiberbiztonsági modelljeként mutatja be. Az ExploitBench teszten 73,5 százalékos eredményt ért el, szemben a GPT-5.5 47,9 százalékával összehasonlítható kimenetitoken-keret mellett. Az ExploitGym kétórás korlátjánál a pass rate 15,1 százalékról 24,9 százalékra nőtt, hatórás korlátnál pedig 33,7 százalékot ért el. A SEC-Bench Pro teszten 71,2 százalékos eredményt hozott a GPT-5.5 45,8 százalékával szemben.
A modell védekező feladatokat is támogat, köztük a biztonságos kódellenőrzést, a javítást, a fenyegetésmodellezést és a blue teaminget. Az OpenAI közlése szerint a GPT-5.6 a vállalat eddigi legátfogóbb biztonsági értékelési időszaka után vált általánosan elérhetővé. A védelem modellbe tanított korlátozásokat, valós idejű ellenőrzéseket, megfigyelést és a bizalomhoz, illetve kockázathoz igazított hozzáférést kombinál.
Az OpenAI július 30-án 80 százalékkal csökkentette a GPT-5.6 Luna, 20 százalékkal pedig a GPT-5.6 Terra árát. Augusztus 21-én a GPT-5.6 Sol API- és kreditalapú árazását is több mint 20 százalékkal mérsékelte, három hónapra.

