Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A DeepSeek V4 Pro olcsón előzi meg a GPT-5.6 Solt több próbálkozással

2026. augusztus 18.Forrás: Together AI
A DeepSeek V4 Pro olcsón előzi meg a GPT-5.6 Solt több próbálkozással
Kép: Together AI

A GPT-5.6 Sol pontosabb és gyorsabb egyetlen próbálkozásnál, a DeepSeek V4 Pro 0813 viszont 35-ször olcsóbb, és több újrapróbálkozással magasabb eredményt ér el a DeepSWE teszten. A Together AI szerint a két modell egymás után használva 83,0 százalékos megoldási arányt ad, feladatonként 3,35 dolláros költség mellett.

A lényeg röviden
  • A GPT-5.6 Sol pass@1 értéke 72,7 százalék, a DeepSeek V4 Pro 0813-é 62,8 százalék.
  • Négy próbálkozásnál a Pro 88,5 százalékos pass@4 eredménnyel megelőzte a Sol 85,8 százalékát.
  • A Pro futtatása 0,24 dollárba, a Solé 8,37 dollárba került.
  • A Pro, majd sikertelen teszt esetén Sol kaszkád 83,0 százalékos eredményt ért el 3,35 dolláros költséggel.
  • A Sol gyorsabb és megbízhatóbb első próbálkozásnál, de gyakrabban okozott regressziót a tesztekben.

A Sol vezet elsőre, a Pro négy próbálkozással fordít

A Together AI 2026. augusztus 18-án közzétett összehasonlítása a DeepSWE benchmark 113 feladatán vizsgálta a DeepSeek V4 Pro 0813 és a GPT-5.6 Sol teljesítményét. Mindkét modellt maximális beállításon futtatták, modellenként négy próbálkozással, összesen 904 futtatásban.

Egyetlen próbálkozásnál a GPT-5.6 Sol egyértelműen vezetett: pass@1 értéke 72,7 százalék volt, szemben a DeepSeek V4 Pro 0813 62,8 százalékával. Két próbálkozásnál az eredmény 81,0 és 78,5 százalékra szűkült, négy próbálkozásnál pedig a DeepSeek modell került előre. Pass@4 értéke 88,5 százalék lett, míg a Solé 85,8 százalék.

A Together AI adatai szerint a Pro szélesebb lefedettséget ér el, de egy-egy próbálkozás során kevésbé megbízható. Lefedettsége 88,5, megbízhatósága 71,0 százalék, miközben a Sol ezeknél 85,8, illetve 84,5 százalékot ért el. Négyből négy alkalommal a Sol 61 feladatot oldott meg, a Pro 35-öt.

A DeepSeek modell futtatása töredékébe kerül

A legnagyobb különbség a költségben látható. Egy futtatás a DeepSeek V4 Pro 0813 esetében 0,24 dollárba került, a GPT-5.6 Solnál viszont 8,37 dollárba. Ez körülbelül 35-szörös eltérés. A Together AI számítása szerint 100 dollárból a Pro 261, a Sol 9 feladatot oldott meg.

Az olcsóbb modell ugyanakkor lassabb és hosszabb kimeneteket készít. Egy futtatás mediánja 35 perc és 146 lépés volt, a kimenet pedig 101 ezer tokenből állt. A Sol 17 perc alatt, 53 lépéssel és 59 ezer kimeneti tokennel dolgozott. A forrás szerint ezért a Sol lehet kedvezőbb, ha az emberi felhasználó várakozási ideje fontos, míg a Pro költség- és kapacitásérzékeny munkafolyamatokban előnyösebb.

A hibák jellege is eltért. A Sol hibáinak 20 százalékában olyan tesztek is elromlottak, amelyek korábban sikeresek voltak. A DeepSeek Pro esetében ez az arány 11 százalék volt. A Together AI ezért a Sol kimenetére teljes regressziós ellenőrzést javasol, mielőtt a módosításokat elfogadnák.

A modellválasztás feladattól és programozási nyelvtől függ

A GPT-5.6 Sol a vizsgált nyolc feladatterületből hatban végzett az élen. Különösen erős volt az adatmodellezési és szerializációs feladatokban, ahol 92 százalékot ért el, valamint a lekérdezési és konfigurációs, a konkurens működést, a build- és üzemeltetési feladatokat, a programelemzést és a protokoll-megfelelést vizsgáló kategóriákban. A nyelvi és futásidejű belső működést mérő területen döntetlen született, az állapottartó reaktivitásban pedig a Pro vezetett 66 és 64 százalékra.

Programozási nyelvek szerint a Sol négy területen nyert: Pythonban 74, Go esetében 79, TypeScriptben 66, JavaScriptben pedig 75 százalékot ért el. Rustban a DeepSeek V4 Pro 0813 volt jobb, 65 és 60 százalékos eredménnyel.

A két modell 90 közös feladatot oldott meg, a Pro 10, a Sol 7 olyan feladatot teljesített, amelyet a másik nem. Együttes lefedettségük 107 volt a 113 feladatból, vagyis 94,7 százalék.

A Together AI szerint a kétlépcsős használat a legerősebb

A vizsgálat legfontosabb gyakorlati következtetése a modellek egymás utáni használata. A javasolt folyamatban a DeepSeek V4 Pro 0813 próbálkozik először, majd a tesztek elutasítása esetén a feladatot a GPT-5.6 Sol kapja meg. Ez a kaszkád 83,0 százalékos megoldási arányt ért el, feladatonként 3,35 dolláros költséggel.

Ez tíz százalékponttal jobb a Sol önálló 72,7 százalékos eredményénél, miközben a költség kevesebb mint fele a 8,37 dolláros értéknek. A forrás szerint a Pro első lépcsőként a feladatok nagy részét alacsony áron megoldja, a Sol díját pedig csak a nehezebb eseteknél kell kifizetni. A Together AI tesztje alapján a Pro az első modellként olcsóbb volt, mint a Sol elsőként történő használata, miközben a pontosság azonos maradt.

A DeepSeek V4 Pro 0813 a Together AI szerint már elérhető a szolgáltatásán, amerikai infrastruktúrán. A modell 1,05 millió tokenes kontextust, függvényhívást, JSON módot és OpenAI-kompatibilis API-t kínál.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A Replit Agent maga dönti el, mikor és melyik modellt használja
Fejlesztőknek2026. szeptember 29. 18:00

A Replit Agent maga dönti el, mikor és melyik modellt használja

A Replit Agent új megközelítése nagyobb döntési szabadságot ad a fő modellnek: maga határozza meg, mennyire gondolkodjon, mikor adjon át egy feladatot, és melyik…

A Replit Agent maga dönti el, mikor és melyik modellt használja
Fejlesztőknek2026. szeptember 29. 18:00

A Replit Agent maga dönti el, mikor és melyik modellt használja

A Replit Agent új vezérlési rendszere a fő modellre bízza, mennyire gondolja végig a feladatot, mikor delegál részfeladatot, és melyik almodellt választja hozzá. A…

A GPT-5.6 Sol vezeti a régi rendszerekre szabott tesztet
Kutatás2026. szeptember 24.

A GPT-5.6 Sol vezeti a régi rendszerekre szabott tesztet

A GPT-5.6 Sol érte el a legjobb eredményt a Factory Legacy-Bench nevű tesztjén, amely a COBOL, a Java 7, a BASIC, a C89, a Fortran és az Assembly kezelését vizsgálja. A…