A DeepSeek olcsóbban hoz jobb eredményt a GPT-5.6 Lunánál, ha együtt használják

A GPT-5.6 Luna minden vizsgált minőségi mutatóban megelőzte a DeepSeek-V4 Flash 0731 modellt, az olcsóbb modellre épülő kétlépcsős rendszer mégis pontosabb és olcsóbb lett a Lunánál önmagában. A Together AI 113, nyílt forráskódú tárolókból származó programozási feladaton hasonlította össze a modelleket.
- A GPT-5.6 Luna pass@1 eredménye 67,2, a DeepSeek-V4 Flashé 53,3 százalék.
- A DeepSeek futtatása 0,10 dollárba, a Lunáé 0,61 dollárba került.
- A DeepSeek első, a Luna második lépcsőként 78,9 százalékos megoldási arányt ért el.
- A kétlépcsős rendszer feladatonként 0,385 dollárba került.
- A DeepSeek a lekérdezési és konfigurációs feladatokban előzte meg a Lunát.
A Luna pontosabb, a DeepSeek jóval olcsóbb
A Together AI augusztus 6-án közölt elemzése szerint a GPT-5.6 Luna pass@1 értéke 67,2 százalék volt a DeepSWE tesztben, míg a DeepSeek-V4 Flash 0731 modellé 53,3 százalék. Ez 14 százalékpontos különbség. Két próbálkozásnál 81,6 és 70,1 százalékos, négy próbálkozásnál pedig 90,3 és 80,5 százalékos eredményt mértek, így a Luna minden azonos próbálkozásszám mellett vezetett.
Az árkülönbség ennél jóval nagyobb. Egy futtatás a DeepSeek esetében 0,10 dollárba, a Lunánál 0,61 dollárba került. A tesztben ez 100 dolláronként 532, illetve 110 megoldást jelentett. A DeepSeek ugyanakkor lassabb volt: a medián futási idő 23 percet és 148 lépést tett ki, szemben a Luna 16 percével és 92 lépésével.
Eltérő erősségek a programozási feladatokban
A 113 feladat négy próbálkozással futott le modellenként, a kiértékelést rejtett tesztkészlet végezte. A Luna a nyolc vizsgált feladattípusból hétben győzött. Különösen nagy volt az előnye a programelemzésben, a konkurenciával és tartóssággal kapcsolatos munkákban, valamint a nyelvek és futtatókörnyezetek belső működését érintő feladatokban.
A DeepSeek egyetlen területen előzte meg a Lunát, a lekérdezési és konfigurációs nyelveknél, ahol 78 és 70 százalékos eredményt értek el. A programozási nyelvek közül a Luna mind az öt vizsgált nyelven jobb volt. A DeepSeek Rustban 55, Go nyelven 62 százalékot ért el, JavaScriptben viszont 35, Pythonban pedig 49 százalékot. A Luna ugyanezeken a területeken 60, 79, 60 és 65 százalékos eredményt produkált.
A hibák jellege is eltért. A DeepSeek sikertelen próbálkozásainak 9 százalékában törte el a tároló korábban működő tesztjeit, a Lunánál ez az arány 15 százalék volt. Mindkét modellnél a sikertelen megoldások többsége közeli találatnak számított.
A kétlépcsős rendszer mindkét modellt önmagában felülmúlta
A Together AI a DeepSeek-V4 Flash modellt első lépcsőként, a GPT-5.6 Lunát pedig csak az elbukott feladatoknál használva 78,9 százalékos megoldási arányt mért. Egy feladat átlagos költsége így 0,385 dollár lett. Ez 11,7 százalékponttal jobb eredmény a Luna önálló 67,2 százalékánál, miközben az ár a 0,61 dolláros költség körülbelül 63 százaléka.
A módszer lényege, hogy a DeepSeek nagyjából a feladatok felét egy tized dollárért megoldja, a drágább modell pedig csak a teszteken elbukó válaszokhoz készít új próbálkozást. A Together AI szerint ez a felállás egy ideális, egyetlen modellválasztást végző útválasztónál is jobb eredményt hozott. A két modell együtt 113 feladatból 106-ot oldott meg legalább egyszer, a fennmaradó hét feladathoz a cég szerint egy harmadik, erősebb modellre lenne szükség.
Mit jelent ez a felhasználóknak?
A mérés alapján a GPT-5.6 Luna a minőségre törekvő fejlesztési feladatok könnyebb alapértelmezett választása, míg a DeepSeek-V4 Flash 0731 fő előnye az ára és a lekérdezési, illetve konfigurációs munkákban mutatott teljesítménye. A DeepSeek nyílt súlyokkal érhető el a Together AI platformján, így a cég szerint olcsó első lépcsőként, nagyobb léptékű használatban is bevethető.


