Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A DeepSeek olcsóbban hoz jobb eredményt a GPT-5.6 Lunánál, ha együtt használják

2026. augusztus 6.Forrás: Together AI
A DeepSeek olcsóbban hoz jobb eredményt a GPT-5.6 Lunánál, ha együtt használják
Kép: Together AI

A GPT-5.6 Luna minden vizsgált minőségi mutatóban megelőzte a DeepSeek-V4 Flash 0731 modellt, az olcsóbb modellre épülő kétlépcsős rendszer mégis pontosabb és olcsóbb lett a Lunánál önmagában. A Together AI 113, nyílt forráskódú tárolókból származó programozási feladaton hasonlította össze a modelleket.

A lényeg röviden
  • A GPT-5.6 Luna pass@1 eredménye 67,2, a DeepSeek-V4 Flashé 53,3 százalék.
  • A DeepSeek futtatása 0,10 dollárba, a Lunáé 0,61 dollárba került.
  • A DeepSeek első, a Luna második lépcsőként 78,9 százalékos megoldási arányt ért el.
  • A kétlépcsős rendszer feladatonként 0,385 dollárba került.
  • A DeepSeek a lekérdezési és konfigurációs feladatokban előzte meg a Lunát.

A Luna pontosabb, a DeepSeek jóval olcsóbb

A Together AI augusztus 6-án közölt elemzése szerint a GPT-5.6 Luna pass@1 értéke 67,2 százalék volt a DeepSWE tesztben, míg a DeepSeek-V4 Flash 0731 modellé 53,3 százalék. Ez 14 százalékpontos különbség. Két próbálkozásnál 81,6 és 70,1 százalékos, négy próbálkozásnál pedig 90,3 és 80,5 százalékos eredményt mértek, így a Luna minden azonos próbálkozásszám mellett vezetett.

Az árkülönbség ennél jóval nagyobb. Egy futtatás a DeepSeek esetében 0,10 dollárba, a Lunánál 0,61 dollárba került. A tesztben ez 100 dolláronként 532, illetve 110 megoldást jelentett. A DeepSeek ugyanakkor lassabb volt: a medián futási idő 23 percet és 148 lépést tett ki, szemben a Luna 16 percével és 92 lépésével.

Eltérő erősségek a programozási feladatokban

A 113 feladat négy próbálkozással futott le modellenként, a kiértékelést rejtett tesztkészlet végezte. A Luna a nyolc vizsgált feladattípusból hétben győzött. Különösen nagy volt az előnye a programelemzésben, a konkurenciával és tartóssággal kapcsolatos munkákban, valamint a nyelvek és futtatókörnyezetek belső működését érintő feladatokban.

A DeepSeek egyetlen területen előzte meg a Lunát, a lekérdezési és konfigurációs nyelveknél, ahol 78 és 70 százalékos eredményt értek el. A programozási nyelvek közül a Luna mind az öt vizsgált nyelven jobb volt. A DeepSeek Rustban 55, Go nyelven 62 százalékot ért el, JavaScriptben viszont 35, Pythonban pedig 49 százalékot. A Luna ugyanezeken a területeken 60, 79, 60 és 65 százalékos eredményt produkált.

A hibák jellege is eltért. A DeepSeek sikertelen próbálkozásainak 9 százalékában törte el a tároló korábban működő tesztjeit, a Lunánál ez az arány 15 százalék volt. Mindkét modellnél a sikertelen megoldások többsége közeli találatnak számított.

A kétlépcsős rendszer mindkét modellt önmagában felülmúlta

A Together AI a DeepSeek-V4 Flash modellt első lépcsőként, a GPT-5.6 Lunát pedig csak az elbukott feladatoknál használva 78,9 százalékos megoldási arányt mért. Egy feladat átlagos költsége így 0,385 dollár lett. Ez 11,7 százalékponttal jobb eredmény a Luna önálló 67,2 százalékánál, miközben az ár a 0,61 dolláros költség körülbelül 63 százaléka.

A módszer lényege, hogy a DeepSeek nagyjából a feladatok felét egy tized dollárért megoldja, a drágább modell pedig csak a teszteken elbukó válaszokhoz készít új próbálkozást. A Together AI szerint ez a felállás egy ideális, egyetlen modellválasztást végző útválasztónál is jobb eredményt hozott. A két modell együtt 113 feladatból 106-ot oldott meg legalább egyszer, a fennmaradó hét feladathoz a cég szerint egy harmadik, erősebb modellre lenne szükség.

Mit jelent ez a felhasználóknak?

A mérés alapján a GPT-5.6 Luna a minőségre törekvő fejlesztési feladatok könnyebb alapértelmezett választása, míg a DeepSeek-V4 Flash 0731 fő előnye az ára és a lekérdezési, illetve konfigurációs munkákban mutatott teljesítménye. A DeepSeek nyílt súlyokkal érhető el a Together AI platformján, így a cég szerint olcsó első lépcsőként, nagyobb léptékű használatban is bevethető.

Kapcsolódó hírek

A Replit Agent maga dönti el, mikor és melyik modellt használja
Fejlesztőknek2026. szeptember 29. 18:00

A Replit Agent maga dönti el, mikor és melyik modellt használja

A Replit Agent új megközelítése nagyobb döntési szabadságot ad a fő modellnek: maga határozza meg, mennyire gondolkodjon, mikor adjon át egy feladatot, és melyik…

A Replit Agent maga dönti el, mikor és melyik modellt használja
Fejlesztőknek2026. szeptember 29. 18:00

A Replit Agent maga dönti el, mikor és melyik modellt használja

A Replit Agent új vezérlési rendszere a fő modellre bízza, mennyire gondolja végig a feladatot, mikor delegál részfeladatot, és melyik almodellt választja hozzá. A…

Döntési modelleket támogat az Ollama, három modell már elérhető
Termékek és eszközök2026. szeptember 29.

Döntési modelleket támogat az Ollama, három modell már elérhető

Az Ollama 0.35-ös verziójától Jev API-alapú döntési modellek futtathatók helyben, az új /v1/systemone végponton keresztül. A vállalat szerint a megoldás gyors döntéseket…