A DeepSeek V4 Pro olcsóbban és több próbálkozással felülmúlta a Fable 5-öt

A DeepSeek V4 Pro 0813 első próbálkozásra gyengébb volt a Claude Fable 5-nél a DeepSWE programozási tesztjein, több próbálkozással azonban megelőzte, miközben egy futtatás költsége 90-szer alacsonyabb maradt. A Together AI szerint a két modell egymást kiegészítő hibái miatt a leghatékonyabb megoldás a DeepSeekre épülő, szükség esetén Fable-re váltó modellútválasztás.
- A Claude Fable 5 pass@1 értéke 69,7, a DeepSeek V4 Pro 0813-é 62,8 százalék volt.
- Négy próbálkozás után a DeepSeek vezetett, 88,5 és 84,1 százalékos pass@4 eredménnyel.
- A DeepSeek futtatásonként 0,24, a Fable 21,63 dollárba került.
- A DeepSeekre épülő, Fable-lel kiegészített kaszkád 82,7 százalékot ért el 8,28 dolláros költséggel.
- A Fable fő előnye a Rust és a szerializálás, a két modell együttesen 107 feladatot fedett le 113-ból.
A Fable kezd jobban, a DeepSeek zár erősebben
A Together AI 2026. augusztus 17-én közölt összehasonlítása a DeepSWE mind a 113 feladatán vizsgálta a DeepSeek V4 Pro 0813 és a Claude Fable 5 teljesítményét. Mindkét modellt maximális beállítással futtatták, modellenként négy próbálkozással, összesen 904 futtatásban.
Egyetlen próbálkozásnál a Claude Fable 5 vezetett: a pass@1 eredménye 69,7 százalék volt, szemben a DeepSeek V4 Pro 0813 62,8 százalékával. A különbség két próbálkozásnál eltűnt, 78,5 és 77,1 százalékos eredménnyel, négy próbálkozásnál pedig a DeepSeek került előre. A pass@4 értéke 88,5 százalék volt a DeepSeeknél és 84,1 százalék a Fable-nél.
Kilencvenszeres árkülönbség
A tesztben egy DeepSeek-futtatás 0,24 dollárba került, míg a Claude Fable 5 futtatása 21,63 dollár volt. A Together AI számítása szerint 100 dollárból a DeepSeek 260, a Fable pedig 3 feladatot oldott meg.
A költségelőnyhöz nem társult jelentős sebességkülönbség. A DeepSeek medián futási ideje 35 perc, a Fable-é 31 perc volt. A DeepSeek több lépést hajtott végre, 146-ot a Fable 79 lépésével szemben, a Fable viszont lépésenként több kimeneti tokent írt ki: 115 ezret, szemben a DeepSeek 101 ezrével.
A hibák jellege is eltért. Mindkét modell a hibás esetek 11 százalékában rontotta el a meglévő tesztcsomagot. A DeepSeek hibái 66 százalékban közel voltak a helyes megoldáshoz, a Fable esetében ez az arány 57 százalék volt. Nagy eltérésnek számító hibát a DeepSeek 10, a Fable 18 százalékban vétett.
A Fable Rustban és szerializálásban erős
A Claude Fable 5 a Together AI bontása szerint a nyolc vizsgált feladattípusból hatban nyert. Különösen a data modeling és serialization kategóriában teljesített jól, 88 százalékos eredménnyel, valamint a nyelvi belső működést vizsgáló feladatokban, ahol 78 százalékot ért el.
A DeepSeek két területen végzett jobban: stateful reactivity feladatokban 66 és 64 százalékos, concurrency and durability feladatokban pedig 58 és 45 százalékos eredménnyel. Programozási nyelvek szerint a Fable ötből négyben vezetett. Rustban 85 százalékot ért el a DeepSeek 65 százalékával szemben, TypeScriptben viszont a DeepSeek nyert 61 és 57 százalékkal. Pythonban 70 és 60, Go-ban 71 és 67, JavaScriptben pedig 75 és 65 százalék volt az eredmény.
A kombinált használat adja a legjobb eredményt
A két modell feladatszintű eredményei kevéssé korreláltak, a mérésben 0,39-es értéket kaptak. Mindketten 88 feladatot oldottak meg, a DeepSeek önállóan 12, a Fable pedig 7 olyan feladatot oldott meg, amelyet a másik nem. Együttes lefedettségük 107 volt a 113 feladatból, vagyis 94,7 százalék.
A Together AI ezért azt javasolja, hogy a rendszer először a DeepSeek V4 Pro 0813-at futtassa, és csak akkor küldje tovább a feladatot a Claude Fable 5-höz, ha a tesztcsomag elutasítja az első megoldást. Ez a kaszkád 82,7 százalékos megoldási arányt ért el, feladatonként 8,28 dolláros költséggel. A Fable önálló használata 69,7 százalékot és 21,63 dollárt jelentett. A DeepSeek V4 Pro 0813 a Together AI oldalán jelenleg amerikai infrastruktúrán érhető el, 1,05 millió tokenes kontextussal, függvényhívással, JSON móddal és OpenAI-kompatibilis API-val.
Together AI: DeepSeek V4 Pro 0813 vs Claude Fable 5 on DeepSWE: Cost, Coding, and Routing


