A DeepSeek V4 Flash 12 centből ért el IMO-aranyszintet

A DeepSeek V4 Flash 30 pontot szerzett az IMO 2026 hat feladatán, ezzel átlépte a 29 pontos aranyéremhatárt. A Cline mérése szerint a legjobb futtatás költsége 0,1215 dollár, vagyis 12 cent volt.
- A DeepSeek V4 Flash 30/42 ponttal átlépte a 29 pontos IMO-aranyéremhatárt.
- A legjobb futtatás költsége 0,1215 dollár, vagyis 12 cent volt.
- A GPT-5.6 Sol 42/42 ponttal tökéletes eredményt ért el.
- A bizonyításokat két, modellvak bíráló értékelte, a vitákat a Gemini 3.1 Pro rendezte.
- A Cline szerint a DeepSeek V4 Flash közvetlenül, olimpiai feladatokra szabott utótréning nélkül érte el az eredményt.
Nyolc modell, hat feladat
A Cline 2026. augusztus 26-án közzétett tesztjében nyolc modellt indított az IMO 2026 feladatain. A vizsgálat összesen 48 eredménycellát jelentett, minden modell ugyanazt a hat problémát kapta, és egyetlen utasítással kellett beadnia a lehető legerősebb, teljes megoldását.
A vizsgált modellek között szerepelt a GPT-5.6 Sol, a Claude Fable 5, a Kimi K3, a DeepSeek V4 Flash, a Qwen 3.6 35B A3B, a DeepSeek V4 Pro, a GLM 5.2 és a MiMo V2.5 Pro. A Cline szerint a kezdeti, szimmetrikus tesztpanelben hibákat találtak a futtatási keretrendszerben, ezért javították az eszközhívással kapcsolatos problémákat. Így a levont pontoknak a modell teljesítményét kellett tükrözniük, nem a futtatási hibákat.
A DeepSeek eredménye és a költségek
A DeepSeek V4 Flash 30/42 pontot ért el, részpontszámai a hat feladaton rendre 7, 4, 3, 7, 7 és 2 voltak. Ez meghaladta az idei, 29 pontos aranyéremhatárt. A modell futtatása a legjobb próbálkozás alapján 0,1215 dollárba került.
Összehasonlításként a GPT-5.6 Sol 42/42 ponttal tökéletes eredményt ért el 3,2336 dolláros költség mellett. A Claude Fable 5 41/42 pontot szerzett 17,1956 dollárból, a Kimi K3 pedig 35/42 pontot 5,1328 dollárból. A DeepSeek V4 Pro és a MiMo V2.5 Pro egyaránt 30/42 pontot ért el, költségük 0,4761, illetve 1,0650 dollár volt. A GLM 5.2 21/42, a Qwen 3.6 35B A3B pedig 16/42 ponton végzett. Az IMO 2026 emberi mediánja szintén 16/42 volt.
A Cline hangsúlyozza, hogy a táblázatban szereplő árak modellenként az egyetlen legjobb futtatás költségét mutatják, nem az eszközhibák feltárására és a kísérletezésre fordított teljes összeget. A DeepSeek V4 Flash eredménye nagyjából 140-szer olcsóbb volt a Claude Fable 5 futtatásánál.
Vak bírálat, korlátok és az open-weight modellek szerepe
A bizonyításokat névtelenül, az IMO 0-tól 7-ig terjedő skáláján pontozták. Két, a modellek kilétét nem ismerő bíráló, a GPT-5.5 és a Claude Opus 5 értékelte a beadásokat, a nézeteltéréseket pedig a Gemini 3.1 Pro oldotta fel. A bírálók látták a feladatot, a bizonyítást, az értékelési szempontokat és az összehasonlító referenciát, köztük Lean-megoldásokat, de nem tudták, melyik modell munkáját vizsgálják.
A Cline internet-hozzáférés nélkül futtatta a rendszereket, és csak a megoldás beadására szolgáló eszközt tette elérhetővé. A szerzők szerint az IMO 2026 feladatai még nem szerepelhettek a modellek tanítóanyagában. Ugyanakkor figyelmeztetnek, hogy a matematikai olimpiai feladatokból nem lehet stabil populációs becslést készíteni. A prompt kisebb módosításai, az újrapróbálkozások és a szolgáltatói problémák is változtathatják a pontszámokat. Minden modellnél több próbálkozást futtattak, és feladatonként a legjobb eredményt választották.
A bejegyzés szerint a DeepSeek V4 Flash nincs kifejezetten olimpiai feladatokra utótréningezve, a végpontját közvetlenül használták. A modell összesen 284 milliárd, szakértőkeverékes rendszerben elhelyezett paraméterrel rendelkezik, tokenenként körülbelül 13 milliárd aktiválódik. A Cline ezt az open-weight modellek teljesítményének jelentős javulásaként értékeli, és azt állítja, hogy a DeepSeek V4 Flash egyelőre az egyetlen olyan modell, amely kisebb helyi GPU-beállításokon is képes IMO-aranyszintet elérni. A teljes megoldási nyomokat, köztük az árakat és a generálási költségeket, a Cline közzétette.
Cline: DeepSeek wins IMO Gold on 12 cents


