Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A DeepSeek V4 Flash 12 centből ért el IMO-aranyszintet

2026. augusztus 26. 22:44Forrás: Cline
A DeepSeek V4 Flash 12 centből ért el IMO-aranyszintet
Kép: Cline

A DeepSeek V4 Flash 30 pontot szerzett az IMO 2026 hat feladatán, ezzel átlépte a 29 pontos aranyéremhatárt. A Cline mérése szerint a legjobb futtatás költsége 0,1215 dollár, vagyis 12 cent volt.

A lényeg röviden
  • A DeepSeek V4 Flash 30/42 ponttal átlépte a 29 pontos IMO-aranyéremhatárt.
  • A legjobb futtatás költsége 0,1215 dollár, vagyis 12 cent volt.
  • A GPT-5.6 Sol 42/42 ponttal tökéletes eredményt ért el.
  • A bizonyításokat két, modellvak bíráló értékelte, a vitákat a Gemini 3.1 Pro rendezte.
  • A Cline szerint a DeepSeek V4 Flash közvetlenül, olimpiai feladatokra szabott utótréning nélkül érte el az eredményt.

Nyolc modell, hat feladat

A Cline 2026. augusztus 26-án közzétett tesztjében nyolc modellt indított az IMO 2026 feladatain. A vizsgálat összesen 48 eredménycellát jelentett, minden modell ugyanazt a hat problémát kapta, és egyetlen utasítással kellett beadnia a lehető legerősebb, teljes megoldását.

A vizsgált modellek között szerepelt a GPT-5.6 Sol, a Claude Fable 5, a Kimi K3, a DeepSeek V4 Flash, a Qwen 3.6 35B A3B, a DeepSeek V4 Pro, a GLM 5.2 és a MiMo V2.5 Pro. A Cline szerint a kezdeti, szimmetrikus tesztpanelben hibákat találtak a futtatási keretrendszerben, ezért javították az eszközhívással kapcsolatos problémákat. Így a levont pontoknak a modell teljesítményét kellett tükrözniük, nem a futtatási hibákat.

A DeepSeek eredménye és a költségek

A DeepSeek V4 Flash 30/42 pontot ért el, részpontszámai a hat feladaton rendre 7, 4, 3, 7, 7 és 2 voltak. Ez meghaladta az idei, 29 pontos aranyéremhatárt. A modell futtatása a legjobb próbálkozás alapján 0,1215 dollárba került.

Összehasonlításként a GPT-5.6 Sol 42/42 ponttal tökéletes eredményt ért el 3,2336 dolláros költség mellett. A Claude Fable 5 41/42 pontot szerzett 17,1956 dollárból, a Kimi K3 pedig 35/42 pontot 5,1328 dollárból. A DeepSeek V4 Pro és a MiMo V2.5 Pro egyaránt 30/42 pontot ért el, költségük 0,4761, illetve 1,0650 dollár volt. A GLM 5.2 21/42, a Qwen 3.6 35B A3B pedig 16/42 ponton végzett. Az IMO 2026 emberi mediánja szintén 16/42 volt.

A Cline hangsúlyozza, hogy a táblázatban szereplő árak modellenként az egyetlen legjobb futtatás költségét mutatják, nem az eszközhibák feltárására és a kísérletezésre fordított teljes összeget. A DeepSeek V4 Flash eredménye nagyjából 140-szer olcsóbb volt a Claude Fable 5 futtatásánál.

Vak bírálat, korlátok és az open-weight modellek szerepe

A bizonyításokat névtelenül, az IMO 0-tól 7-ig terjedő skáláján pontozták. Két, a modellek kilétét nem ismerő bíráló, a GPT-5.5 és a Claude Opus 5 értékelte a beadásokat, a nézeteltéréseket pedig a Gemini 3.1 Pro oldotta fel. A bírálók látták a feladatot, a bizonyítást, az értékelési szempontokat és az összehasonlító referenciát, köztük Lean-megoldásokat, de nem tudták, melyik modell munkáját vizsgálják.

A Cline internet-hozzáférés nélkül futtatta a rendszereket, és csak a megoldás beadására szolgáló eszközt tette elérhetővé. A szerzők szerint az IMO 2026 feladatai még nem szerepelhettek a modellek tanítóanyagában. Ugyanakkor figyelmeztetnek, hogy a matematikai olimpiai feladatokból nem lehet stabil populációs becslést készíteni. A prompt kisebb módosításai, az újrapróbálkozások és a szolgáltatói problémák is változtathatják a pontszámokat. Minden modellnél több próbálkozást futtattak, és feladatonként a legjobb eredményt választották.

A bejegyzés szerint a DeepSeek V4 Flash nincs kifejezetten olimpiai feladatokra utótréningezve, a végpontját közvetlenül használták. A modell összesen 284 milliárd, szakértőkeverékes rendszerben elhelyezett paraméterrel rendelkezik, tokenenként körülbelül 13 milliárd aktiválódik. A Cline ezt az open-weight modellek teljesítményének jelentős javulásaként értékeli, és azt állítja, hogy a DeepSeek V4 Flash egyelőre az egyetlen olyan modell, amely kisebb helyi GPU-beállításokon is képes IMO-aranyszintet elérni. A teljes megoldási nyomokat, köztük az árakat és a generálási költségeket, a Cline közzétette.

Kapcsolódó hírek

Kimi K3: Claude-klón vagy önálló fejlesztés?
Modellek2026. október 2. 16:12

Kimi K3: Claude-klón vagy önálló fejlesztés?

A Moonshot AI Kimi K3 modellje 2,8 billió paraméterével az első nyílt súlyú modell ezen a méreten. A megjelenés után felmerült, hogy a fejlesztés Anthropic-modellből…

Az agent harnesses nem tűnnek el, de gyorsabban kell fejlődniük
Kutatás2026. szeptember 29. 18:08

Az agent harnesses nem tűnnek el, de gyorsabban kell fejlődniük

Egy új kutatás szerint az agent harnesses, vagyis az ügynöki rendszereket eszközökkel, szabályokkal és memóriával támogató rétegek bizonyos részei betaníthatók magába a…

A modellek átvehetik az ügynöki keretek egy részét
Kutatás2026. szeptember 29. 18:08

A modellek átvehetik az ügynöki keretek egy részét

Egy új kutatás szerint az ügynöki keretek, vagyis a modelleket eszközökkel és szabályokkal segítő rendszerek egyes részei közvetlenül betaníthatók a modellbe. A keretek…