A drágábbnak tűnő AI-modell olcsóbb lehet a kódolási feladatokban

A tokenenként olcsóbb AI-modell egy kódolási feladat teljesítését végül jóval drágábbá teheti, derül ki a Fiddler AI több mint 600 ügynökfutást vizsgáló elemzéséből. A kutatás szerint a válaszok hossza, a tesztek felépítése és a nem látható hibák is jelentősen befolyásolják a tényleges költséget.
- A Fiddler AI 678 ügynökfutást vizsgált négy modellen.
- A Haiku 4.5 tokenára alacsonyabb volt, mégis többe került az ellenőrzött sikeres feladat.
- A hosszú válaszok a későbbi körök bemeneti költségét is növelték.
- A látható tesztek túlbecsülhetik a kódolómodellek teljesítményét.
- A költséget és a sikert a teljes ügynökfutás alapján kell mérni.
Az alacsonyabb tokenár nem jelentett alacsonyabb végső költséget
A Fiddler AI 2026. szeptember 11-én közzétett elemzésében először a Claude Haiku 4.5 és a Claude Sonnet 5 teljesítményét hasonlította össze öt Python-hibakeresési feladaton. Mindkét modellt ugyanaz a kódolóügynök-hurok vezérelte, és minden feladatra három próbálkozást, összesen három ismétlést futtattak.
A vizsgálat első szakasza 90 futást eredményezett. A Sonnet ezekben összesen 0,45 dollárba, a Haiku 4,00 dollárba került. A Fiddler szerint a Haiku bemeneti és kimeneti tokenára a Sonnet árának fele volt, mégis jelentősen többe került egy ellenőrzött sikeres feladat.
A Haiku 1,74-szer több lépést használt, de a költségkülönbség elsősorban nem ebből adódott. Egy próbálkozás költsége a sikeresség figyelembevétele előtt is 8,9-szer magasabb volt. A Sonnet válaszainak mediánja 16 kimeneti token, a Haikué 361 token volt. A 90. percentilisnél ez 276, illetve 2980 tokenre, a leghosszabb válaszoknál pedig 541, illetve 22 721 tokenre nőtt.
Egy hosszú válasz a következő körök árát is növeli
A kódolóügynök egy lépésben egyetlen parancsot adhatott ki, például fájlok vizsgálatára, kódmódosításra vagy tesztfuttatásra. A végrehajtás után a rendszer visszaadta az eredményt, amely bekerült a következő kör beszélgetési előzményeibe. Emiatt egy hosszú modellválasz nemcsak a kimeneti tokenek miatt drága, hanem a későbbi bemeneti költséget is növeli.
A Fiddler mérése szerint a Haiku bemeneti kontextusa az első és a második lépés között 13,7-szeresére nőtt, majd kérésenként 9000 és 10 000 token között maradt. A Sonnet kontextusa fokozatosabban bővült, és az ötödik lépésre mintegy 1200 tokenes lett.
A tömör Haiku-futásokban egy lépés 0,00235 dollárba került, ami valamivel kevesebb volt a Sonnet 0,00244 dolláros értékénél. A hosszú válaszokat adó Haiku-futásoknál ugyanez az összeg 0,01693 dollárra nőtt, vagyis a tömör futások 7,2-szeresére.
A vizsgálat egyik szélsőséges válaszában a modell 21 492 tokenben 60 shellparancsot írt le, miközben a rendszer egy körben csak egy parancsot hajthatott végre. A Fiddler értelmezése szerint a modell 59 parancs eredményét előre kitalálta, majd egy olyan állapot alapján jelentette késznek a feladatot, amely valójában nem létezett. A futtatókörnyezet ebből csak az első érvényes parancsot hajtotta végre.
A tesztek látható eredménye félrevezető lehet
A Fiddler három külön értékelésben összesen 678 próbát futtatott négy modellen, két szolgáltatónál. Az első vizsgálat öt Python-feladattal a tokenár és az ellenőrzött siker költségét hasonlította össze. A második kilenc, saját készítésű feladaton azt vizsgálta, mennyire térnek el a látható és az elrejtett tesztek eredményei. A harmadik 40 HumanEval+ feladattal ellenőrizte, hogy a megfigyelések más feladatkészleten is fennállnak-e.
A futás csak akkor számított sikeresnek, ha a megoldás az elrejtett teszteken is átment. A vállalat szerint a látható tesztek túlbecsülhetik a modellek teljesítményét, mert olyan hibákat nem feltétlenül fednek fel, amelyeket a withheld, vagyis a modell elől elrejtett tesztek kimutatnak.
Az elemzés egyik tanulsága, hogy a modellek rangsora és hibamintázata a feladatkészlettől, valamint a siker mérésének módjától is függhet. A Fiddler szerint ugyanaz a kockázat éles környezetben is megjelenhet: egy ügynök átmehet a teszteken, majd a bevezetés után mégis hibázhat. A modellek összehasonlításához ezért a válaszokat, a ténylegesen végrehajtott műveleteket, a teszteredményeket és a teljes futási költséget együtt kell vizsgálni.
Fiddler AI: Why Cheaper Models Cost More to Complete Coding Tasks


