Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A drágábbnak tűnő AI-modell olcsóbb lehet a kódolási feladatokban

2026. szeptember 11.Forrás: Fiddler AI
A drágábbnak tűnő AI-modell olcsóbb lehet a kódolási feladatokban
Kép: Fiddler AI

A tokenenként olcsóbb AI-modell egy kódolási feladat teljesítését végül jóval drágábbá teheti, derül ki a Fiddler AI több mint 600 ügynökfutást vizsgáló elemzéséből. A kutatás szerint a válaszok hossza, a tesztek felépítése és a nem látható hibák is jelentősen befolyásolják a tényleges költséget.

A lényeg röviden
  • A Fiddler AI 678 ügynökfutást vizsgált négy modellen.
  • A Haiku 4.5 tokenára alacsonyabb volt, mégis többe került az ellenőrzött sikeres feladat.
  • A hosszú válaszok a későbbi körök bemeneti költségét is növelték.
  • A látható tesztek túlbecsülhetik a kódolómodellek teljesítményét.
  • A költséget és a sikert a teljes ügynökfutás alapján kell mérni.

Az alacsonyabb tokenár nem jelentett alacsonyabb végső költséget

A Fiddler AI 2026. szeptember 11-én közzétett elemzésében először a Claude Haiku 4.5 és a Claude Sonnet 5 teljesítményét hasonlította össze öt Python-hibakeresési feladaton. Mindkét modellt ugyanaz a kódolóügynök-hurok vezérelte, és minden feladatra három próbálkozást, összesen három ismétlést futtattak.

A vizsgálat első szakasza 90 futást eredményezett. A Sonnet ezekben összesen 0,45 dollárba, a Haiku 4,00 dollárba került. A Fiddler szerint a Haiku bemeneti és kimeneti tokenára a Sonnet árának fele volt, mégis jelentősen többe került egy ellenőrzött sikeres feladat.

A Haiku 1,74-szer több lépést használt, de a költségkülönbség elsősorban nem ebből adódott. Egy próbálkozás költsége a sikeresség figyelembevétele előtt is 8,9-szer magasabb volt. A Sonnet válaszainak mediánja 16 kimeneti token, a Haikué 361 token volt. A 90. percentilisnél ez 276, illetve 2980 tokenre, a leghosszabb válaszoknál pedig 541, illetve 22 721 tokenre nőtt.

Egy hosszú válasz a következő körök árát is növeli

A kódolóügynök egy lépésben egyetlen parancsot adhatott ki, például fájlok vizsgálatára, kódmódosításra vagy tesztfuttatásra. A végrehajtás után a rendszer visszaadta az eredményt, amely bekerült a következő kör beszélgetési előzményeibe. Emiatt egy hosszú modellválasz nemcsak a kimeneti tokenek miatt drága, hanem a későbbi bemeneti költséget is növeli.

A Fiddler mérése szerint a Haiku bemeneti kontextusa az első és a második lépés között 13,7-szeresére nőtt, majd kérésenként 9000 és 10 000 token között maradt. A Sonnet kontextusa fokozatosabban bővült, és az ötödik lépésre mintegy 1200 tokenes lett.

A tömör Haiku-futásokban egy lépés 0,00235 dollárba került, ami valamivel kevesebb volt a Sonnet 0,00244 dolláros értékénél. A hosszú válaszokat adó Haiku-futásoknál ugyanez az összeg 0,01693 dollárra nőtt, vagyis a tömör futások 7,2-szeresére.

A vizsgálat egyik szélsőséges válaszában a modell 21 492 tokenben 60 shellparancsot írt le, miközben a rendszer egy körben csak egy parancsot hajthatott végre. A Fiddler értelmezése szerint a modell 59 parancs eredményét előre kitalálta, majd egy olyan állapot alapján jelentette késznek a feladatot, amely valójában nem létezett. A futtatókörnyezet ebből csak az első érvényes parancsot hajtotta végre.

A tesztek látható eredménye félrevezető lehet

A Fiddler három külön értékelésben összesen 678 próbát futtatott négy modellen, két szolgáltatónál. Az első vizsgálat öt Python-feladattal a tokenár és az ellenőrzött siker költségét hasonlította össze. A második kilenc, saját készítésű feladaton azt vizsgálta, mennyire térnek el a látható és az elrejtett tesztek eredményei. A harmadik 40 HumanEval+ feladattal ellenőrizte, hogy a megfigyelések más feladatkészleten is fennállnak-e.

A futás csak akkor számított sikeresnek, ha a megoldás az elrejtett teszteken is átment. A vállalat szerint a látható tesztek túlbecsülhetik a modellek teljesítményét, mert olyan hibákat nem feltétlenül fednek fel, amelyeket a withheld, vagyis a modell elől elrejtett tesztek kimutatnak.

Az elemzés egyik tanulsága, hogy a modellek rangsora és hibamintázata a feladatkészlettől, valamint a siker mérésének módjától is függhet. A Fiddler szerint ugyanaz a kockázat éles környezetben is megjelenhet: egy ügynök átmehet a teszteken, majd a bevezetés után mégis hibázhat. A modellek összehasonlításához ezért a válaszokat, a ténylegesen végrehajtott műveleteket, a teszteredményeket és a teljes futási költséget együtt kell vizsgálni.

Kapcsolódó hírek

Az Anthropic Claude-ja éles ügynökök nyomaiból épít teszteket
Fejlesztőknek2026. október 2.

Az Anthropic Claude-ja éles ügynökök nyomaiból épít teszteket

Az Anthropic Claude-ja két új paranccsal támogatja az AI-ügynökök tesztelését és fokozatos javítását. Az Arize AI szerint a módszer akkor válik igazán használhatóvá, ha…

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél
Kutatás2026. október 1.

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél

Az összetett, több ügynököt és külön keresőmodulokat használó gépi tanulási mérnöki rendszerek nem bizonyultak jobbnak egy egyszerű kódoló ügynöknél azonos időkeret és…

Az Apple kutatása szerint kevésbé számít az ügynökök körítése
Kutatás2026. október 1.

Az Apple kutatása szerint kevésbé számít az ügynökök körítése

Az Apple kutatói szerint a gépi tanulási feladatokra fejlesztett ügynököknél az alapul szolgáló nagy nyelvi modell teljesítménye fontosabb lehet az ügynök köré épített…