Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Cline nyílttá teszi az open-weight ügynökök értékelési adatait

2026. augusztus 18. 20:10Forrás: Cline
A Cline nyílttá teszi az open-weight ügynökök értékelési adatait
Kép: Cline

A Cline nyílttá teszi az open-weight modellekkel működő kódoló ügynökök értékeléséhez használt módszereit, eredményeit és nyomvonalait. A vállalat szerint a cél annak bemutatása, hogyan lehet a teljesítményt, a tokenfelhasználást és a költségeket egyszerre vizsgálni.

A lényeg röviden
  • A Cline szerint öt leggyakrabban használt modellje mind open-weight modell.
  • A vállalat kérései 20, illetve 30 százalékkal több tokent használtak a nyilvános hatékonysági átlagnál.
  • A Terminal Bench 89 feladatból álló adathalmazán vizsgálják az ügynököket.
  • A Fable maximális módja 91 százalékos eredményt ért el, tízszeres költséggel a Kimi K3-hoz képest.
  • A Cline több mint ezer dollárnyi értékelési eredményt és nyomvonalat tesz elérhetővé.

A nyílt súlyú modellek kerültek a középpontba

A Cline augusztus 18-án közzétett bejegyzése szerint az új modellkiadások, köztük a Fable és a Gpt-5.6 Sol megjelenése mellett egyre költségesebb a zárt súlyú modellek használata. A vállalat úgy látja, hogy a kódoló ügynökök előfizetései gyakran nem biztosítanak kellő átláthatóságot az árakról, miközben a kredithatárok mögötti tokenértékek is változhatnak.

A Cline az elmúlt hónapokban az open-weight modellek tokenfelhasználásának növekedését tapasztalta. Ennek okaként az ár- és minőségjavulást említi, és azt állítja, hogy ezek a modellek már felveszik a versenyt a zárt modellekkel. A vállalat saját használati adatai szerint jelenleg a Cline öt leggyakrabban használt modellje mind open-weight modell.

A Cline új SDK-ja alapján a vállalat kérései 20, illetve 30 százalékkal több tokent használtak, mint a leghatékonyabbnak hirdetett ügynöki keretrendszerek nyilvános átlaga. Bár a Cline több open-weight modellen élvonalbeli értékelési eredményeket ért el, a többletköltséget elfogadhatatlannak tartotta.

Öt szempont az ügynökök finomhangolásához

A bejegyzés szerzői a fejlesztési folyamatot „Hill Climber's Checklist” néven öt heurisztikára építik. Ezek közül a szöveg három részletes bemutatását tartalmazza. Az első egy irányadó mérőszám kijelölése, amely segít elkerülni a túlzott és az elégtelen optimalizálást. A Cline általában az adott modellhez elérhető legjobb nyilvános ügynöki keretrendszer eredményét célozza meg. Ha az eltérés csak 1, illetve 3 százalék, a további javítás rendszerint nem éri meg a ráfordítást.

A második szempont a zaj számszerűsítése. Ugyanazon modell, keretrendszer és beállítás több futtatása is eltérő eredményt hozhat. A Cline példái között szerepel a minimax-m3, amely öt újrafuttatás során 43,8 és 56,2 százalék közötti eredményt ért el. A glm-5.2 esetében az ismétlések 56,2 és 74,2 százalék között szóródtak.

A harmadik lépés a hibák okának feldarabolása, elsőként feladat, majd modell és szolgáltató szerint. A Cline egy tokenfelhasználási problémánál azt találta, hogy 450 millió tokenből körülbelül 250 ezret mindössze 15 feladat generált a 89 feladatból álló Terminal Bench adathalmazon. A vállalat szerint ezért célszerű először a problémás feladatokat elkülöníteni, célzottan javítani, majd teljes futtatással ellenőrizni, hogy a változtatás nem rontott más feladatokon.

Nyílt adatokkal vizsgálnák a költség és teljesítmény egyensúlyát

Az értékelések futtatásához a Cline a Harbor keretrendszert használja, amely a Terminal-Bench készítői által fejlesztett, széles körben alkalmazott ügynökevaluációs eszköz. A Harbor kezeli a homokozók működtetését, az ügynöki ciklust és a futások megfigyelését, miközben a Modal segítségével párhuzamos értékelések indíthatók.

A Cline szerint az értékelés több cél egyidejű optimalizálását jelenti. Ilyen ellentét lehet a költség és az intelligencia, a gondolkodási szint és a tokenhatékonyság, a megoldási idő és az értékelési pontszám, illetve a tokenhatékonyság és a pontszám között. A vállalat példája szerint a Fable maximális módjával 91 százalékos eredmény érhető el a Terminal Benchen, de ez tízszer annyiba kerül, mint a Kimi K3 használata.

A Cline több mint ezer dollárnyi értékelési pontszámot és nyomvonalat ígér letölthető formában. Ezeket a felhasználók saját ügynökeikkel is megvizsgálhatják, hogy részletesebb következtetéseket vonjanak le a modellek és a keretrendszerek működéséről. A bejelentés így a fejlesztőknek ad eszközöket ahhoz, hogy a nyílt súlyú modellek teljesítményét a felhasznált tokenekkel és a nettó futtatási költséggel együtt hasonlítsák össze.

Kapcsolódó hírek

A Replit Agent maga dönti el, mikor és melyik modellt használja
Fejlesztőknek2026. szeptember 29. 18:00

A Replit Agent maga dönti el, mikor és melyik modellt használja

A Replit Agent új megközelítése nagyobb döntési szabadságot ad a fő modellnek: maga határozza meg, mennyire gondolkodjon, mikor adjon át egy feladatot, és melyik…

A Replit Agent maga dönti el, mikor és melyik modellt használja
Fejlesztőknek2026. szeptember 29. 18:00

A Replit Agent maga dönti el, mikor és melyik modellt használja

A Replit Agent új vezérlési rendszere a fő modellre bízza, mennyire gondolja végig a feladatot, mikor delegál részfeladatot, és melyik almodellt választja hozzá. A…

A DeepSeek V4 Flash 12 centből ért el IMO-aranyszintet
Kutatás2026. augusztus 26. 22:44

A DeepSeek V4 Flash 12 centből ért el IMO-aranyszintet

A DeepSeek V4 Flash 30 pontot szerzett az IMO 2026 hat feladatán, ezzel átlépte a 29 pontos aranyéremhatárt. A Cline mérése szerint a legjobb futtatás költsége 0,1215…