A Cline nyílttá teszi az open-weight ügynökök értékelési adatait

A Cline nyílttá teszi az open-weight modellekkel működő kódoló ügynökök értékeléséhez használt módszereit, eredményeit és nyomvonalait. A vállalat szerint a cél annak bemutatása, hogyan lehet a teljesítményt, a tokenfelhasználást és a költségeket egyszerre vizsgálni.
- A Cline szerint öt leggyakrabban használt modellje mind open-weight modell.
- A vállalat kérései 20, illetve 30 százalékkal több tokent használtak a nyilvános hatékonysági átlagnál.
- A Terminal Bench 89 feladatból álló adathalmazán vizsgálják az ügynököket.
- A Fable maximális módja 91 százalékos eredményt ért el, tízszeres költséggel a Kimi K3-hoz képest.
- A Cline több mint ezer dollárnyi értékelési eredményt és nyomvonalat tesz elérhetővé.
A nyílt súlyú modellek kerültek a középpontba
A Cline augusztus 18-án közzétett bejegyzése szerint az új modellkiadások, köztük a Fable és a Gpt-5.6 Sol megjelenése mellett egyre költségesebb a zárt súlyú modellek használata. A vállalat úgy látja, hogy a kódoló ügynökök előfizetései gyakran nem biztosítanak kellő átláthatóságot az árakról, miközben a kredithatárok mögötti tokenértékek is változhatnak.
A Cline az elmúlt hónapokban az open-weight modellek tokenfelhasználásának növekedését tapasztalta. Ennek okaként az ár- és minőségjavulást említi, és azt állítja, hogy ezek a modellek már felveszik a versenyt a zárt modellekkel. A vállalat saját használati adatai szerint jelenleg a Cline öt leggyakrabban használt modellje mind open-weight modell.
A Cline új SDK-ja alapján a vállalat kérései 20, illetve 30 százalékkal több tokent használtak, mint a leghatékonyabbnak hirdetett ügynöki keretrendszerek nyilvános átlaga. Bár a Cline több open-weight modellen élvonalbeli értékelési eredményeket ért el, a többletköltséget elfogadhatatlannak tartotta.
Öt szempont az ügynökök finomhangolásához
A bejegyzés szerzői a fejlesztési folyamatot „Hill Climber's Checklist” néven öt heurisztikára építik. Ezek közül a szöveg három részletes bemutatását tartalmazza. Az első egy irányadó mérőszám kijelölése, amely segít elkerülni a túlzott és az elégtelen optimalizálást. A Cline általában az adott modellhez elérhető legjobb nyilvános ügynöki keretrendszer eredményét célozza meg. Ha az eltérés csak 1, illetve 3 százalék, a további javítás rendszerint nem éri meg a ráfordítást.
A második szempont a zaj számszerűsítése. Ugyanazon modell, keretrendszer és beállítás több futtatása is eltérő eredményt hozhat. A Cline példái között szerepel a minimax-m3, amely öt újrafuttatás során 43,8 és 56,2 százalék közötti eredményt ért el. A glm-5.2 esetében az ismétlések 56,2 és 74,2 százalék között szóródtak.
A harmadik lépés a hibák okának feldarabolása, elsőként feladat, majd modell és szolgáltató szerint. A Cline egy tokenfelhasználási problémánál azt találta, hogy 450 millió tokenből körülbelül 250 ezret mindössze 15 feladat generált a 89 feladatból álló Terminal Bench adathalmazon. A vállalat szerint ezért célszerű először a problémás feladatokat elkülöníteni, célzottan javítani, majd teljes futtatással ellenőrizni, hogy a változtatás nem rontott más feladatokon.
Nyílt adatokkal vizsgálnák a költség és teljesítmény egyensúlyát
Az értékelések futtatásához a Cline a Harbor keretrendszert használja, amely a Terminal-Bench készítői által fejlesztett, széles körben alkalmazott ügynökevaluációs eszköz. A Harbor kezeli a homokozók működtetését, az ügynöki ciklust és a futások megfigyelését, miközben a Modal segítségével párhuzamos értékelések indíthatók.
A Cline szerint az értékelés több cél egyidejű optimalizálását jelenti. Ilyen ellentét lehet a költség és az intelligencia, a gondolkodási szint és a tokenhatékonyság, a megoldási idő és az értékelési pontszám, illetve a tokenhatékonyság és a pontszám között. A vállalat példája szerint a Fable maximális módjával 91 százalékos eredmény érhető el a Terminal Benchen, de ez tízszer annyiba kerül, mint a Kimi K3 használata.
A Cline több mint ezer dollárnyi értékelési pontszámot és nyomvonalat ígér letölthető formában. Ezeket a felhasználók saját ügynökeikkel is megvizsgálhatják, hogy részletesebb következtetéseket vonjanak le a modellek és a keretrendszerek működéséről. A bejelentés így a fejlesztőknek ad eszközöket ahhoz, hogy a nyílt súlyú modellek teljesítményét a felhasznált tokenekkel és a nettó futtatási költséggel együtt hasonlítsák össze.
Cline: Open-sourcing evals for open-weight agents


