Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A drágább Fable 5-tel mégis olcsóbb lett a Devin használata

2026. július 13. 19:00Forrás: Cognition
A drágább Fable 5-tel mégis olcsóbb lett a Devin használata
Kép: Cognition

A Fable 5 tokenenként kétszer annyiba kerül, mint az Opus 4.8, a Cognition tesztje szerint mégis olcsóbban futott vele a Devin. A különbséget az ügynökök munkaszervezése és delegálási gyakorlata okozta.

A lényeg röviden
  • A Fable 5 tokenenként kétszer drágább az Opus 4.8-nál.
  • Sidekickkel a Fable 5 futása átlagosan 1,86 dollárba, az Opus 4.8-é 2,04 dollárba került.
  • A Fable 5 60,7, az Opus 4.8 pedig 54,6 pontot ért el a FrontierCode 1.1 teszten.
  • A Fable 5 vezető ügynöke kevesebb fordulót és kevesebb bemeneti tokent használt.
  • A Cognition szerint a delegálás időzítése és a feladatleírás minősége fontosabb lehet a tokenárnál.

A magasabb tokenár ellenére alacsonyabb költség

A Cognition lecserélte az Opus 4.8-at Fable 5-re a Devinben, majd mindkét modellt a FrontierCode 1.1 értékelésen vizsgálta a vállalat új Fusion architektúrájával. A tesztben 3000 értékelési munkamenetet futtattak le négy beállításban: Fable 5 és Opus 4.8 vezető modellként, mindkettőt oldalsó ügynökkel és anélkül.

A tisztán futtatott modelleknél a várakozásoknak megfelelő eredmény született. A Fable 5 60,8 pontot ért el 4,03 dolláros átlagos futásonkénti költség mellett, míg az Opus 4.8 55,4 pontot és 3,06 dolláros költséget mutatott.

Az oldalsó ügynök bekapcsolásakor azonban megfordult a költségsorrend. A Fable 5 és a Sidekick együtt 60,7 pontot ért el, egy futás átlagos költsége 1,86 dollár volt. Az Opus 4.8 és a Sidekick 54,6 pontot szerzett, miközben a költség 2,04 dollárt tett ki. A Cognition szerint a Fable 5 így 9 százalékkal olcsóbb és 11 százalékkal jobb eredményt produkált ebben az összevetésben.

A delegálás módja döntötte el a számlát

A Fusion felépítésében a vezető ügynök tartja kézben a munkamenetet, kommunikál a felhasználóval, megtervezi a feladatot, ellenőrzi az eredményt és véglegesíti a változtatásokat. A tartósan elérhető Sidekick részfeladatokat kap, saját környezetben dolgozik, majd jelentést küld vissza.

A költségvizsgálat szerint a Fable 5 vezető ügynöke futásonként átlagosan 11,5 alkalommal lépett működésbe, az Opus 4.8 esetében ez 26,5 alkalom volt. A Fable 5 vezetője 545 ezer kumulált bemeneti tokent használt, az Opus 4.8 pedig 1,679 milliót. A kimeneti tokenek száma 6,1 ezer, illetve 19,0 ezer volt.

A Fable 5 ugyanakkor többet költött a Sidekickre, futásonként 0,58 dollárt, szemben az Opus 4.8 0,31 dollárjával. Ezt ellensúlyozta, hogy a vezető modell költsége a Fable 5-nél 1,28 dollár, az Opus 4.8-nál pedig 1,73 dollár lett.

A Cognition elemzése szerint a két vezető modell nagyjából ugyanannyiszor, körülbelül három alkalommal delegált. A különbség az időzítésben és a feladatok kijelölésében jelent meg. A Fable 5 korán átadta a felderítést és a megvalósítás, tesztelés, valamint hibajavítás nagy részét. Az Opus 4.8 gyakran hosszú önálló feltárás és implementáció után delegált, amikor a költséges munka már elkészült.

A Fable 5 kevesebb munkamenetet és kevesebb javítást igényelt

A Cognition 40 feladatot részletesen is összehasonlított a két vezető modell futásaiban. A Fable 5 által vezetett munkamenetek 81 százalékában a vezető modell egyetlen kódszerkesztést sem végzett, az Opus 4.8 esetében ez az arány 24 százalék volt. A Fable 5 a futások 13 százalékában saját maga egyetlen repositoryfájlt sem olvasott el.

A vállalat példája szerint egy hashfeladaton az Opus 4.8 kézzel implementált egy olyan megoldást, amely nem teljesítette a mutató hosszától független, O(1) futási időre vonatkozó követelményt. Ez a megoldás 25 pontot kapott. A Fable 5 a Sidekicknek átadott részletesebb feladatleírásban külön rögzítette a korlátot és a teljesítendő teszteket, a végső eredmény pedig 94 pont lett.

Az ellenőrzés után is eltérően viselkedett a két modell. Az Opus 4.8 kétszer gyakrabban töltötte vissza a Sidekick fájljait a saját kontextusába, és négyszer több javító módosítást végzett vezetői modellként. A Fable 5 több esetben újabb olcsó delegálással javíttatta a hibát, míg az Opus 4.8 olykor visszavonta a Sidekick munkáját, majd maga írta újra.

A modell tokenára önmagában nem mutatja meg az ügynök költségét

A Cognition következtetése szerint az agentikus munkák árát nem önmagában a tokenenkénti díj határozza meg. Jelentős szerepe van annak, hogy a vezető modell hány fordulót fut, mekkora kontextust tart meg, és milyen feladatokat végez el saját maga helyett a Sidekickkel.

A vállalat tesztje alapján a Fable 5 korábbi és magasabb szintű delegálása csökkentette a vezető modell munkaterhét, miközben az értékelési eredmény gyakorlatilag változatlan maradt a tiszta Fable 5 futáshoz képest. Ez azt mutatja, hogy agentikus rendszereknél a munkafolyamat felépítése a modell egységáránál pontosabban jelezheti a végső költséget.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása
Kutatás2026. október 2. 20:01

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása

A promptok gyorsítótárazása csökkentheti az ismétlődő bemenetek feldolgozásának költségét, de az Arize AI tesztje szerint a magas cache újraolvasási arány önmagában nem…

A Grok 4.7 olcsóbban hozza az Opus 4.8 szintjét kódolásban
Kutatás2026. szeptember 22. 14:13

A Grok 4.7 olcsóbban hozza az Opus 4.8 szintjét kódolásban

A Grok 4.7 a Senior SWE-Bench teszten 40,0 százalékos tasteful pass@3 eredményt ért el, ezzel holtversenyben hatodik lett. Az eredmény megegyezik az Opus 4.8…

A Cognition két AI-modellt kapcsol össze olcsóbb kódolásért
Cégek és üzlet2026. szeptember 11. 19:00

A Cognition két AI-modellt kapcsol össze olcsóbb kódolásért

A Cognition elérhetővé tette Fusion nevű megoldását a Devin Desktopban és a Devin CLI-ban. A rendszer egy nagy teljesítményű modellt állít vezető szerepbe, egy olcsóbb…