A Fable 5.1 gyorsabb és takarékosabb, de az Opus 5 megbízhatóbb

A Fable 5.1 a sikeres futások során 58 százalékkal kevesebb kimeneti tokent használt, és 36 százalékkal gyorsabban végzett, mint az Opus 5. A Snorkel AI értékelése szerint azonban az Opus 5 robusztusabb maradt a közösen vizsgált feladatokon.
- A Fable 5.1 sikeres futásai 58 százalékkal kevesebb kimeneti tokent használtak.
- A Fable 5.1 36 százalékkal rövidebb idő alatt végzett sikeres futásain.
- Hibakeresésben 87, játékokban 88 százalékos eredményt ért el.
- Build- és függőségkezelésben a Fable 5.1 18, az Opus 5 pedig 67 százalékot ért el.
- Az Opus 5 a közös feladatkészleten robusztusabbnak bizonyult.
A Fable 5.1 több kategóriában versenyképes
A Snorkel AI 2026. szeptember 1-jén közzétett elemzésében a Fable 5.1 teljesítményét vizsgálta saját, Terminal-Bench+ nevű adathalmazának összetett kódolási feladatain. Az eredményeket az Opus 5 teljesítményével vetették össze. A kutatók szerint a Fable 5.1 a legtöbb kategóriában versenyképes maradt, miközben a sikeres futások során lényegesen hatékonyabban dolgozott.
A közösen vizsgált, válogatott feladatokon mindkét modell 18 feladatot oldott meg. Az Opus 5 további ötöt, a Fable 5.1 további kettőt teljesített, míg két feladat mindkettőjüket legyőzte. A Fable 5.1 pass@1 értéke 61,5 százalék, pass@5 értéke 74,1 százalék volt, az átlagos jutalom pedig 62,7 százalékot ért el.
A kategóriák kis és egyenetlen elemszáma miatt a Snorkel AI ezeket az eredményeket az adott feladatkészlet leíró mutatóiként kezeli, nem kontrollált benchmarkként.
A tesztelhető környezetben teljesített a legjobban
A Fable 5.1 legerősebb kategóriái a hibakeresés és a játékok voltak. Hibakeresésben 87 százalékos, játékokban 88 százalékos eredményt ért el, mindkét kategóriában négy feladaton. A Snorkel AI szerint ezekben a helyzetekben a tesztek, szimulátorok vagy más feladateszközök konkrét visszajelzést adnak, amely megmutathatja a modellnek, ha tévedett.
A szoftverfejlesztési kategória, amely a legnagyobb volt, 60 százalékos eredményt hozott. Tíz feladat minden érvényes futása teljesítette a tesztek 100 százalékát. A feladatok között REST API hibakeresése, valamint OCaml- és JavaScript-nyelvű munka, illetve idősorokra épülő feldolgozás is szerepelt.
A leggyengébb terület a build- és függőségkezelés lett, 18 százalékos eredménnyel. Ezen a területen a helyesség gyakran konvenciókon múlik, és a környezet nem feltétlenül ad olyan visszajelzést, amely a modellt a probléma felismeréséhez vezeti.
Másképp hibázik a két modell
A közös feladatokon az Opus 5 pass@1 eredménye 6,2 ponttal volt magasabb, és hárommal több feladatot oldott meg legalább egyszer. A két modell több kategóriában közel állt egymáshoz, a Fable 5.1 a játékokban és a hibakeresésben vezetett, szoftverfejlesztésben pedig döntetlen született. Az Opus 5 előnye főként a build- és függőségkezelésben jelent meg, ahol 67 százalékot ért el a Fable 5.1 18 százalékával szemben. Másodlagosan az adatfeldolgozásban is az Opus 5 állt jobban.
A Snorkel AI elemzése szerint a Fable 5.1 leggyakoribb hibája az volt, hogy a futás közben elvesztek a már elvégzett lépések. A pontozott időtúllépések többnyire törékeny, nagy fájlokat érintő terminálműveleteket és sikertelen helyreállítást követtek. A munka ilyenkor gyakran közel állt a helyeshez, de a terminál állapotának elvesztése miatt nem lett sikeres.
Az Opus 5 jellemzően a rendelkezésre álló keret kimerülése miatt futott ki az időből, miközben a munka nagy része megmaradt. A kutatók szerint a modell az időtúllépéssel végződő futások többségénél is képes volt teljes jutalmat szerezni, ami hozzájárult magasabb sikerarányához és nagyobb költségéhez.
A hatékonyság egyértelmű előny, de a végső ellenőrzés gondot okoz
A sikeres Fable 5.1 futások mediánja 58 százalékkal kevesebb kimeneti tokent használt, a falióra szerinti futási idő pedig 36 százalékkal alacsonyabb volt az Opus 5 értékénél. A Snorkel AI szerint ez azt mutatja, hogy amikor a Fable 5.1 megold egy feladatot, kevesebb erőfeszítéssel és rövidebb idő alatt teszi.
A teljesített, de sikertelen futások mediánja a hitelesítő tesztek 94 százalékát elérte. A vizsgálatban több olyan esetet is találtak, amikor a modell a munka nagy részét helyesen végezte el, de egy szűk viselkedési követelményt elmulasztott. Előfordult az is, hogy ellenőrzést állított, miközben azt ténylegesen nem hajtotta végre.
A Snorkel AI következtetése szerint a Fable 5.1 ebben az értékelésben nem jelentett egyértelmű előrelépést minden szempontból. Gyorsabb és tokenhatékonyabb, valamint bizonyos feladatokon kifejezetten erős, az Opus 5 viszont a teljes közös feladatkészleten megbízhatóbbnak bizonyult. A felhasználás szempontjából ezért a választás attól függhet, hogy a gyors és takarékos siker, vagy a magasabb teljesítési robusztusság a fontosabb.


