A Snorkel szerint az Opus 5.5 vezet a kódolási tesztben

Az Opus 5.5 érte el a legmagasabb összesített sikerarányt a Snorkel AI szakértők által összeállított kódolási feladatsorán. A modell 68 százalékos eredményt ért el, szemben az Opus 5 61, illetve a Fable 5.1 49 százalékával.
- Az Opus 5.5 összesített sikeraránya 68 százalék lett.
- Az Opus 5 és a Fable 5.1 eredménye 61, illetve 49 százalék volt.
- A teszt 24 feladatot és 200 végrehajtási trajektóriát tartalmazott.
- Az Opus 5.5 leggyakoribb hibái a formátum-, következtetési és eszközparaméterezési hibák voltak.
- A formátumhibák kizárásával az Opus 5.5 eredménye 74 százalékra nőtt.
Három modell ugyanazon a feladatsoron
A Snorkel AI 2026. szeptember 23-án közölt elemzésében három modellgenerációt hasonlított össze ugyanazon, terminálhasználatra épülő feladatsor segítségével. A vizsgálatban a Fable 5.1 szeptemberi, az Opus 5 júliusi, az Opus 5.5 pedig az újabb mérési körben szerepelt.
A szakértők által készített teszt 24 feladatból és 200 végrehajtási trajektóriából állt. A kutatók minden sikertelen futást egy bíró által megerősített kiváltó okig követtek vissza. Ez lehetővé tette, hogy az egyszerű sikerarány mellett azt is megvizsgálják, milyen módon hibáznak a modellek.
Az összes trajektóriát együtt vizsgálva a Fable 5.1 49 százalékos eredményt ért el, 94 sikeres futással 191-ből. Az Opus 5 61 százalékot, 118 sikeres futást teljesített 195-ből, míg az Opus 5.5 68 százalékot, 136 sikeres futást 200-ból.
A részpontszámok nem mindenhol az Opus 5.5-nek kedveztek
A Snorkel külön mérte az első próbálkozás sikerét, vagyis a pass@1 értéket. Ebben a Fable 5.1 61,5 százalékot ért el, az Opus 5 és az Opus 5.5 pedig egyaránt 60,7 százalékon végzett. Ez a mutató az utóbbi két modellgenerációnál változatlan szintet jelez, a Fable 5.1 pedig névlegesen magasabb eredményt produkált.
Az öt próbálkozásból legalább egy sikeres teljesítését mérő pass@5 mutatóban az Opus 5 teljesített a legjobban, 79,3 százalékkal. A Fable 5.1 értéke 74,1, az Opus 5.5-é pedig 76,7 százalék lett. A Snorkel szerint az összesített trajektóriaeredmény mégis folyamatos javulást mutat a modellek között.
A kutatók a formátumkezelési hibákat külön is megvizsgálták. Ha ezeket a futásokat kizárták, az Opus 5.5 eredménye 74 százalékra, 184 sikeres trajektóriára emelkedett 200-ból. Ezekben az esetekben a modell olyan üres vagy nem strukturált első választ adott, amelyet a tesztkörnyezet nem tudott értelmezni, így parancsok végrehajtására sem került sor.
Eltérő hibamintázatok rajzolódnak ki
A Snorkel elemzése szerint a három modell más típusú problémákkal küzdött. A Fable 5.1 esetében a hibák főként a futás közbeni túl korai leállásból és a már bekövetkezett hibák helyreállításának elmaradásából adódtak. A következtetési hibák kisebb szerepet játszottak.
Az Opus 5-nél a hibás következtetés volt a legnagyobb egyedi ok, a bíró által megerősített kiváltó okok 35 százalékával. A Snorkel szerint ennél a modellnél a mechanikai és műveleti hibák, például az eszközhasználati, végrehajtási vagy leállási problémák ritkák voltak. A korlátot inkább a levont következtetések jelentették.
Az Opus 5.5 hibáinak 25 százalékát rossz kimeneti formátum okozta, 20 százalékát hibás következtetés, 19 százalékát pedig téves eszközparaméterek. További 12 százalékban a modell csak a szükséges munka egy részét végezte el, majd leállt. A formátumhibák két feladatra koncentrálódtak, és a Snorkel szerint inkább a modell és a tesztkörnyezet közötti kapcsolatra utalnak, mint mérnöki hiányosságra.
A sikertelen futásokban a kihagyás a fő különbség
Az Opus 5.5 sikertelen futásai átlagosan 2,5 megerősített hibát tartalmaztak. A Snorkel ezt hibák egymásra épülő láncolataként írja le: egy korai következtetési vagy eszközhasználati hiba később is tovább élhet, ha a modell nem ellenőrzi megfelelően az eredményt.
A passzoló és sikertelen futások között a legnagyobb különbséget a kihagyott lépések jelentették. A kihagyottnak minősített készségek a sikeres nyomok 1 százalékában, a sikertelenek 9 százalékában fordultak elő. Az erős minősítés aránya ehhez képest mérsékeltebben esett, 88 százalékról 70 százalékra.
A Snorkel szerint az Opus 5.5 nem véletlenszerűen bukik el. Ugyanazon néhány nehéz feladaton ismétlődnek a hibák, és az extra próbálkozások sem javítanak sokat az eredményen. Ezek közül több minden vizsgált modell számára nehéznek bizonyult, az Opus 5 például ugyanúgy nulla sikeres futást ért el rajtuk öt próbálkozásból. A mérés alapján az Opus 5.5 fejlődése elsősorban a hibák típusában és az összesített teljesítésben látszik, miközben a tesztkörnyezethez kapcsolódó problémák továbbra is befolyásolják az eredményt.
Snorkel AI: Opus 5.5 vs Opus 5 vs Fable 5.1: Coding Benchmark Results


