Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Snorkel szerint az Opus 5.5 vezet a kódolási tesztben

2026. szeptember 23.Forrás: Snorkel AI
A Snorkel szerint az Opus 5.5 vezet a kódolási tesztben
Kép: Snorkel AI

Az Opus 5.5 érte el a legmagasabb összesített sikerarányt a Snorkel AI szakértők által összeállított kódolási feladatsorán. A modell 68 százalékos eredményt ért el, szemben az Opus 5 61, illetve a Fable 5.1 49 százalékával.

A lényeg röviden
  • Az Opus 5.5 összesített sikeraránya 68 százalék lett.
  • Az Opus 5 és a Fable 5.1 eredménye 61, illetve 49 százalék volt.
  • A teszt 24 feladatot és 200 végrehajtási trajektóriát tartalmazott.
  • Az Opus 5.5 leggyakoribb hibái a formátum-, következtetési és eszközparaméterezési hibák voltak.
  • A formátumhibák kizárásával az Opus 5.5 eredménye 74 százalékra nőtt.

Három modell ugyanazon a feladatsoron

A Snorkel AI 2026. szeptember 23-án közölt elemzésében három modellgenerációt hasonlított össze ugyanazon, terminálhasználatra épülő feladatsor segítségével. A vizsgálatban a Fable 5.1 szeptemberi, az Opus 5 júliusi, az Opus 5.5 pedig az újabb mérési körben szerepelt.

A szakértők által készített teszt 24 feladatból és 200 végrehajtási trajektóriából állt. A kutatók minden sikertelen futást egy bíró által megerősített kiváltó okig követtek vissza. Ez lehetővé tette, hogy az egyszerű sikerarány mellett azt is megvizsgálják, milyen módon hibáznak a modellek.

Az összes trajektóriát együtt vizsgálva a Fable 5.1 49 százalékos eredményt ért el, 94 sikeres futással 191-ből. Az Opus 5 61 százalékot, 118 sikeres futást teljesített 195-ből, míg az Opus 5.5 68 százalékot, 136 sikeres futást 200-ból.

A részpontszámok nem mindenhol az Opus 5.5-nek kedveztek

A Snorkel külön mérte az első próbálkozás sikerét, vagyis a pass@1 értéket. Ebben a Fable 5.1 61,5 százalékot ért el, az Opus 5 és az Opus 5.5 pedig egyaránt 60,7 százalékon végzett. Ez a mutató az utóbbi két modellgenerációnál változatlan szintet jelez, a Fable 5.1 pedig névlegesen magasabb eredményt produkált.

Az öt próbálkozásból legalább egy sikeres teljesítését mérő pass@5 mutatóban az Opus 5 teljesített a legjobban, 79,3 százalékkal. A Fable 5.1 értéke 74,1, az Opus 5.5-é pedig 76,7 százalék lett. A Snorkel szerint az összesített trajektóriaeredmény mégis folyamatos javulást mutat a modellek között.

A kutatók a formátumkezelési hibákat külön is megvizsgálták. Ha ezeket a futásokat kizárták, az Opus 5.5 eredménye 74 százalékra, 184 sikeres trajektóriára emelkedett 200-ból. Ezekben az esetekben a modell olyan üres vagy nem strukturált első választ adott, amelyet a tesztkörnyezet nem tudott értelmezni, így parancsok végrehajtására sem került sor.

Eltérő hibamintázatok rajzolódnak ki

A Snorkel elemzése szerint a három modell más típusú problémákkal küzdött. A Fable 5.1 esetében a hibák főként a futás közbeni túl korai leállásból és a már bekövetkezett hibák helyreállításának elmaradásából adódtak. A következtetési hibák kisebb szerepet játszottak.

Az Opus 5-nél a hibás következtetés volt a legnagyobb egyedi ok, a bíró által megerősített kiváltó okok 35 százalékával. A Snorkel szerint ennél a modellnél a mechanikai és műveleti hibák, például az eszközhasználati, végrehajtási vagy leállási problémák ritkák voltak. A korlátot inkább a levont következtetések jelentették.

Az Opus 5.5 hibáinak 25 százalékát rossz kimeneti formátum okozta, 20 százalékát hibás következtetés, 19 százalékát pedig téves eszközparaméterek. További 12 százalékban a modell csak a szükséges munka egy részét végezte el, majd leállt. A formátumhibák két feladatra koncentrálódtak, és a Snorkel szerint inkább a modell és a tesztkörnyezet közötti kapcsolatra utalnak, mint mérnöki hiányosságra.

A sikertelen futásokban a kihagyás a fő különbség

Az Opus 5.5 sikertelen futásai átlagosan 2,5 megerősített hibát tartalmaztak. A Snorkel ezt hibák egymásra épülő láncolataként írja le: egy korai következtetési vagy eszközhasználati hiba később is tovább élhet, ha a modell nem ellenőrzi megfelelően az eredményt.

A passzoló és sikertelen futások között a legnagyobb különbséget a kihagyott lépések jelentették. A kihagyottnak minősített készségek a sikeres nyomok 1 százalékában, a sikertelenek 9 százalékában fordultak elő. Az erős minősítés aránya ehhez képest mérsékeltebben esett, 88 százalékról 70 százalékra.

A Snorkel szerint az Opus 5.5 nem véletlenszerűen bukik el. Ugyanazon néhány nehéz feladaton ismétlődnek a hibák, és az extra próbálkozások sem javítanak sokat az eredményen. Ezek közül több minden vizsgált modell számára nehéznek bizonyult, az Opus 5 például ugyanúgy nulla sikeres futást ért el rajtuk öt próbálkozásból. A mérés alapján az Opus 5.5 fejlődése elsősorban a hibák típusában és az összesített teljesítésben látszik, miközben a tesztkörnyezethez kapcsolódó problémák továbbra is befolyásolják az eredményt.

Kapcsolódó hírek

Az Anthropic csökkentette Claude jellegzetes fordulatait, de nem tűntek el
Kutatás2026. szeptember 29.

Az Anthropic csökkentette Claude jellegzetes fordulatait, de nem tűntek el

Az Opus 5.5 valóban szinte teljesen elhagyta a hosszú gondolatjeleket, és a Claude-ra jellemző stiláris fordulatok száma is csökkent. Az Arize AI vizsgálata szerint…

Az Anthropic tényleg javított Claude stílusán, de nem tüntette el teljesen
Kutatás2026. szeptember 29.

Az Anthropic tényleg javított Claude stílusán, de nem tüntette el teljesen

Az Opus 5.5 valóban sokkal kevesebb em dash jelet és Claude-ra jellemző fordulatot használ, mint az Opus 5, de az Arize AI vizsgálata szerint a probléma nem tűnt el…

A Fable 5.1 gyorsabb és takarékosabb, de az Opus 5 megbízhatóbb
Kutatás2026. szeptember 2.

A Fable 5.1 gyorsabb és takarékosabb, de az Opus 5 megbízhatóbb

A Fable 5.1 a sikeres futások során 58 százalékkal kevesebb kimeneti tokent használt, és 36 százalékkal gyorsabban végzett, mint az Opus 5. A Snorkel AI értékelése…