Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Claude Opus 5.5 több hibát találhat, de több megjegyzést is generál

2026. szeptember 22.Forrás: CodeRabbit
A Claude Opus 5.5 több hibát találhat, de több megjegyzést is generál
Kép: CodeRabbit

A Claude Opus 5.5 a CodeRabbit tesztjeiben kissé több ismert hibát talált a vállalat éles modellmixénél, miközben alacsonyabb műveleti pontosságot és több megjegyzést produkált. A modell más hibákat is észrevett, mint a jelenlegi alapbeállítás, ezért a csere előtt a lefedettséget és az ellenőrzésre fordított munkát együtt kell mérlegelni.

A lényeg röviden
  • A Claude Opus 5.5 Standard 51-et, Max konfigurációja 50-et talált meg a 80 OSS-esetből.
  • A Signal tesztben a Max 10 hibát talált a 13-ból, az alapmodell 5-öt.
  • Az Opus 5.5 több megjegyzést generált, mint a produkciós modellmix.
  • A Standard konfiguráció kevesebb megjegyzés mellett nagyobb használható pontosságot ért el az OSS tesztben.
  • A tokenhasználat konfigurációtól függően 40,6 és 60,1 százalékkal haladta meg az alapmodellt.

Olcsóbb modell, változó kódellenőrzési eredmények

Az Anthropic 2026. szeptember 22-én mutatta be a Claude 5.5 család első modelljeként a Claude Opus 5.5-öt. A CodeRabbit ezt saját mesterséges intelligenciával támogatott kódellenőrzési folyamatában vizsgálta. A vállalat szerint a modell közepes gondolkodási erősségen több, többlépéses kódolási feladatban elérte vagy meghaladta a Claude Opus 5 magas beállításának teljesítményét, nagyjából feleannyi token használatával.

A tokenárak is csökkentek. A bemeneti tokenek ára 1 millió tokenenként 5 dollárról 4 dollárra, a kimeneti tokeneké 25 dollárról 20 dollárra esett. A gyorsítótárból történő olvasás ára 0,20 dollár 1 millió tokenenként. A CodeRabbit hangsúlyozza, hogy egy teljes kódellenőrzés költségét az ár mellett a tokenhasználat és a hívások száma is meghatározza.

Az Opus 5.5-ben a gondolkodás mindig alkalmazkodó, az erősség beállítása szabályozza többek között az elmélyülést, a késleltetést és a költséget. A kényszerített eszközhívásokat kivezették, ezért azoknak az alkalmazásoknak, amelyek eszközeredményre támaszkodnak, ellenőrizniük kell, hogy a hívás valóban megtörtént-e.

A Standard beállítás jobb kiindulópontnak bizonyult

A CodeRabbit két konfigurációt tesztelt, a kisebb gondolkodási erősségű Standardot és a nagyobb erősségeket kombináló Maxot. Az OSS August tesztben 80 ismert hibamintát, a nehezebb Signal tesztben 13 esetet vizsgáltak. A mérés az elkapott hibákat, a használható megjegyzések pontosságát és a szűrés után jelentett megjegyzések számát követte.

Az OSS August tesztben a produkciós alapmodell 80-ból 49 hibát talált, 39,3 százalékos használható pontosság mellett, és 116 megjegyzést jelentett. A Standard 51 hibát talált, pontossága 38,6 százalék, megjegyzéseinek száma 127 volt. A Max 50 hibát talált, 35,7 százalékos pontossággal és 140 megjegyzéssel.

A CodeRabbit szerint ezek alapján a Standard jobb kezdőbeállítás. A nagyobb gondolkodási erősség nem eredményezett következetesen jobb ellenőrzést, miközben növelte a fejlesztők által átnézendő megjegyzések számát.

A nehezebb esetekben a Max több hibát talált

A 13 esetből álló Signal tesztben a produkciós alapmodell 5 hibát talált, 29,4 százalékos használható pontossággal és 17 megjegyzéssel. A Standard 8 hibát azonosított, pontossága 66,7 százalék, megjegyzéseinek száma 21 volt. A Max 10 hibát talált, 52 százalékos pontosság és 25 megjegyzés mellett.

A módosított sorokon kívüli találatokat is beleszámítva a Standard és a Max egyaránt 10 hibáig jutott, míg az alapmodell 7-et talált. A konfigurációk eltérő hibákat hagytak ki. Az OSS tesztben a Standard 11 olyan hibát talált, amelyet az alapmodell nem, ugyanakkor 9 olyan hibát nem talált meg, amelyet az alapmodell igen.

A CodeRabbit egyik példájában két párhuzamos feladat ugyanazt az újrapróbálkozási számlálót olvasta ki, így két növelési művelet után az érték csak 1 lett. A Claude Opus 5.5 mindkét konfigurációja az adatbázis atomi növelését javasolta, amely ebben az esetben 2-re emelné a számlálót.

A több találat nagyobb tokenhasználattal járt

A CodeRabbit futási összesítője szerint az Opus 5.5 mindkét vizsgált konfigurációban több tokent használt a produkciós modellmixnél. A Standard használata az OSS August tesztben 49,2, a Signal tesztben 40,6 százalékkal növelte a jelentett tokenhasználatot. A Max esetében ugyanez 57,6, illetve 60,1 százalék volt.

Ezek az adatok nem különítik el a bemeneti és kimeneti tokeneket, és önmagukban nem állapítják meg a dollárban számolt költséget vagy a késleltetést. A CodeRabbit ezért azt javasolja, hogy a csapatok a teljes ellenőrzést mérjék, beleértve az újrapróbálkozásokat, az ellenőrző hívásokat és a tartalékmodelleket is. A modell bevezetését akkor tartja indokolhatónak, ha a többlet-találatok ellensúlyozzák a számítási költséget és a fejlesztők ellenőrzési munkáját.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A Claude Sonnet 5.5 több hibát talált, feleannyi idő alatt
Modellek2026. szeptember 28.

A Claude Sonnet 5.5 több hibát talált, feleannyi idő alatt

A CodeRabbit tesztjeiben a Claude Sonnet 5.5 több ismert hibát talált meg a Sonnet 5-nél, miközben körülbelül feleannyi idő alatt futott le. A javulás ára az, hogy a…

Olcsóbb és specializáltabb modellekkel gyorsul az AI-verseny
Modellek2026. szeptember 23. 00:09

Olcsóbb és specializáltabb modellekkel gyorsul az AI-verseny

Két nap alatt három jelentős AI-labor új modellt mutatott be: a SpaceXAI Grok 4.7-et, az Anthropic Claude Opus 5.5-öt, az OpenAI pedig a GPT-6 Sol és GPT-6 Luna…

A Microsoft Foundryba érkezett a Claude Opus 5.5
Modellek2026. szeptember 22. 19:00

A Microsoft Foundryba érkezett a Claude Opus 5.5

Elérhetővé vált a Claude Opus 5.5 a Microsoft Foundryban, így a fejlesztők és vállalatok hosszabb, több lépésből álló kódolási, elemzési és üzleti feladatokhoz is…