A Claude Opus 5.5 több hibát találhat, de több megjegyzést is generál

A Claude Opus 5.5 a CodeRabbit tesztjeiben kissé több ismert hibát talált a vállalat éles modellmixénél, miközben alacsonyabb műveleti pontosságot és több megjegyzést produkált. A modell más hibákat is észrevett, mint a jelenlegi alapbeállítás, ezért a csere előtt a lefedettséget és az ellenőrzésre fordított munkát együtt kell mérlegelni.
- A Claude Opus 5.5 Standard 51-et, Max konfigurációja 50-et talált meg a 80 OSS-esetből.
- A Signal tesztben a Max 10 hibát talált a 13-ból, az alapmodell 5-öt.
- Az Opus 5.5 több megjegyzést generált, mint a produkciós modellmix.
- A Standard konfiguráció kevesebb megjegyzés mellett nagyobb használható pontosságot ért el az OSS tesztben.
- A tokenhasználat konfigurációtól függően 40,6 és 60,1 százalékkal haladta meg az alapmodellt.
Olcsóbb modell, változó kódellenőrzési eredmények
Az Anthropic 2026. szeptember 22-én mutatta be a Claude 5.5 család első modelljeként a Claude Opus 5.5-öt. A CodeRabbit ezt saját mesterséges intelligenciával támogatott kódellenőrzési folyamatában vizsgálta. A vállalat szerint a modell közepes gondolkodási erősségen több, többlépéses kódolási feladatban elérte vagy meghaladta a Claude Opus 5 magas beállításának teljesítményét, nagyjából feleannyi token használatával.
A tokenárak is csökkentek. A bemeneti tokenek ára 1 millió tokenenként 5 dollárról 4 dollárra, a kimeneti tokeneké 25 dollárról 20 dollárra esett. A gyorsítótárból történő olvasás ára 0,20 dollár 1 millió tokenenként. A CodeRabbit hangsúlyozza, hogy egy teljes kódellenőrzés költségét az ár mellett a tokenhasználat és a hívások száma is meghatározza.
Az Opus 5.5-ben a gondolkodás mindig alkalmazkodó, az erősség beállítása szabályozza többek között az elmélyülést, a késleltetést és a költséget. A kényszerített eszközhívásokat kivezették, ezért azoknak az alkalmazásoknak, amelyek eszközeredményre támaszkodnak, ellenőrizniük kell, hogy a hívás valóban megtörtént-e.
A Standard beállítás jobb kiindulópontnak bizonyult
A CodeRabbit két konfigurációt tesztelt, a kisebb gondolkodási erősségű Standardot és a nagyobb erősségeket kombináló Maxot. Az OSS August tesztben 80 ismert hibamintát, a nehezebb Signal tesztben 13 esetet vizsgáltak. A mérés az elkapott hibákat, a használható megjegyzések pontosságát és a szűrés után jelentett megjegyzések számát követte.
Az OSS August tesztben a produkciós alapmodell 80-ból 49 hibát talált, 39,3 százalékos használható pontosság mellett, és 116 megjegyzést jelentett. A Standard 51 hibát talált, pontossága 38,6 százalék, megjegyzéseinek száma 127 volt. A Max 50 hibát talált, 35,7 százalékos pontossággal és 140 megjegyzéssel.
A CodeRabbit szerint ezek alapján a Standard jobb kezdőbeállítás. A nagyobb gondolkodási erősség nem eredményezett következetesen jobb ellenőrzést, miközben növelte a fejlesztők által átnézendő megjegyzések számát.
A nehezebb esetekben a Max több hibát talált
A 13 esetből álló Signal tesztben a produkciós alapmodell 5 hibát talált, 29,4 százalékos használható pontossággal és 17 megjegyzéssel. A Standard 8 hibát azonosított, pontossága 66,7 százalék, megjegyzéseinek száma 21 volt. A Max 10 hibát talált, 52 százalékos pontosság és 25 megjegyzés mellett.
A módosított sorokon kívüli találatokat is beleszámítva a Standard és a Max egyaránt 10 hibáig jutott, míg az alapmodell 7-et talált. A konfigurációk eltérő hibákat hagytak ki. Az OSS tesztben a Standard 11 olyan hibát talált, amelyet az alapmodell nem, ugyanakkor 9 olyan hibát nem talált meg, amelyet az alapmodell igen.
A CodeRabbit egyik példájában két párhuzamos feladat ugyanazt az újrapróbálkozási számlálót olvasta ki, így két növelési művelet után az érték csak 1 lett. A Claude Opus 5.5 mindkét konfigurációja az adatbázis atomi növelését javasolta, amely ebben az esetben 2-re emelné a számlálót.
A több találat nagyobb tokenhasználattal járt
A CodeRabbit futási összesítője szerint az Opus 5.5 mindkét vizsgált konfigurációban több tokent használt a produkciós modellmixnél. A Standard használata az OSS August tesztben 49,2, a Signal tesztben 40,6 százalékkal növelte a jelentett tokenhasználatot. A Max esetében ugyanez 57,6, illetve 60,1 százalék volt.
Ezek az adatok nem különítik el a bemeneti és kimeneti tokeneket, és önmagukban nem állapítják meg a dollárban számolt költséget vagy a késleltetést. A CodeRabbit ezért azt javasolja, hogy a csapatok a teljes ellenőrzést mérjék, beleértve az újrapróbálkozásokat, az ellenőrző hívásokat és a tartalékmodelleket is. A modell bevezetését akkor tartja indokolhatónak, ha a többlet-találatok ellensúlyozzák a számítási költséget és a fejlesztők ellenőrzési munkáját.
CodeRabbit: Claude Opus 5.5 for code review: More catches, different misses


