A Claude Sonnet 5.5 több hibát talált, feleannyi idő alatt

A CodeRabbit tesztjeiben a Claude Sonnet 5.5 több ismert hibát talált meg a Sonnet 5-nél, miközben körülbelül feleannyi idő alatt futott le. A javulás ára az, hogy a modell más hibákat hagyott figyelmen kívül, mint elődje.
- A Sonnet 5.5 a 13 nehéz esetből 6 hibát talált meg, a Sonnet 5 4-et.
- A cselekvésre alkalmas megjegyzések pontossága 41,2, illetve 40 százalék volt.
- Az új modell átlagosan 5 perc 27 másodperc alatt végzett, szemben a Sonnet 5 9 perc 55 másodpercével.
- A nagyobb, 44 pull requestes teszten a Sonnet 5.5 24 százalékkal kevesebb megjegyzést adott.
- A CodeRabbit szerint a Sonnet 5.5 már a fő kódellenőrzési körben is számításba jöhet.
Több hibát talált, hasonló pontosság mellett
A CodeRabbit a 2026. szeptember 28-án közzétett értékelésben ugyanazon a 13, korábban azonosított hibát tartalmazó eseten futtatta le a Claude Sonnet 5.5 és a Sonnet 5 kódellenőrző folyamatát. A tesztelt pull requestek olyan nyílt forráskódú projektekből érkeztek, mint az Elasticsearch, a Puma, a vLLM, a Cilium, az axios és a Next.js.
A gondosan értékelt, ténylegesen használható megjegyzések alapján a Sonnet 5.5 gondolkodással bekapcsolva 6 hibát talált meg a 13-ból, a Sonnet 5 pedig 4-et. Ez 46,2, illetve 30,8 százalékos lefedettséget jelentett. A Sonnet 5.5 cselekvésre alkalmas megjegyzéseinek pontossága 41,2 százalék volt, szemben a Sonnet 5 40 százalékával.
A Sonnet 5.5 összesen 17 ellenőrzött megjegyzést adott, a Sonnet 5 15-öt. A CodeRabbit szerint a négy plusz találat olyan hiba volt, amelyet a Sonnet 5 átengedett, miközben két olyan eset is akadt, amelyet az előd megtalált, az új modell viszont nem. A szerzők ezért úgy látják, hogy a javulás részben abból ered, hogy a két modell más hibákat hagy ki.
Feleannyi idő, alacsonyabb hívási költség
A 13 esetből álló teszten a Sonnet 5.5 átlagosan 5 perc 27 másodperc alatt végzett, a Sonnet 5-nek ehhez 9 perc 55 másodpercre volt szüksége. A CodeRabbit számítása szerint a Claude-modellhívások listaáras költsége felülvizsgálatonként körülbelül 60 százalékkal volt alacsonyabb az új modellnél.
Az Anthropic szerint a Sonnet 5.5 a Sonnet 5-tel azonos áron érhető el. A forrásban szereplő díjak bemeneti millió tokenenként 2 dollár, kimeneti millió tokenenként 10 dollár, gyorsítótár-olvasásnál 0,20 dollár, írásnál pedig 2,50 dollár. A vállalat azt állítja, hogy a modell ugyanahhoz a feladathoz jellemzően jóval kevesebb tokent használ, feladatonként akár 30 százalékkal kevesebbet, és több mint 30 százalékkal gyorsabban generál.
A CodeRabbit 44 nyílt forráskódú pull requestet és 85 ismert hibát tartalmazó, nagyobb tesztjén a Sonnet 5.5 111 megjegyzést tett közzé, míg a Sonnet 5 146-ot. Az új modell átlagosan 6 perc 33 másodperc alatt végzett egy felülvizsgálattal, az elődnek 13 perc 31 másodpercre volt szüksége. A 44 ellenőrzés teljes ideje 4 óra 49 perc, illetve 9 óra 55 perc volt.
A modell szerepe a Claude 5.5 családban
Az Anthropic a Sonnet 5.5-öt az Opus 5.5 gyorsabb, olcsóbb kiegészítőjeként pozicionálja. A vállalat szerint a Sonnet elsősorban jól körülhatárolt, mindennapi feladatokra alkalmas, például hibajavításra, valamint dokumentumok, bemutatók és táblázatok készítésére. Az Opus 5.5 a nyitott végű, tartós mérlegelést igénylő feladatok modellje marad.
A CodeRabbit értékelése szerint a Sonnet sorozat korábbi változatai között is látható volt egy irányváltás. A Sonnet 4.6 a mért ismert hibák körülbelül 63 százalékát találta meg, de 29 százalékos pontosság mellett sok mindenre megjegyzést tett. A Sonnet 5 körülbelül 50 százalékos lefedettségre esett vissza, miközben tisztább megjegyzéseket adott. A CodeRabbit szerint a Sonnet 5.5 úgy növelte a lefedettséget, hogy közben nagyjából megőrizte a pontosságot.
A gondolkodás alapértelmezés szerint adaptív, a felhasználó pedig alacsony, közepes, magas, xhigh és max szintek közül választhat. A Claude alkalmazásokban a közepes, a Claude Platformon a magas szint az alapértelmezett. A CodeRabbit ezúttal a kódellenőrzés fő körére is alkalmasnak tartja a Sonnet 5.5-öt, ugyanakkor hangsúlyozza, hogy a 13 esetből álló nehéz teszt kis minta, és az új modell továbbra sem érte el az Opus 5.5 eredményeit.


