Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Claude Sonnet 5.5 több hibát talált, feleannyi idő alatt

2026. szeptember 28.Forrás: CodeRabbit
A Claude Sonnet 5.5 több hibát talált, feleannyi idő alatt
Kép: CodeRabbit

A CodeRabbit tesztjeiben a Claude Sonnet 5.5 több ismert hibát talált meg a Sonnet 5-nél, miközben körülbelül feleannyi idő alatt futott le. A javulás ára az, hogy a modell más hibákat hagyott figyelmen kívül, mint elődje.

A lényeg röviden
  • A Sonnet 5.5 a 13 nehéz esetből 6 hibát talált meg, a Sonnet 5 4-et.
  • A cselekvésre alkalmas megjegyzések pontossága 41,2, illetve 40 százalék volt.
  • Az új modell átlagosan 5 perc 27 másodperc alatt végzett, szemben a Sonnet 5 9 perc 55 másodpercével.
  • A nagyobb, 44 pull requestes teszten a Sonnet 5.5 24 százalékkal kevesebb megjegyzést adott.
  • A CodeRabbit szerint a Sonnet 5.5 már a fő kódellenőrzési körben is számításba jöhet.

Több hibát talált, hasonló pontosság mellett

A CodeRabbit a 2026. szeptember 28-án közzétett értékelésben ugyanazon a 13, korábban azonosított hibát tartalmazó eseten futtatta le a Claude Sonnet 5.5 és a Sonnet 5 kódellenőrző folyamatát. A tesztelt pull requestek olyan nyílt forráskódú projektekből érkeztek, mint az Elasticsearch, a Puma, a vLLM, a Cilium, az axios és a Next.js.

A gondosan értékelt, ténylegesen használható megjegyzések alapján a Sonnet 5.5 gondolkodással bekapcsolva 6 hibát talált meg a 13-ból, a Sonnet 5 pedig 4-et. Ez 46,2, illetve 30,8 százalékos lefedettséget jelentett. A Sonnet 5.5 cselekvésre alkalmas megjegyzéseinek pontossága 41,2 százalék volt, szemben a Sonnet 5 40 százalékával.

A Sonnet 5.5 összesen 17 ellenőrzött megjegyzést adott, a Sonnet 5 15-öt. A CodeRabbit szerint a négy plusz találat olyan hiba volt, amelyet a Sonnet 5 átengedett, miközben két olyan eset is akadt, amelyet az előd megtalált, az új modell viszont nem. A szerzők ezért úgy látják, hogy a javulás részben abból ered, hogy a két modell más hibákat hagy ki.

Feleannyi idő, alacsonyabb hívási költség

A 13 esetből álló teszten a Sonnet 5.5 átlagosan 5 perc 27 másodperc alatt végzett, a Sonnet 5-nek ehhez 9 perc 55 másodpercre volt szüksége. A CodeRabbit számítása szerint a Claude-modellhívások listaáras költsége felülvizsgálatonként körülbelül 60 százalékkal volt alacsonyabb az új modellnél.

Az Anthropic szerint a Sonnet 5.5 a Sonnet 5-tel azonos áron érhető el. A forrásban szereplő díjak bemeneti millió tokenenként 2 dollár, kimeneti millió tokenenként 10 dollár, gyorsítótár-olvasásnál 0,20 dollár, írásnál pedig 2,50 dollár. A vállalat azt állítja, hogy a modell ugyanahhoz a feladathoz jellemzően jóval kevesebb tokent használ, feladatonként akár 30 százalékkal kevesebbet, és több mint 30 százalékkal gyorsabban generál.

A CodeRabbit 44 nyílt forráskódú pull requestet és 85 ismert hibát tartalmazó, nagyobb tesztjén a Sonnet 5.5 111 megjegyzést tett közzé, míg a Sonnet 5 146-ot. Az új modell átlagosan 6 perc 33 másodperc alatt végzett egy felülvizsgálattal, az elődnek 13 perc 31 másodpercre volt szüksége. A 44 ellenőrzés teljes ideje 4 óra 49 perc, illetve 9 óra 55 perc volt.

A modell szerepe a Claude 5.5 családban

Az Anthropic a Sonnet 5.5-öt az Opus 5.5 gyorsabb, olcsóbb kiegészítőjeként pozicionálja. A vállalat szerint a Sonnet elsősorban jól körülhatárolt, mindennapi feladatokra alkalmas, például hibajavításra, valamint dokumentumok, bemutatók és táblázatok készítésére. Az Opus 5.5 a nyitott végű, tartós mérlegelést igénylő feladatok modellje marad.

A CodeRabbit értékelése szerint a Sonnet sorozat korábbi változatai között is látható volt egy irányváltás. A Sonnet 4.6 a mért ismert hibák körülbelül 63 százalékát találta meg, de 29 százalékos pontosság mellett sok mindenre megjegyzést tett. A Sonnet 5 körülbelül 50 százalékos lefedettségre esett vissza, miközben tisztább megjegyzéseket adott. A CodeRabbit szerint a Sonnet 5.5 úgy növelte a lefedettséget, hogy közben nagyjából megőrizte a pontosságot.

A gondolkodás alapértelmezés szerint adaptív, a felhasználó pedig alacsony, közepes, magas, xhigh és max szintek közül választhat. A Claude alkalmazásokban a közepes, a Claude Platformon a magas szint az alapértelmezett. A CodeRabbit ezúttal a kódellenőrzés fő körére is alkalmasnak tartja a Sonnet 5.5-öt, ugyanakkor hangsúlyozza, hogy a 13 esetből álló nehéz teszt kis minta, és az új modell továbbra sem érte el az Opus 5.5 eredményeit.

Kapcsolódó hírek

A Snowflake Cortex AI-ba érkezik a Claude Sonnet 5.5
Termékek és eszközök2026. szeptember 28. 21:21

A Snowflake Cortex AI-ba érkezik a Claude Sonnet 5.5

Nyilvános előzetesként érkezik a Claude Sonnet 5.5 a Snowflake Cortex AI platformjára. A modellt a csapatok kezdetben a Cortex Inference szolgáltatáson keresztül…

A Snowflake Cortex AI-ba érkezik az Anthropic Claude Sonnet 5.5
Termékek és eszközök2026. szeptember 28. 21:21

A Snowflake Cortex AI-ba érkezik az Anthropic Claude Sonnet 5.5

Nyilvános előzetesként érkezik a Snowflake Cortex AI-ba az Anthropic Claude Sonnet 5.5 modellje. A vállalati csapatok a Cortex Inference szolgáltatáson keresztül…

A Claude Opus 5.5 több hibát találhat, de több megjegyzést is generál
Modellek2026. szeptember 22.

A Claude Opus 5.5 több hibát találhat, de több megjegyzést is generál

A Claude Opus 5.5 a CodeRabbit tesztjeiben kissé több ismert hibát talált a vállalat éles modellmixénél, miközben alacsonyabb műveleti pontosságot és több megjegyzést…