A CodeRabbit szerint 86,7 százalékos eredményt ért el biztonsági tesztjén

A CodeRabbit Security a vállalat belső összehasonlító tesztjében 86,7 százalékos arányban azonosította a vizsgált, ismert sérülékenységeket. A CodeRabbit három másik rendszert is tesztelt valódi, nyílt forráskódú repozitóriumokon.
- A CodeRabbit Security 86,7 százalékos eredményt ért el a vállalat belső tesztjén.
- A vizsgálat 100 sérülékenységet és 94 nyílt forráskódú repozitóriumot tartalmazott.
- A teszt 11 nyelvre és 11 sérülékenységi családra terjedt ki.
- A felismeréshez a hibát és annak kihasználási útját is be kellett mutatni.
- A CodeRabbit a térképezést, a keresést, az ellenőrzést és az opcionális javítást külön szakaszként kezeli.
Valódi repozitóriumokon vizsgálták a rendszereket
A CodeRabbit 2026. október 6-i beszámolója szerint a biztonsági ügynököt és három másik rendszert ismert sérülékenységek felismerésére tesztelték. A vállalat belső összehasonlító fejlesztési szeletében a CodeRabbit Security 86,7 százalékos, a Devin 73,3 százalékos, a Codex Security Plugin 62,0 százalékos, a Claude Security pedig 40,0 százalékos eredményt ért el.
A teszt 100 sérülékenységet és 94 repozitóriumot tartalmazott, 11 programozási nyelven és 11 sérülékenységi családban. A készletben 12 kritikus, 50 magas és 38 közepes súlyosságú eset szerepelt. A vizsgált területek között volt a hitelesítés, a jogosultságkezelés, a befecskendezés, a deszerializáció, az SSRF, az XSS, a kriptográfia, az adatfeltárás, az útvonalkezelés, a protokollintegritás és a szolgáltatásmegtagadás.
A rendszernek a kihasználhatóságot is meg kell indokolnia
A tesztesetek a GitHub Advisory Database és az OSV adatbázis ismert hibáiból származtak. Minden rendszer a sérülékeny forráskód egy pillanatképét kapta meg, miközben elrejtették előle a biztonsági közleményt és a javítást. A Git-előzményeket és a távoli kapcsolatokat eltávolították, a vizsgálat pedig hálózati hozzáférés nélkül futott.
A rendszerek nem kapták meg többek között a GHSA- vagy CVE-azonosítót, a CWE-besorolást, a súlyosságot, a repozitórium nevét, az érintett fájlt, a célzott sorokat és a javított forrást. A CodeRabbit szerint ezek a korlátozások csökkentik a vizsgálat során felhasználható kapaszkodók számát, ugyanakkor a nyilvános repozitóriumok és sérülékenységek korábbi modellbetanításban való megjelenése külön korlátot jelent.
Észlelési pont csak akkor járt, ha a jelentés azonosította a sérülékenységet, bemutatta a kihasználás módját, és figyelembe vette az alkalmazás védelmi mechanizmusait. Egy ugyanabban a fájlban talált másik hiba, illetve önmagában a megfelelő CWE-besorolás nem volt elegendő.
Négy lépésben térképez, vizsgál és ellenőriz
A CodeRabbit Security működését a vállalat négy szakaszban írja le: térképezés, keresés, ellenőrzés és opcionális javítás. A térképező ügynökök biztonságos homokozóban feltérképezik az alkalmazást, megkeresik a belépési pontokat, a bizalmi határokat, valamint a hitelesítési és jogosultsági ellenőrzéseket. Emellett elérhetőségi gráfot építenek a külső bemenetek és az általuk elérhető kód, illetve erőforrások között.
A keresési szakaszban szakosított ügynökök párhuzamosan vizsgálják többek között a jogosultságkezelést, a befecskendezést, az üzleti logikát, az adatfeltárást és az AI-specifikus fenyegetéseket. A jelölteket ezután külön ellenőrző vizsgálja. Megnézi, hogy az érintett kód elérhető-e, léteznek-e máshol védelmek, teljesülhetnek-e a kihasználás feltételei, és alátámasztják-e a bizonyítékok a feltételezett hatást.
A vállalat szerint a rendszer elveti a tesztkódon, elérhetetlen kódon vagy alá nem támasztott feltételezéseken alapuló jelölteket. A javítási funkció az arra alkalmas, megerősített esetekhez biztonsági ágon készít javítási tervezetet, majd felülvizsgálható pull requestet vagy merge requestet nyit.
A mérés a teljes elemzési folyamatot vizsgálja
A CodeRabbit hangsúlyozza, hogy a közölt pontszám a sérülékenység felismerését méri, a javítás minőségét nem. A vállalat vegyes modellkonfigurációkat is összehasonlított egymodelles beállításokkal, és azt vizsgálta, hogyan hat az egyes modellek kiválasztása a felismerésre, az ellenőrzésre és a végső jelentésre.
A beszámoló szerint egy olcsóbb modell használata csökkentheti a futtatási költséget, de kevesebb helyes találat juthat el a végső jelentésig. A CodeRabbit ezért a teljes folyamatot hangolja, és továbbra is vizsgálja, hogy az új modellek hol illeszkednek a legjobban. A teszt eredménye a felhasználók számára azt jelenti, hogy a vállalat a biztonsági ügynök képességét ismert hibák visszakeresésén, az alkalmazás teljes kód- és konfigurációs környezetében méri.


