Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A GitHub új mércét készített az AI-kódellenőrzők összehasonlítására

2026. október 5. 17:59Forrás: GitHub
A GitHub új mércét készített az AI-kódellenőrzők összehasonlítására
Kép: GitHub

A GitHub bemutatta a ReviewBench nevű nyílt benchmarkot, amely az AI-alapú kódellenőrző rendszerek összehasonlítható értékelésére szolgál. Az adatbázis 219 pull requestet tartalmaz 19 programozási nyelven, a készítők pedig több forrásból állították össze az ellenőrzési eredményeket.

A lényeg röviden
  • A ReviewBench 219 pull requestet tartalmaz 19 programozási nyelven.
  • Az adatállományt 103,9 millió GitHub-pull request eloszlásai alapján alakították ki.
  • A benchmark hat mutatóval méri az ismert és az újonnan felfedezett problémákat.
  • A független mérnöki ellenőrzés 96,6 százalékos egyezést mutatott.
  • A teljes benchmarkadat-készlet nyilvánosan elérhető.

Valós fejlesztési munkafolyamatokat próbál modellezni

A GitHub október 5-én közzétett bemutatója szerint a kódellenőrző ügynökök egyre fontosabb szerepet töltenek be a pull requestek vizsgálatában. Ezek a rendszerek hibákat keresnek, segítenek eldönteni, mire kell figyelmet fordítani, és még a kód élesítése előtt jelezhetik a problémákat.

A rendszerek összevetése eddig nehéz volt, mivel az egyes ellenőrzők eltérő erősségekkel rendelkeznek. Van, amelyik több hibát talál, mások kevesebb zajt keltenek, illetve különbség lehet abban is, hogy egy rendszer kritikus problémákat vagy inkább kisebb javítási lehetőségeket tár fel.

A ReviewBench alapjául a GitHub 103,9 millió pull request elemzése szolgált. A benchmarkban szereplő 219 pull request 187 nyilvános, nyílt forráskódú licenc alatt álló tárolóból érkezik, és 19 nyelvet fed le. A nyelvi, valamint a tárolóméret szerinti eloszlás a GitHub teljes platformjára jellemző mintázatot követi. A pull requestek méretét ugyanakkor a közepes és nagyobb, érdemi ellenőrzést igénylő változtatások felé súlyozták, hogy ne a kisebb, egyetlen fájlt érintő módosítások domináljanak.

Több forrásból építették fel az ellenőrzési alapot

A GitHub szerint egyetlen emberi ellenőr vagy modell sem képes minden releváns problémát megtalálni egy pull requestben. Ezért a ReviewBench aranykészlete több forrásból származó megállapításokra épül. A készítők valódi emberi kódellenőrzésekből, a szerzők későbbi javító commitjaiból kikövetkeztetett hibákból, statikus elemzőeszközökből és több, különböző modellcsaládba tartozó fejlett nyelvi modellből gyűjtöttek jelölteket.

Az átfedő megállapításokat szemantikailag egyesítették, majd közös értékelési szabályzat alapján vizsgálták. Egy találat csak akkor számít helyesnek, ha tényszerű, releváns és nem triviális. A GitHub a Claude Sonnet 5 modellt használta értékelőként, és közzétette az alkalmazott szabályzatot, valamint az értékelő eszközt is.

A rendszer a problémákat súlyosság és kategória szerint is címkézi. Így külön vizsgálhatók például a kritikus, közepes és alacsony súlyosságú hibák, illetve a helyességhez, biztonsághoz, megbízhatósághoz, karbantarthatósághoz és teszteléshez kapcsolódó találatok.

Hat mutatóval és különböző fejlesztői igények szerint mér

A ReviewBench két mutatócsaládot használ. A grounded precision, grounded recall és grounded F1 kizárólag a már ismert, aranykészletben szereplő problémák alapján hasonlítja össze az ügynököket. Az augmented precision, augmented recall és augmented F1 azokat a találatokat is értékeli, amelyek nem egyeznek az előre rögzített problémákkal.

Az utóbbi esetben az értékelő külön dönti el, hogy az újonnan jelzett hiba valódi vagy téves pozitív találat-e. Ez lehetővé teszi, hogy egy rendszer elismerést kapjon olyan valós problémákért is, amelyeket az alapadatok összeállítói nem azonosítottak. A GitHub a grounded recallt használja fő, rendszerek közötti összehasonlítási mutatóként, az augmented mérőszámokat pedig az egyes rendszerek további diagnosztikájára.

A felhasználók a találatokat súlyosság és kategória szerint szűrhetik, és a pontosságot vagy a lefedettséget helyezhetik előtérbe. Az Fβ-mutató β értéke módosítható, így a szélesebb hibafeltárás vagy az alacsonyabb zaj kaphat nagyobb súlyt. Ennek megfelelően a rendszerek sorrendje is változhat.

Független ellenőrzéssel és nyilvános adatokkal indul

A benchmark kiadása előtt a készítésben részt nem vevő vezető mérnökök minden aranykészletben szereplő találatot újraértékeltek. A GitHub közlése szerint a két címkézés 96,6 százalékban egyezett. A vállalat verziózza az adatállományt, az értékelőt és az összehasonlításhoz használt egyeztetőt, így az eredmények azonos beállítások mellett újra előállíthatók.

A ReviewBench kutatási előzetese a benchmark webhelyén érhető el. A teljes adatkészlet nyilvános, a felhasználók megvizsgálhatják a pull requesteket, a találatokat és a címkéket, összehasonlíthatják a kódellenőrző ügynököket, valamint saját rendszerüket is értékelhetik. A GitHub szerint a ReviewBench offline eredményei a Copilot code review esetében hatékonyabban jelezték előre a gyártási kísérletek irányát, ami segíthet annak felmérésében, hogy egy mért javulás a felhasználói élményben is megjelenhet-e.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A Cloudflare OS vállalati munkateret ad az ügynököknek
Termékek és eszközök2026. október 1. 15:00

A Cloudflare OS vállalati munkateret ad az ügynököknek

A Cloudflare megnyitotta a teljesen kezelt Cloudflare OS várólistáját. A vállalat ügynöki munkateret kínál, amely a cég adataihoz és rendszereihez kapcsolódhat, miközben…

A Cloudflare OS céges AI-munkateret kínál, menedzselt formában
Termékek és eszközök2026. október 1. 15:00

A Cloudflare OS céges AI-munkateret kínál, menedzselt formában

A Cloudflare megnyitotta a várólistát a teljes körűen menedzselt Cloudflare OS-telepítésekhez. A vállalat szerint a rendszer olyan AI-munkateret ad minden szervezeti…

A Factory Automations ismétlődő fejlesztési feladatokat végez el
Termékek és eszközök2026. szeptember 30.

A Factory Automations ismétlődő fejlesztési feladatokat végez el

A Factory általánosan elérhetővé tette az Automations funkciót, amellyel a felhasználók ismétlődő fejlesztési és csapatmunka-folyamatokat automatizálhatnak. A Droid…