Qodo: az extra AI-kódellenőrzés egy hasznos rést talált, de hibákat is kért

A Jev strukturált ítéletalkotó modell egy további kötelező tesztelési rést talált a Qodo ellenőrzései után, de újonnan igazolt hibát nem azonosított. A vizsgálat szerint az extra ellenőrzés három esetben nem kellően alátámasztott aggályokat is generált.
- Jev 24 értékelési esetből egy további szükséges tesztelési rést talált.
- A modell nem azonosított újonnan megerősített hibát.
- Három esetben nem kellően alátámasztott aggályokat jelzett.
- A javítási kérések száma 18-ról 21-re nőtt.
- A Qodo szerint a Jev hozzáadásának nettó előnye egyelőre ismeretlen.
Egy hiányzó tesztet talált a 24 esetből
A Qodo 24 értékelési esetben vizsgálta, hogy mit ad hozzá a Jev, a TypeSafe strukturált ítéletalkotó modellje a kiválasztott automatizált ellenőrzésekhez és a Qodo kódellenőrzéséhez képest. A kombinált munkafolyamat egy további, szükséges ellenőrzési rést azonosított, újonnan megerősített hibát azonban nem talált.
A vizsgálat egyik példája a Controlled Release Lab fokozatos kiadásokat kezelő rendszere volt. A c020 esetben a kód helyesen állította le a kiadást, amikor egy munkaterület lekérdezései lelassultak, miközben az összesített késleltetés egészséges maradt. A benyújtott tesztek az egészséges működést, az összesített hibát és az érvénytelen megfigyeléseket lefedték, de a munkaterülethez kötött elszigetelést nem.
Egy független próba a kiválasztott munkaterület kéréseit 900 ezredmásodpercre lassította, miközben az összesített p95 érték 20 ezredmásodperc maradt. A p95 a rögzített késleltetések 95. percentilise. A hiányzó tesztnek azt kellett volna igazolnia, hogy a QUERY_LATENCY_HOLD kód szerepel az eredményben, miközben a LATENCY_HOLD nem. A Qodo hat megállapítása más problémákra vonatkozott, az értékelés pedig ezek között nem talált rá erre a hiányosságra.
Három esetben nem kellett volna javítást kérni
Jev a c013, c014 és c028 esetben nem kellően alátámasztott aggályokat jelzett. A c028 feladatban a rendszernek legalább 55 másodperc után fel kellett szabadítania a tétlen kliensek bejegyzéseit, miközben megőrizte négy aktív párhuzamossági engedélyét. A benyújtott teszt több mint 1024 felszabadított klienst vizsgált, és egy külön, másodpercenként 20 kérést küldő próba is sikeres volt.
A kombinált munkafolyamatban Jev mindhárom menetben szabálysértést és hiányzó lefedettséget jelzett, a szabálysértéshez tartozó bizalma pedig meghaladta a 0,8-at. A rögzített szabályzat szerint az ilyen jelzések javítási kéréssé válnak. Így a Qodo eredeti ellenőrzési kérése javítási kéréssé alakult, noha ezt a megnevezett követelmény nem támasztotta alá.
A javítási kérések száma 18-ról 21-re nőtt. Ebből két olyan újrakategorizált hiba volt, amelyet a Qodo már azonosított, egy pedig a c028 esethez kapcsolódott. A vizsgálat szerint egyik sem volt újonnan megerősített hiba. A 0,8-as bizalmi érték nem azt jelenti, hogy a válasz 80 százalékban helyes, vagy hogy a változtatás biztonságos.
Korlátozott összehasonlítás, jelentős erőforrásigény
A protokoll négy munkafolyamatot vetett össze: a kiválasztott ellenőrzéseket, azokat Qodóval kiegészítve, azokat Jevvel kiegészítve, valamint mindhárom rendszert együtt. Hat pilot- és 24 értékelési eset szerepelt benne. A Jev-modellt jev-1.13.0 verzióban rögzítették, a Qodo CLI teljes, 1.0.3-as ellenőrzéseit pedig azonosságvizsgálat után újra felhasználták.
A Qodo hozzáfért a tárházhoz, Jev viszont rögzített forrás- és tesztbizonyítékot kapott. Emiatt az összehasonlítás nem alkalmas arra, hogy azonos feltételek mellett rangsorolja a modelleket. A kiválasztott tesztcsomagok, a típusellenőrzés és a build sem képviselte a teljes CI-környezetet.
A Qodo nyolc előre beültetett hibát és a 16 szükséges résből 15-öt azonosított. Mindkét Jev-munkafolyamat mind a 16 rés ellenőrzését kérte. A teljes gyűjtés 252 hívást tartalmazott, a jelentett bemeneti tokenfelhasználás pedig megközelítőleg 3,88 millió volt, a pilotokkal együtt. A 24 értékelési esetben a kombinált munkafolyamat mediánja a szokásos eseteknél 0,62 másodperc, egy lekérdezéses menet öt HTTP-kérésének összegeként 3,26 másodperc volt.
A Qodo szerint az eredmények további lefedettségi vizsgálatot indokolnak, de a nettó előny egyelőre ismeretlen. A következő értékelésekhez új eseteket és a karbantartói munkaráfordítás mérését javasolja. Az extra ítéletek befolyását név szerint meghatározott viselkedésekhez, nyomon követhető bizonyítékokhoz és megőrzött blokkolókhoz kötné.
Qodo: Does Jev make AI code review more efficient?


