Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Qodo: az extra AI-kódellenőrzés egy hasznos rést talált, de hibákat is kért

2026. október 5. 18:41Forrás: Qodo
Qodo: az extra AI-kódellenőrzés egy hasznos rést talált, de hibákat is kért
Kép: Qodo

A Jev strukturált ítéletalkotó modell egy további kötelező tesztelési rést talált a Qodo ellenőrzései után, de újonnan igazolt hibát nem azonosított. A vizsgálat szerint az extra ellenőrzés három esetben nem kellően alátámasztott aggályokat is generált.

A lényeg röviden
  • Jev 24 értékelési esetből egy további szükséges tesztelési rést talált.
  • A modell nem azonosított újonnan megerősített hibát.
  • Három esetben nem kellően alátámasztott aggályokat jelzett.
  • A javítási kérések száma 18-ról 21-re nőtt.
  • A Qodo szerint a Jev hozzáadásának nettó előnye egyelőre ismeretlen.

Egy hiányzó tesztet talált a 24 esetből

A Qodo 24 értékelési esetben vizsgálta, hogy mit ad hozzá a Jev, a TypeSafe strukturált ítéletalkotó modellje a kiválasztott automatizált ellenőrzésekhez és a Qodo kódellenőrzéséhez képest. A kombinált munkafolyamat egy további, szükséges ellenőrzési rést azonosított, újonnan megerősített hibát azonban nem talált.

A vizsgálat egyik példája a Controlled Release Lab fokozatos kiadásokat kezelő rendszere volt. A c020 esetben a kód helyesen állította le a kiadást, amikor egy munkaterület lekérdezései lelassultak, miközben az összesített késleltetés egészséges maradt. A benyújtott tesztek az egészséges működést, az összesített hibát és az érvénytelen megfigyeléseket lefedték, de a munkaterülethez kötött elszigetelést nem.

Egy független próba a kiválasztott munkaterület kéréseit 900 ezredmásodpercre lassította, miközben az összesített p95 érték 20 ezredmásodperc maradt. A p95 a rögzített késleltetések 95. percentilise. A hiányzó tesztnek azt kellett volna igazolnia, hogy a QUERY_LATENCY_HOLD kód szerepel az eredményben, miközben a LATENCY_HOLD nem. A Qodo hat megállapítása más problémákra vonatkozott, az értékelés pedig ezek között nem talált rá erre a hiányosságra.

Három esetben nem kellett volna javítást kérni

Jev a c013, c014 és c028 esetben nem kellően alátámasztott aggályokat jelzett. A c028 feladatban a rendszernek legalább 55 másodperc után fel kellett szabadítania a tétlen kliensek bejegyzéseit, miközben megőrizte négy aktív párhuzamossági engedélyét. A benyújtott teszt több mint 1024 felszabadított klienst vizsgált, és egy külön, másodpercenként 20 kérést küldő próba is sikeres volt.

A kombinált munkafolyamatban Jev mindhárom menetben szabálysértést és hiányzó lefedettséget jelzett, a szabálysértéshez tartozó bizalma pedig meghaladta a 0,8-at. A rögzített szabályzat szerint az ilyen jelzések javítási kéréssé válnak. Így a Qodo eredeti ellenőrzési kérése javítási kéréssé alakult, noha ezt a megnevezett követelmény nem támasztotta alá.

A javítási kérések száma 18-ról 21-re nőtt. Ebből két olyan újrakategorizált hiba volt, amelyet a Qodo már azonosított, egy pedig a c028 esethez kapcsolódott. A vizsgálat szerint egyik sem volt újonnan megerősített hiba. A 0,8-as bizalmi érték nem azt jelenti, hogy a válasz 80 százalékban helyes, vagy hogy a változtatás biztonságos.

Korlátozott összehasonlítás, jelentős erőforrásigény

A protokoll négy munkafolyamatot vetett össze: a kiválasztott ellenőrzéseket, azokat Qodóval kiegészítve, azokat Jevvel kiegészítve, valamint mindhárom rendszert együtt. Hat pilot- és 24 értékelési eset szerepelt benne. A Jev-modellt jev-1.13.0 verzióban rögzítették, a Qodo CLI teljes, 1.0.3-as ellenőrzéseit pedig azonosságvizsgálat után újra felhasználták.

A Qodo hozzáfért a tárházhoz, Jev viszont rögzített forrás- és tesztbizonyítékot kapott. Emiatt az összehasonlítás nem alkalmas arra, hogy azonos feltételek mellett rangsorolja a modelleket. A kiválasztott tesztcsomagok, a típusellenőrzés és a build sem képviselte a teljes CI-környezetet.

A Qodo nyolc előre beültetett hibát és a 16 szükséges résből 15-öt azonosított. Mindkét Jev-munkafolyamat mind a 16 rés ellenőrzését kérte. A teljes gyűjtés 252 hívást tartalmazott, a jelentett bemeneti tokenfelhasználás pedig megközelítőleg 3,88 millió volt, a pilotokkal együtt. A 24 értékelési esetben a kombinált munkafolyamat mediánja a szokásos eseteknél 0,62 másodperc, egy lekérdezéses menet öt HTTP-kérésének összegeként 3,26 másodperc volt.

A Qodo szerint az eredmények további lefedettségi vizsgálatot indokolnak, de a nettó előny egyelőre ismeretlen. A következő értékelésekhez új eseteket és a karbantartói munkaráfordítás mérését javasolja. Az extra ítéletek befolyását név szerint meghatározott viselkedésekhez, nyomon követhető bizonyítékokhoz és megőrzött blokkolókhoz kötné.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A LanceDB szerint gyors és versenyképes a Jev újrarangsoroló
Kutatás2026. október 1. 05:58

A LanceDB szerint gyors és versenyképes a Jev újrarangsoroló

A LanceDB öt adathalmazon hasonlította össze a Jev újrarangsorolót 19 konfigurációval. A vállalat szerint a Jev gyors és versenyképes, miközben a találatok relevanciáját…

A LanceDB szerint a Jev gyors és versenyképes reranker
Kutatás2026. október 1. 05:58

A LanceDB szerint a Jev gyors és versenyképes reranker

A LanceDB öt adathalmazon és 19, előre elkészített reranker-konfigurációval vetette össze a TypeSafe Jev modelljét. A vállalat szerint a Jev gyors és versenyképes…

A Jev gépi döntéseket ad az alkalmazások kezébe szöveg nélkül
Fejlesztőknek2026. október 1.

A Jev gépi döntéseket ad az alkalmazások kezébe szöveg nélkül

A TypeSafe Jev nevű AI-modellje osztályozási, pontozási és útválasztási feladatokra készült. A rendszer szöveges válasz helyett közvetlenül felhasználható, típusos…