A CodeRabbit szerint a Fable 5.1 pontosabban, de lassabban review-zik

A Fable 5.1 a CodeRabbit tesztjeiben kevesebb és pontosabb kódreview-megjegyzést készített, mint a Fable 5, viszont egy feladat ellenőrzése átlagosan több időt vett igénybe. A vállalat szerint a modell elsősorban összetett módosításokhoz lehet megfelelő.
- A Fable 5.1 pontossága 32,8 százalékról 37,3 százalékra javult.
- A végső megjegyzések száma 253-ról 166-ra csökkent.
- Az átlagos review-idő 12 perc 32 másodpercről 18 perc 38 másodpercre nőtt.
- A Low beállítás jobb összesített eredményt ért el a High módnál.
- A CodeRabbit összetett kódolási és review-feladatokra ajánlja a modellt.
Kevesebb megjegyzés, jobb pontosság
A CodeRabbit szeptember 1-jén közzétett értékelése 45 kódreview-feladatra és 105 ismert hibapontra épült. A Fable 5.1 a hibapontok 61,0 százalékát találta meg, vagyis 64-et a 105-ből. A Fable 5 ugyanezen összehasonlításban 65 hibapontot azonosított, 61,9 százalékos visszahívással.
A pontosság közben 32,8 százalékról 37,3 százalékra nőtt. A feldolgozás után a Fable 5.1 166 végső megjegyzést hagyott, a korábbi modell 253 megjegyzéséhez képest. A nitpick jellegű, kisebb jelentőségű észrevételek száma 265-ről 79-re csökkent.
A CodeRabbit hangsúlyozza, hogy az összevetés irányt jelez, mivel a két értékelés eltérő verziójú review-rendszert használt. A 37,3 százalékos pontosság egyben azt is jelenti, hogy a végső megjegyzések többségét a teszt bírája nem jelölte érvényesnek.
A hosszabb gondolkodás nem hozott jobb eredményt
A vállalat két beállítást vizsgált. A Low kevesebb, a High több következtetési munkát engedett a modellnek. Mindkettő 45 feladatot teljesített, feladatonként körülbelül 2,0 fájlellenőrzési hívással.
A Low beállítás 61,0 százalékos visszahívást és 37,3 százalékos pontosságot ért el, az egy feladatra jutó átlagos idő 18 perc 38 másodperc volt. A High 57,1 százalékos visszahívást és 36,4 százalékos pontosságot produkált, miközben 21 perc 36 másodpercig dolgozott feladatonként. A CodeRabbit szerint a több következtetés néhány nehéz esetben segített, de az összesített eredményben lassabb működéssel és kevesebb megtalált hibaponttal járt.
A Fable 5.1 a Fable 5-höz képest 12 perc 32 másodpercről 18 perc 38 másodpercre növelte az átlagos review-időt. Ez 6 perc 6 másodperces, 48,7 százalékos emelkedés.
Összetett kódolási feladatokban lehet erős
A CodeRabbit megfigyelései szerint a Fable 5.1 szerkesztés előtt gyakran ellenőrizte a rendelkezésre álló eszközöket és erőforrásokat, majd tervet készített. Egyszerű feladatoknál gyorsnak tűnt, összetettebb, több következtetést igénylő munkáknál viszont lassabb volt a korábbi Fable-verzióknál.
Egy nehezebb tesztben egy meglévő, egyjátékos Snake alkalmazást kellett ötszereplős, önállóan működő kígyók arénájává alakítania. A játék 20 × 20-as pályán futott, a kígyók külön stratégiákat használtak, és a megoldásnak a böngészőben, valamint parancssori szimulátorban is ugyanazokat a determinisztikus eredményeket kellett adnia. A rögzített mérkőzés a 793. körig jutott, ekkor még két kígyó életben volt.
A CodeRabbit ajánlása szerint a Fable 5.1-et szelektíven érdemes használni. Összetett változtatásoknál hasznos lehet, amikor az átfogó hibafeltárás fontosabb a sebességnél, rutinszerű pull requestekhez viszont gyorsabb és pontosabb alapbeállítást javasolnak. A modellnek világos célt, elegendő projektkörnyezetet és tervezési időt érdemes adni.
CodeRabbit: Fable 5.1 review: Coding tests and code review results


