Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A CodeRabbit szerint a Fable 5.1 pontosabban, de lassabban review-zik

2026. szeptember 1.Forrás: CodeRabbit
A CodeRabbit szerint a Fable 5.1 pontosabban, de lassabban review-zik
Kép: CodeRabbit

A Fable 5.1 a CodeRabbit tesztjeiben kevesebb és pontosabb kódreview-megjegyzést készített, mint a Fable 5, viszont egy feladat ellenőrzése átlagosan több időt vett igénybe. A vállalat szerint a modell elsősorban összetett módosításokhoz lehet megfelelő.

A lényeg röviden
  • A Fable 5.1 pontossága 32,8 százalékról 37,3 százalékra javult.
  • A végső megjegyzések száma 253-ról 166-ra csökkent.
  • Az átlagos review-idő 12 perc 32 másodpercről 18 perc 38 másodpercre nőtt.
  • A Low beállítás jobb összesített eredményt ért el a High módnál.
  • A CodeRabbit összetett kódolási és review-feladatokra ajánlja a modellt.

Kevesebb megjegyzés, jobb pontosság

A CodeRabbit szeptember 1-jén közzétett értékelése 45 kódreview-feladatra és 105 ismert hibapontra épült. A Fable 5.1 a hibapontok 61,0 százalékát találta meg, vagyis 64-et a 105-ből. A Fable 5 ugyanezen összehasonlításban 65 hibapontot azonosított, 61,9 százalékos visszahívással.

A pontosság közben 32,8 százalékról 37,3 százalékra nőtt. A feldolgozás után a Fable 5.1 166 végső megjegyzést hagyott, a korábbi modell 253 megjegyzéséhez képest. A nitpick jellegű, kisebb jelentőségű észrevételek száma 265-ről 79-re csökkent.

A CodeRabbit hangsúlyozza, hogy az összevetés irányt jelez, mivel a két értékelés eltérő verziójú review-rendszert használt. A 37,3 százalékos pontosság egyben azt is jelenti, hogy a végső megjegyzések többségét a teszt bírája nem jelölte érvényesnek.

A hosszabb gondolkodás nem hozott jobb eredményt

A vállalat két beállítást vizsgált. A Low kevesebb, a High több következtetési munkát engedett a modellnek. Mindkettő 45 feladatot teljesített, feladatonként körülbelül 2,0 fájlellenőrzési hívással.

A Low beállítás 61,0 százalékos visszahívást és 37,3 százalékos pontosságot ért el, az egy feladatra jutó átlagos idő 18 perc 38 másodperc volt. A High 57,1 százalékos visszahívást és 36,4 százalékos pontosságot produkált, miközben 21 perc 36 másodpercig dolgozott feladatonként. A CodeRabbit szerint a több következtetés néhány nehéz esetben segített, de az összesített eredményben lassabb működéssel és kevesebb megtalált hibaponttal járt.

A Fable 5.1 a Fable 5-höz képest 12 perc 32 másodpercről 18 perc 38 másodpercre növelte az átlagos review-időt. Ez 6 perc 6 másodperces, 48,7 százalékos emelkedés.

Összetett kódolási feladatokban lehet erős

A CodeRabbit megfigyelései szerint a Fable 5.1 szerkesztés előtt gyakran ellenőrizte a rendelkezésre álló eszközöket és erőforrásokat, majd tervet készített. Egyszerű feladatoknál gyorsnak tűnt, összetettebb, több következtetést igénylő munkáknál viszont lassabb volt a korábbi Fable-verzióknál.

Egy nehezebb tesztben egy meglévő, egyjátékos Snake alkalmazást kellett ötszereplős, önállóan működő kígyók arénájává alakítania. A játék 20 × 20-as pályán futott, a kígyók külön stratégiákat használtak, és a megoldásnak a böngészőben, valamint parancssori szimulátorban is ugyanazokat a determinisztikus eredményeket kellett adnia. A rögzített mérkőzés a 793. körig jutott, ekkor még két kígyó életben volt.

A CodeRabbit ajánlása szerint a Fable 5.1-et szelektíven érdemes használni. Összetett változtatásoknál hasznos lehet, amikor az átfogó hibafeltárás fontosabb a sebességnél, rutinszerű pull requestekhez viszont gyorsabb és pontosabb alapbeállítást javasolnak. A modellnek világos célt, elegendő projektkörnyezetet és tervezési időt érdemes adni.

Kapcsolódó hírek

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél
Kutatás2026. október 1.

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél

Az összetett, több ügynököt és külön keresőmodulokat használó gépi tanulási mérnöki rendszerek nem bizonyultak jobbnak egy egyszerű kódoló ügynöknél azonos időkeret és…

Az Apple kutatása szerint kevésbé számít az ügynökök körítése
Kutatás2026. október 1.

Az Apple kutatása szerint kevésbé számít az ügynökök körítése

Az Apple kutatói szerint a gépi tanulási feladatokra fejlesztett ügynököknél az alapul szolgáló nagy nyelvi modell teljesítménye fontosabb lehet az ügynök köré épített…

A Claude Sonnet 5.5 több hibát talált, feleannyi idő alatt
Modellek2026. szeptember 28.

A Claude Sonnet 5.5 több hibát talált, feleannyi idő alatt

A CodeRabbit tesztjeiben a Claude Sonnet 5.5 több ismert hibát talált meg a Sonnet 5-nél, miközben körülbelül feleannyi idő alatt futott le. A javulás ára az, hogy a…