A CodeRabbit olcsóbban és pontosabban tanította be az NVIDIA modelljét

A CodeRabbit az NVIDIA Nemotron 3.5 Lightning modellt tanította be a kódellenőrzések útválasztására. A modell az utótréning után pontosabban követte a vállalat szabályait, miközben a becsült következtetési költség mintegy felére csökkent.
- A CodeRabbit 39 566 nyilvános példából indította a kísérletet.
- Az útválasztási egyezés 75,8 százalékról 80,7 százalékra nőtt.
- A Cohen-féle kappa az RLVR után 0,544 lett.
- A finomhangolt modell A100-on, 314,82 token/másodperc sebességgel futott.
- A becsült kiszolgálási költség 50,4 százalékkal csökkent.
Kódellenőrzések útválasztására tanították be
A CodeRabbit minden kódellenőrzés elején eldönti, milyen beállításokkal kell lefuttatni a felülvizsgálatot. A rendszer a kódmódosításokat kiértékeli, majd a modell kimenetét ellenőrzési konfigurációvá alakítja. Mivel az útválasztás nagy mennyiségben végzett modellfeladat, a vállalat azt vizsgálta, hogy egy kisebb modell képes-e megbízhatóan ellátni ezt a munkát.
A választás az NVIDIA Nemotron 3.5 Lightning modelljére esett. A CodeRabbit szerint a modell erős kódválaszokat adott, mérete pedig lehetővé tette, hogy kisebb infrastruktúrán is hatékonyan fusson. A vállalat az NVIDIA-val és a Basetennel közösen kétlépcsős utótréninget végzett. Először felügyelt finomhangolást (SFT), majd ellenőrizhető jutalmazású megerősítéses tanulást (RLVR) alkalmaztak.
A munkában az NVIDIA NeMo AutoModel és NeMo RL keretrendszerei, a Baseten menedzselt NVIDIA H100 Training Jobs és A100 Dedicated Inference szolgáltatásai, valamint a CodeRabbit kódellenőrzési adatai és értékelési rendszere vett részt. A bejelentés 2026. augusztus 11-én jelent meg.
A finomhangolás 4 százalékponttal javította a pontosságot
A kísérlethez nyilvános tárolókból 39 566 példát gyűjtöttek. Az adatokat tárolónként választották szét, hogy elkerüljék a tanító- és értékelési adatok átfedését. A szűrés és a tokenizáló pontos ellenőrzése után 9996 példa került a fő SFT-adathalmazba, a rögzített értékelési készlet pedig 1000 feladatból állt.
A tanító példákat tudásdesztillációval hozták létre. Egy erősebb modell referencia-útválasztási döntést készített minden kódmódosításhoz, ezeket az eredményeket megszűrték, majd a megmaradt példákkal tanították a Nemotron 3.5 Lightninget.
A felügyelt finomhangolást a NeMo AutoModellel, a Baseten NVIDIA H100 Training Jobs környezetében végezték. Rank-8 LoRA-adaptereket használtak egy tanítási cikluson keresztül, három tanulási sebességet kipróbálva. A 2e-4-es beállítás adta a legalacsonyabb validációs veszteséget mind az öt ellenőrzési ponton, ezért az 1249. lépésnél készült adaptert vitték tovább.
A korábbi GPT-alapú modell 75,8 százalékos pontos útválasztási egyezést ért el az 1000 feladatos értékelésen. Az SFT után ez 80,4 százalékra nőtt. A Cohen-féle kappa alapján mért kimeneti egyezés 0,429-ről 0,461-re javult.
Az RLVR javította a kimenetek egyezését
A második szakaszban a NeMo RL nyílt keretrendszerével, NVIDIA H100 GPU-kon futtattak RLVR-t GRPO-val. Ehhez az első szakasz LoRA-adapterét beolvasztották az alapmodell súlyaiba. A tanítás 910 kiválasztott kérésen zajlott, a modellt minden 25. lépés után értékelték, és akkor állították le, amikor a validációs eredmény nem javult tovább.
Az SFT és az RLVR együttes alkalmazása 80,7 százalékos pontos útválasztási egyezést eredményezett, miközben a Cohen-féle kappa 0,544-re emelkedett. Az SFT-hez képest az útválasztási eredmény 0,3 százalékponttal javult, a kappa pedig 0,0835-tel nőtt. A CodeRabbit szerint az útválasztási különbség páros konfidenciaintervalluma áthaladt a nullán, ezért ezt az eredményt nem tekintik statisztikailag döntő javulásnak. A kimeneti egyezés növekedését egyértelműbb RLVR-eredményként értékelték.
A végső modell mind az 1000 kérést teljesítette, üres vagy szokatlanul rövid kimenet nélkül. Ez kizárja az összeomlás nyilvánvaló jeleit, de a tartós terhelés és a termelési forgalom vizsgálata még hátravan.
A modell A100-on is futhat, és kevesebbe kerülhet
A Nemotron 3.5 Lightning kompakt mérete lehetővé tette, hogy a végső modellt NVIDIA A100 rendszeren szolgálják ki H100 helyett. A Baseten Dedicated Inference a kombinált SFT- és RLVR-kimenetet rank-16 LoRA-ként töltötte be az eredeti modell fölé. A kiszolgálás vLLM-en, egy 80 GiB kapacitású A100-on futott.
Nyolc párhuzamos kérés mellett a mért összesített kimeneti sebesség másodpercenként 314,82 token volt. Ugyanazon 1000 feladatos értékelésnél az OpenAI modelljének költsége a nyilvános árak alapján 2,34 dollárra jött ki. A Baseten erőforrás-táblázata szerint az A100 használata a mért csúcsteljesítmény mellett 1,16 dollárba került.
Ez 1,18 dolláros, vagyis 50,4 százalékos becsült megtakarítást jelentett. A finomhangolt modell ezen a feladaton 63,4 százalékkal kevesebb kimeneti tokent is generált, mint az alapmodell. A CodeRabbit szerint az eredmények alapján a Nemotron 3.5 Lightning más, nagy mennyiségben futtatott, szűk feladatokra is alkalmas jelölt lehet a vállalat folyamatában. A termelési használat előtt azonban további terhelési ellenőrzésekre van szükség.
CodeRabbit: Teaching NVIDIA Nemotron 3.5 Lightning to route code reviews


