Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A CodeRabbit olcsóbban és pontosabban tanította be az NVIDIA modelljét

2026. augusztus 11. 15:00Forrás: CodeRabbit
A CodeRabbit olcsóbban és pontosabban tanította be az NVIDIA modelljét
Kép: CodeRabbit

A CodeRabbit az NVIDIA Nemotron 3.5 Lightning modellt tanította be a kódellenőrzések útválasztására. A modell az utótréning után pontosabban követte a vállalat szabályait, miközben a becsült következtetési költség mintegy felére csökkent.

A lényeg röviden
  • A CodeRabbit 39 566 nyilvános példából indította a kísérletet.
  • Az útválasztási egyezés 75,8 százalékról 80,7 százalékra nőtt.
  • A Cohen-féle kappa az RLVR után 0,544 lett.
  • A finomhangolt modell A100-on, 314,82 token/másodperc sebességgel futott.
  • A becsült kiszolgálási költség 50,4 százalékkal csökkent.

Kódellenőrzések útválasztására tanították be

A CodeRabbit minden kódellenőrzés elején eldönti, milyen beállításokkal kell lefuttatni a felülvizsgálatot. A rendszer a kódmódosításokat kiértékeli, majd a modell kimenetét ellenőrzési konfigurációvá alakítja. Mivel az útválasztás nagy mennyiségben végzett modellfeladat, a vállalat azt vizsgálta, hogy egy kisebb modell képes-e megbízhatóan ellátni ezt a munkát.

A választás az NVIDIA Nemotron 3.5 Lightning modelljére esett. A CodeRabbit szerint a modell erős kódválaszokat adott, mérete pedig lehetővé tette, hogy kisebb infrastruktúrán is hatékonyan fusson. A vállalat az NVIDIA-val és a Basetennel közösen kétlépcsős utótréninget végzett. Először felügyelt finomhangolást (SFT), majd ellenőrizhető jutalmazású megerősítéses tanulást (RLVR) alkalmaztak.

A munkában az NVIDIA NeMo AutoModel és NeMo RL keretrendszerei, a Baseten menedzselt NVIDIA H100 Training Jobs és A100 Dedicated Inference szolgáltatásai, valamint a CodeRabbit kódellenőrzési adatai és értékelési rendszere vett részt. A bejelentés 2026. augusztus 11-én jelent meg.

A finomhangolás 4 százalékponttal javította a pontosságot

A kísérlethez nyilvános tárolókból 39 566 példát gyűjtöttek. Az adatokat tárolónként választották szét, hogy elkerüljék a tanító- és értékelési adatok átfedését. A szűrés és a tokenizáló pontos ellenőrzése után 9996 példa került a fő SFT-adathalmazba, a rögzített értékelési készlet pedig 1000 feladatból állt.

A tanító példákat tudásdesztillációval hozták létre. Egy erősebb modell referencia-útválasztási döntést készített minden kódmódosításhoz, ezeket az eredményeket megszűrték, majd a megmaradt példákkal tanították a Nemotron 3.5 Lightninget.

A felügyelt finomhangolást a NeMo AutoModellel, a Baseten NVIDIA H100 Training Jobs környezetében végezték. Rank-8 LoRA-adaptereket használtak egy tanítási cikluson keresztül, három tanulási sebességet kipróbálva. A 2e-4-es beállítás adta a legalacsonyabb validációs veszteséget mind az öt ellenőrzési ponton, ezért az 1249. lépésnél készült adaptert vitték tovább.

A korábbi GPT-alapú modell 75,8 százalékos pontos útválasztási egyezést ért el az 1000 feladatos értékelésen. Az SFT után ez 80,4 százalékra nőtt. A Cohen-féle kappa alapján mért kimeneti egyezés 0,429-ről 0,461-re javult.

Az RLVR javította a kimenetek egyezését

A második szakaszban a NeMo RL nyílt keretrendszerével, NVIDIA H100 GPU-kon futtattak RLVR-t GRPO-val. Ehhez az első szakasz LoRA-adapterét beolvasztották az alapmodell súlyaiba. A tanítás 910 kiválasztott kérésen zajlott, a modellt minden 25. lépés után értékelték, és akkor állították le, amikor a validációs eredmény nem javult tovább.

Az SFT és az RLVR együttes alkalmazása 80,7 százalékos pontos útválasztási egyezést eredményezett, miközben a Cohen-féle kappa 0,544-re emelkedett. Az SFT-hez képest az útválasztási eredmény 0,3 százalékponttal javult, a kappa pedig 0,0835-tel nőtt. A CodeRabbit szerint az útválasztási különbség páros konfidenciaintervalluma áthaladt a nullán, ezért ezt az eredményt nem tekintik statisztikailag döntő javulásnak. A kimeneti egyezés növekedését egyértelműbb RLVR-eredményként értékelték.

A végső modell mind az 1000 kérést teljesítette, üres vagy szokatlanul rövid kimenet nélkül. Ez kizárja az összeomlás nyilvánvaló jeleit, de a tartós terhelés és a termelési forgalom vizsgálata még hátravan.

A modell A100-on is futhat, és kevesebbe kerülhet

A Nemotron 3.5 Lightning kompakt mérete lehetővé tette, hogy a végső modellt NVIDIA A100 rendszeren szolgálják ki H100 helyett. A Baseten Dedicated Inference a kombinált SFT- és RLVR-kimenetet rank-16 LoRA-ként töltötte be az eredeti modell fölé. A kiszolgálás vLLM-en, egy 80 GiB kapacitású A100-on futott.

Nyolc párhuzamos kérés mellett a mért összesített kimeneti sebesség másodpercenként 314,82 token volt. Ugyanazon 1000 feladatos értékelésnél az OpenAI modelljének költsége a nyilvános árak alapján 2,34 dollárra jött ki. A Baseten erőforrás-táblázata szerint az A100 használata a mért csúcsteljesítmény mellett 1,16 dollárba került.

Ez 1,18 dolláros, vagyis 50,4 százalékos becsült megtakarítást jelentett. A finomhangolt modell ezen a feladaton 63,4 százalékkal kevesebb kimeneti tokent is generált, mint az alapmodell. A CodeRabbit szerint az eredmények alapján a Nemotron 3.5 Lightning más, nagy mennyiségben futtatott, szűk feladatokra is alkalmas jelölt lehet a vállalat folyamatában. A termelési használat előtt azonban további terhelési ellenőrzésekre van szükség.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

NVIDIA Blackwell GPU-kon gyorsul az OpenAI GPT-6 Astra Ultrafast
Modellek2026. október 2. 01:44

NVIDIA Blackwell GPU-kon gyorsul az OpenAI GPT-6 Astra Ultrafast

Az NVIDIA 2026. október 1-jén közölte, hogy az OpenAI GPT-6 Astra Ultrafast módja NVIDIA Blackwell GPU-kon fut, és már elérhető az OpenAI API-ban, valamint jogosult…

A Claude Sonnet 5.5 több hibát talált, feleannyi idő alatt
Modellek2026. szeptember 28.

A Claude Sonnet 5.5 több hibát talált, feleannyi idő alatt

A CodeRabbit tesztjeiben a Claude Sonnet 5.5 több ismert hibát talált meg a Sonnet 5-nél, miközben körülbelül feleannyi idő alatt futott le. A javulás ára az, hogy a…

A Claude Opus 5.5 több hibát találhat, de több megjegyzést is generál
Modellek2026. szeptember 22.

A Claude Opus 5.5 több hibát találhat, de több megjegyzést is generál

A Claude Opus 5.5 a CodeRabbit tesztjeiben kissé több ismert hibát talált a vállalat éles modellmixénél, miközben alacsonyabb műveleti pontosságot és több megjegyzést…