Ötezer Kaggle-versenyző mutatta meg, hogyan javítható az AI érvelése

Több mint 5000 résztvevő és 4000 csapat dolgozott az NVIDIA Nemotron Model Reasoning Challenge feladatain, ahol azonos modell és korlátozások mellett kellett javítani az érvelési pontosságot. A verseny tapasztalatai szerint a jó eredményhez az ellenőrzött tanítási nyomok, a hatékony tokenhasználat és a megtanulandó struktúrák elkülönítése is fontos.
- Több mint 5000 résztvevő dolgozott 4000 Kaggle-csapatban.
- A verseny a Nemotron-3-Nano-30B modellre és LoRA-adapterekre épült.
- A tanítási érvelési nyomokat köztes lépéseik alapján is ellenőrizni kell.
- A tömör reprezentáció segíthet a tokenkeret hatékonyabb használatában.
- A közösségi megosztás gyorsította a hibák feltárását és a módszerek újrahasznosítását.
Azonos modell, szigorú feltételek
Az NVIDIA Developer július 14-i beszámolója szerint a kihívás a Kaggle közösségét kérte fel annak vizsgálatára, milyen módszerekkel javítható az érvelés pontossága, ha minden csapat ugyanabból a nyílt modellből, azonos infrastruktúrából és rögzített értékelési feltételekből indul. A résztvevők a Nemotron-3-Nano-30B modellt használhatták, és LoRA-adaptereket adhattak be legfeljebb 32-es rankkel.
Az értékelés idején nem lehetett internetet használni, az interferenciakódosítás sem volt engedélyezett, teljes modell beadására pedig nem volt lehetőség. A végső pontszámot privát ranglista alapján számították. Minden megoldásnak fel kellett ismernie a rejtett átalakítást, érvelési nyomot kellett készítenie, majd a végső választ is vissza kellett adnia a rendelkezésre álló tokenkereten belül.
A csapatok azonos Google Cloud G4 virtuális gépeken, NVIDIA RTX PRO 6000 Blackwell GPU-kkal dolgoztak. Így a versenyzők az infrastruktúra kezelése helyett az adatokra, az érvelési folyamatokra és a modell finomhangolására összpontosíthattak.
Az érvelési nyomokat ellenőrizni kell
Az NVIDIA szerint a legerősebb megoldások szintetikus, lépéseket bemutató érvelési adatokat készítettek, de ezeket nem használták fel automatikusan. A csapatok előbb ellenőrizték, hogy a nyomok valóban működnek-e, és szükség esetén javították őket.
A beszámoló egyik fő tanulsága, hogy a meggyőzőnek tűnő érvelési nyom is megtaníthat hibás rövidítéseket. Ezért a köztes lépéseket is vizsgálni kell, nem elég csak a végső válasz helyességét ellenőrizni. Erre megoldók, szabályellenőrzők, tesztek vagy emberi felülvizsgálat is használható.
Az NVIDIA által ismertetett első helyezett megoldás szintetikus feladatokat és megoldó által készített érvelési nyomokat generált, majd felügyelt finomhangolással, SFT-vel tanította ezekre a modellt. A második helyezett beszámolója hasonlóan külön kezelte a szintetikus kérdések és a tanításhoz használt érvelési nyomok előállítását.
A tokenkeret és a memória szerepe
A versenyzők több erős megoldásnál a tokenkeretet az érvelési feladat részének tekintették, nem pusztán futásidejű korlátnak. A hosszú nyomok akkor is kudarcot okozhattak, ha a helyes logikát tartalmazták, például ismétlések vagy túl részletes adatreprezentáció miatt elfogyhatott a hely a válasz előtt.
A beszámoló szerint a tömörítés célja a logika megőrzése, miközben a modell több kontextust hagyhat a nehéz lépésekre és az ellenőrzésre. A versenyben bitmanipulációs stratégia, HEX, valamint hibrid hexadecimális és bináris aláírások is szerepet kaptak.
A harmadik tanulság a stabilan újrahasznosítható struktúrák és az aktuális feladat megoldásának szétválasztása. Sémák, képletek, operátorminták, szimbolikus megfelelések és gyakori hibák tárolhatók vagy visszakereshetők, miközben a modell az adott eset megoldására fordítja az érvelési keretét. Az NVIDIA szerint ez nem a válaszok bemagolását jelenti, hanem a minden alkalommal újra elvégzendő struktúrafelismerés csökkentését.
A közösségi együttműködés szintén fontosnak bizonyult. A több mint 1000 fórumbejegyzésben a résztvevők hibákat, szélsőséges eseteket és működő kísérleteket osztottak meg, amelyekből újra felhasználható technikák alakultak ki. A tapasztalatok a modellfejlesztők számára azt mutatják, hogy az érvelési teljesítmény javítása az adatok, a nyomok, az ellenőrzés és a kontextushasználat összehangolt mérnöki feladata.
NVIDIA Developer: Lessons From the Leaderboard: What 5,000+ Kagglers Taught Us About Improving AI Reasoning
