SPLADE-Code: ritka keresőmodelleket fejlesztettek kódhoz

A NAVER LABS Europe bemutatta a SPLADE-Code modellsorozatot, amelyet kifejezetten forráskódok keresésére fejlesztettek. A kutatók szerint a rendszer 1 millió szövegrészből álló gyűjteményben ezredmásodperc alatti keresést is lehetővé tehet, csekély teljesítményvesztés mellett.
- A SPLADE-Code kódkeresésre specializált tanult ritka keresőmodellek családja.
- A modellek mérete 600 millió és 8 milliárd paraméter között van.
- A rendszer 75,4-es eredményt ért el az MTEB Code mérésén 1 milliárd paraméter alatt.
- Az 8 milliárd paraméteres változat 79,0-s eredményt ért el.
- A kutatók szerint 1 millió szövegrészen ezredmásodperc alatti keresés is elérhető.
A kódkeresés új megközelítése
A nagy kódbázisokban végzett keresés fontos része a modern, nagy nyelvi modellekre épülő szoftverfejlesztő rendszereknek. A jelenlegi megoldások többsége sűrű vektorreprezentációkat használ, miközben a tanult ritka keresés, angolul learned sparse retrieval, kódok esetében kevésbé feltárt terület.
A NAVER LABS Europe kutatói szerint a módszer alkalmazását több tényező nehezíti. Ilyen a forráskódok feldarabolása részszavakra, a természetes nyelvű lekérdezések és a kód közötti szemantikai eltérés, a programozási nyelvek és feladatok sokfélesége, valamint a kóddokumentumok nagy hossza. Ezek a tényezők ronthatják a ritkaságot és a keresés késleltetését.
600 milliótól 8 milliárd paraméterig
A kutatók SPLADE-Code néven mutatták be a tanult ritka keresőmodellek első, nagy léptékű, kódkeresésre specializált családját. A modellek mérete 600 millió és 8 milliárd paraméter között változik.
A közlemény szerint a SPLADE-Code könnyű, egyetlen szakaszból álló betanítási folyamatot használ. A 1 milliárd paraméternél kisebb keresőmodellek között a rendszer a NAVER LABS Europe állítása szerint jelenleg a legjobb eredményt érte el, 75,4-es pontszámmal az MTEB Code mérésén. A nagyobb, 8 milliárd paraméteres változat 79,0-s eredményt ért el, ami a kutatók szerint versenyképes teljesítmény.
A fejlesztők azt is megállapították, hogy a tanult bővítési tokenek kulcsszerepet játszanak a szavak pontos egyezésére épülő és a jelentésalapú keresés összekapcsolásában. Ezek a tokenek lehetővé teszik, hogy a lekérdezés és a kód között akkor is létrejöjjön kapcsolat, ha a két oldal szókészlete eltér.
Gyorsabb lekérdezés nagy kódbázisokban
A tanulmány késleltetési elemzése szerint a tanult ritka keresés 1 millió szövegrészből álló gyűjteményen ezredmásodperc alatti lekérdezést tesz lehetővé. A kutatók ezt csak csekély hatékonyságvesztés mellett mérték.
Az eredmény a nagy kódbázisokat használó, nyelvi modellekre épülő szoftverfejlesztő rendszerek szempontjából lehet fontos. A keresőkomponens feladata, hogy a fejlesztői kérdésekhez vagy egy adott feladathoz kapcsolódó kódrészleteket megtalálja. A forrás alapján a SPLADE-Code ezt a feladatot ritka reprezentációkkal közelíti meg, miközben a kutatók a nagyobb modelleknél is versenyképes eredményeket jelentettek.
A publikáció szerzői Simon Lupart, Maxime Louis, Thibault Formal, Hervé Déjean és Stéphane Clinchant. A tanulmány az Empirical Methods in Natural Language Processing konferencia eredményei között szerepel, amelyet Budapesten rendeznek meg 2026. október 24. és 29. között. A NAVER LABS Europe közlése szerint a publikációt Stéphane Clinchant jegyzi, dátuma 2026. október 24.
NAVER LABS Europe: On the challenges and opportunities of learned sparse retrieval for code


