Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

SPLADE-Code: ritka keresőmodelleket fejlesztettek kódhoz

2026. október 4.Forrás: NAVER LABS Europe
SPLADE-Code: ritka keresőmodelleket fejlesztettek kódhoz
Kép: NAVER LABS Europe

A NAVER LABS Europe bemutatta a SPLADE-Code modellsorozatot, amelyet kifejezetten forráskódok keresésére fejlesztettek. A kutatók szerint a rendszer 1 millió szövegrészből álló gyűjteményben ezredmásodperc alatti keresést is lehetővé tehet, csekély teljesítményvesztés mellett.

A lényeg röviden
  • A SPLADE-Code kódkeresésre specializált tanult ritka keresőmodellek családja.
  • A modellek mérete 600 millió és 8 milliárd paraméter között van.
  • A rendszer 75,4-es eredményt ért el az MTEB Code mérésén 1 milliárd paraméter alatt.
  • Az 8 milliárd paraméteres változat 79,0-s eredményt ért el.
  • A kutatók szerint 1 millió szövegrészen ezredmásodperc alatti keresés is elérhető.

A kódkeresés új megközelítése

A nagy kódbázisokban végzett keresés fontos része a modern, nagy nyelvi modellekre épülő szoftverfejlesztő rendszereknek. A jelenlegi megoldások többsége sűrű vektorreprezentációkat használ, miközben a tanult ritka keresés, angolul learned sparse retrieval, kódok esetében kevésbé feltárt terület.

A NAVER LABS Europe kutatói szerint a módszer alkalmazását több tényező nehezíti. Ilyen a forráskódok feldarabolása részszavakra, a természetes nyelvű lekérdezések és a kód közötti szemantikai eltérés, a programozási nyelvek és feladatok sokfélesége, valamint a kóddokumentumok nagy hossza. Ezek a tényezők ronthatják a ritkaságot és a keresés késleltetését.

600 milliótól 8 milliárd paraméterig

A kutatók SPLADE-Code néven mutatták be a tanult ritka keresőmodellek első, nagy léptékű, kódkeresésre specializált családját. A modellek mérete 600 millió és 8 milliárd paraméter között változik.

A közlemény szerint a SPLADE-Code könnyű, egyetlen szakaszból álló betanítási folyamatot használ. A 1 milliárd paraméternél kisebb keresőmodellek között a rendszer a NAVER LABS Europe állítása szerint jelenleg a legjobb eredményt érte el, 75,4-es pontszámmal az MTEB Code mérésén. A nagyobb, 8 milliárd paraméteres változat 79,0-s eredményt ért el, ami a kutatók szerint versenyképes teljesítmény.

A fejlesztők azt is megállapították, hogy a tanult bővítési tokenek kulcsszerepet játszanak a szavak pontos egyezésére épülő és a jelentésalapú keresés összekapcsolásában. Ezek a tokenek lehetővé teszik, hogy a lekérdezés és a kód között akkor is létrejöjjön kapcsolat, ha a két oldal szókészlete eltér.

Gyorsabb lekérdezés nagy kódbázisokban

A tanulmány késleltetési elemzése szerint a tanult ritka keresés 1 millió szövegrészből álló gyűjteményen ezredmásodperc alatti lekérdezést tesz lehetővé. A kutatók ezt csak csekély hatékonyságvesztés mellett mérték.

Az eredmény a nagy kódbázisokat használó, nyelvi modellekre épülő szoftverfejlesztő rendszerek szempontjából lehet fontos. A keresőkomponens feladata, hogy a fejlesztői kérdésekhez vagy egy adott feladathoz kapcsolódó kódrészleteket megtalálja. A forrás alapján a SPLADE-Code ezt a feladatot ritka reprezentációkkal közelíti meg, miközben a kutatók a nagyobb modelleknél is versenyképes eredményeket jelentettek.

A publikáció szerzői Simon Lupart, Maxime Louis, Thibault Formal, Hervé Déjean és Stéphane Clinchant. A tanulmány az Empirical Methods in Natural Language Processing konferencia eredményei között szerepel, amelyet Budapesten rendeznek meg 2026. október 24. és 29. között. A NAVER LABS Europe közlése szerint a publikációt Stéphane Clinchant jegyzi, dátuma 2026. október 24.

Kapcsolódó hírek

A beszédre optimalizált szöveg generálását kutatja a NAVER LABS Europe
Kutatás2026. október 4.

A beszédre optimalizált szöveg generálását kutatja a NAVER LABS Europe

A NAVER LABS Europe olyan nagy nyelvi modellek fejlesztését vizsgálja, amelyek közvetlenül beszédszintézishez alkalmas szöveget állítanak elő. A kutatók szerint a…

A tapasztalatokból tanuló LLM-ügynökök módszerét mutatta be a NAVER
Kutatás2026. október 4.

A tapasztalatokból tanuló LLM-ügynökök módszerét mutatta be a NAVER

A NAVER LABS Europe kutatói olyan nagy nyelvi modellekre épülő ügynökök betanítási módszerét mutatták be, amely a korábbi tapasztalatok visszakeresését és a felügyelt…

A látható minták még nem bizonyítják, hogyan gondolkodik egy AI
Kutatás2026. október 4.

A látható minták még nem bizonyítják, hogyan gondolkodik egy AI

A NAVER LABS Europe kutatása szerint a látens gondolkodási modellekben megfigyelhető minták önmagukban nem bizonyítják, hogy a modellek valóban az ezekhez társított…