Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Olcsó módszerrel csökkentené a többnyelvű RAG nyelvi torzítását a Qdrant

2026. szeptember 16. 09:00Forrás: Qdrant
Olcsó módszerrel csökkentené a többnyelvű RAG nyelvi torzítását a Qdrant
Kép: Qdrant

A többnyelvű RAG-rendszerek gyakran a kérdés nyelvén keresnek választ akkor is, ha egy másik nyelvű dokumentum relevánsabb lenne. A Qdrant egy friss kutatás alapján a vektorok indexelés előtti eltolásával mérsékelné ezt a problémát.

A lényeg röviden
  • A többnyelvű embedding modellek a jelentés mellett a nyelv szerint is csoportosíthatnak.
  • Az XRAG tesztben az azonos nyelvű releváns válasz 61, a más nyelvű 8 százalékban került a top 10-be.
  • A SHIFT nyelvi offsetek kivonásával javítja a vektoros keresés összehangolását.
  • A multilingual-e5-large nDCG@20 értéke 0,633-ról 0,737-re nőtt a tanulmány benchmarkjain.
  • A Qdrant szerint a módszer használata előtt az azonos nyelvű találatok esetleges romlását is mérni kell.

A szemantikus keresésnél is számít a nyelv

A többnyelvű RAG, vagyis a kereséssel kiegészített szöveggenerálás olyan tudásbázisokon működik, amelyek dokumentumai és kérdései több nyelvet kevernek. Ez különösen gyakori lehet olyan európai vállalatoknál, amelyek belső anyagai két vagy három nyelven készülnek.

Elvileg a többnyelvű beágyazási modellek, például a multilingual-e5-small vagy a bge-m3, ugyanabba a vektortérbe helyezik az azonos jelentésű szövegeket. A Qdrant szerint azonban ezek a modellek a jelentés mellett a nyelv alapján is csoportosítják a szövegeket. Emiatt egy német kérdésre nagyobb eséllyel érkezik német válasz, akkor is, ha a jobb találat angolul érhető el.

A Qdrant az XRAG 15 277, öt nyelven készült híranyagán vizsgálta a jelenséget. Az azonos nyelvű, releváns válasz a találati lista első tíz helyére az esetek 61 százalékában került be, míg az ugyanilyen releváns, más nyelvű válasz csak 8 százalékban.

A SHIFT a nyelvi eltolást korrigálja

A vizsgált, 2026 júniusában bemutatott SHIFT módszer a nyelvet egy nagyjából állandó vektoreltolásként kezeli. A módszer fordítási párokból számítja ki, hogy egy adott nyelv vektorai milyen irányban térnek el a választott pivotnyelv vektoraitól, majd ezt az eltolást kivonja a dokumentumok beágyazásaiból.

Az eltolás meghatározásához a kutatás 533 ezer párhuzamos mMARCO fordítási párt használ. Indexeléskor a nem pivotnyelvű dokumentumok vektorait egy, az adott nyelvhez tartozó offset és egy alfa érték segítségével módosítják. A Qdrant leírása szerint a lekérdezéseket is hasonló módon kell kezelni, ha azok több nyelven érkeznek.

A módszer előnye, hogy nem igényel újratanítást, fordítási folyamatot vagy nyelvenként külön indexet. Ezzel szemben a fordításos megközelítés minden dokumentumhoz nyelvenkénti másolatokat és külön kereséseket igényelhet. Egy nagyobb modell használata szintén költségesebb lehet: a Qdrant összehasonlítása szerint a Qwen3-Embedding-8B 4096 dimenziós vektorokat készít, míg a multilingual-e5-small 384 dimenziósakat.

A kutatásban javult a többnyelvű visszakeresés

A SHIFT tanulmányban a multilingual-e5-large átlagos nDCG@20 értéke 0,633-ról 0,737-re emelkedett a vizsgált benchmarkokon. A Qdrant szerint a Target-Languages Recall@20 nevű, kereszt​​nyelvű visszakeresést mérő mutató javult a legnagyobb mértékben.

A Qdrant saját ellenőrzéséhez a kisebb, 384 dimenziós intfloat/multilingual-e5-small modellt választotta. Az XRAG adathalmaz 15 277 angol, német, spanyol, arab és kínai nyelvű hírcikket, valamint 6200, emberek által megválaszolt kérdést tartalmaz. A kérdések 83 százalékához más nyelven is található releváns válasz, és csak 34 százalékukhoz van releváns válasz a kérdés nyelvén.

A Qdrant a pontos vektoros keresés mellett a saját HNSW-indexével is tesztelte a módszert, mert az eltolás elméletileg ronthatja a közelítő keresés gráfjának minőségét. Az adathalmazhoz egyszerű nyelvfelismerőt használtak, amely összességében körülbelül 74 százalékos pontosságot ért el. A német és spanyol szövegeknél zajosabb eredményt adott, míg arab és kínai esetén megbízhatóbbnak bizonyult.

A gyártási használathoz még vizsgálni kell a kompromisszumokat

A Qdrant szerint a SHIFT egyik nyitott kérdése, hogy a javuló kereszt​​nyelvű találatok mellett nem romlik-e az azonos nyelvű visszakeresés. Egy eltolás után előfordulhat, hogy a rendszer már nem a kérdés nyelvén található legrelevánsabb választ rangsorolja a legmagasabbra.

Szintén kérdéses, hogy egy nyelv eltolása különböző témák és adathalmazok esetén is újra felhasználható-e, vagy mindig az adott tartományhoz kell megbecsülni. A Qdrant ezért a módszert olcsó, újratanítás nélküli lehetőségként mutatja be, amelyet termelési környezetben a nyelvi és keresési metrikák együttes vizsgálatával kell ellenőrizni.

Kapcsolódó hírek

A Qdrant Constella modelljeivel újraágyazás nélkül váltható a keresőmodell
Kutatás2026. szeptember 29.

A Qdrant Constella modelljeivel újraágyazás nélkül váltható a keresőmodell

A Qdrant bemutatta a Constella kutatási előzetesét, amely lehetővé teszi, hogy ugyanazon dokumentumvektorok mellett változtassák a lekérdezésekhez használt…

A Qdrant Constella modelljei újrabeágyazás nélkül cserélhetők
Kutatás2026. szeptember 29.

A Qdrant Constella modelljei újrabeágyazás nélkül cserélhetők

A Qdrant bemutatta a Constella kutatási előzetesét, amely lehetővé teszi, hogy ugyanabban a vektoradatbázisban a lekérdezésekhez használt modellt újrabeágyazás nélkül…

Rustban írták újra a cross-encoder inferenciát, de nem mindenhol lett gyorsabb
Fejlesztőknek2026. szeptember 25.

Rustban írták újra a cross-encoder inferenciát, de nem mindenhol lett gyorsabb

A Qdrant Rustban írta újra a cross-encoder modellek futtatását, majd Python-alapú könyvtárakkal hasonlította össze. A cross-encode-rs kis modellen csak mérsékelten…