Olcsó módszerrel csökkentené a többnyelvű RAG nyelvi torzítását a Qdrant

A többnyelvű RAG-rendszerek gyakran a kérdés nyelvén keresnek választ akkor is, ha egy másik nyelvű dokumentum relevánsabb lenne. A Qdrant egy friss kutatás alapján a vektorok indexelés előtti eltolásával mérsékelné ezt a problémát.
- A többnyelvű embedding modellek a jelentés mellett a nyelv szerint is csoportosíthatnak.
- Az XRAG tesztben az azonos nyelvű releváns válasz 61, a más nyelvű 8 százalékban került a top 10-be.
- A SHIFT nyelvi offsetek kivonásával javítja a vektoros keresés összehangolását.
- A multilingual-e5-large nDCG@20 értéke 0,633-ról 0,737-re nőtt a tanulmány benchmarkjain.
- A Qdrant szerint a módszer használata előtt az azonos nyelvű találatok esetleges romlását is mérni kell.
A szemantikus keresésnél is számít a nyelv
A többnyelvű RAG, vagyis a kereséssel kiegészített szöveggenerálás olyan tudásbázisokon működik, amelyek dokumentumai és kérdései több nyelvet kevernek. Ez különösen gyakori lehet olyan európai vállalatoknál, amelyek belső anyagai két vagy három nyelven készülnek.
Elvileg a többnyelvű beágyazási modellek, például a multilingual-e5-small vagy a bge-m3, ugyanabba a vektortérbe helyezik az azonos jelentésű szövegeket. A Qdrant szerint azonban ezek a modellek a jelentés mellett a nyelv alapján is csoportosítják a szövegeket. Emiatt egy német kérdésre nagyobb eséllyel érkezik német válasz, akkor is, ha a jobb találat angolul érhető el.
A Qdrant az XRAG 15 277, öt nyelven készült híranyagán vizsgálta a jelenséget. Az azonos nyelvű, releváns válasz a találati lista első tíz helyére az esetek 61 százalékában került be, míg az ugyanilyen releváns, más nyelvű válasz csak 8 százalékban.
A SHIFT a nyelvi eltolást korrigálja
A vizsgált, 2026 júniusában bemutatott SHIFT módszer a nyelvet egy nagyjából állandó vektoreltolásként kezeli. A módszer fordítási párokból számítja ki, hogy egy adott nyelv vektorai milyen irányban térnek el a választott pivotnyelv vektoraitól, majd ezt az eltolást kivonja a dokumentumok beágyazásaiból.
Az eltolás meghatározásához a kutatás 533 ezer párhuzamos mMARCO fordítási párt használ. Indexeléskor a nem pivotnyelvű dokumentumok vektorait egy, az adott nyelvhez tartozó offset és egy alfa érték segítségével módosítják. A Qdrant leírása szerint a lekérdezéseket is hasonló módon kell kezelni, ha azok több nyelven érkeznek.
A módszer előnye, hogy nem igényel újratanítást, fordítási folyamatot vagy nyelvenként külön indexet. Ezzel szemben a fordításos megközelítés minden dokumentumhoz nyelvenkénti másolatokat és külön kereséseket igényelhet. Egy nagyobb modell használata szintén költségesebb lehet: a Qdrant összehasonlítása szerint a Qwen3-Embedding-8B 4096 dimenziós vektorokat készít, míg a multilingual-e5-small 384 dimenziósakat.
A kutatásban javult a többnyelvű visszakeresés
A SHIFT tanulmányban a multilingual-e5-large átlagos nDCG@20 értéke 0,633-ról 0,737-re emelkedett a vizsgált benchmarkokon. A Qdrant szerint a Target-Languages Recall@20 nevű, keresztnyelvű visszakeresést mérő mutató javult a legnagyobb mértékben.
A Qdrant saját ellenőrzéséhez a kisebb, 384 dimenziós intfloat/multilingual-e5-small modellt választotta. Az XRAG adathalmaz 15 277 angol, német, spanyol, arab és kínai nyelvű hírcikket, valamint 6200, emberek által megválaszolt kérdést tartalmaz. A kérdések 83 százalékához más nyelven is található releváns válasz, és csak 34 százalékukhoz van releváns válasz a kérdés nyelvén.
A Qdrant a pontos vektoros keresés mellett a saját HNSW-indexével is tesztelte a módszert, mert az eltolás elméletileg ronthatja a közelítő keresés gráfjának minőségét. Az adathalmazhoz egyszerű nyelvfelismerőt használtak, amely összességében körülbelül 74 százalékos pontosságot ért el. A német és spanyol szövegeknél zajosabb eredményt adott, míg arab és kínai esetén megbízhatóbbnak bizonyult.
A gyártási használathoz még vizsgálni kell a kompromisszumokat
A Qdrant szerint a SHIFT egyik nyitott kérdése, hogy a javuló keresztnyelvű találatok mellett nem romlik-e az azonos nyelvű visszakeresés. Egy eltolás után előfordulhat, hogy a rendszer már nem a kérdés nyelvén található legrelevánsabb választ rangsorolja a legmagasabbra.
Szintén kérdéses, hogy egy nyelv eltolása különböző témák és adathalmazok esetén is újra felhasználható-e, vagy mindig az adott tartományhoz kell megbecsülni. A Qdrant ezért a módszert olcsó, újratanítás nélküli lehetőségként mutatja be, amelyet termelési környezetben a nyelvi és keresési metrikák együttes vizsgálatával kell ellenőrizni.
Qdrant: SHIFTing Languages in Multilingual RAG


