A Qdrant a Jev osztályozót tesztelte keresésen és rangsoroláson

A Qdrant több keresési feladaton próbálta ki a TypeSafe Jev döntési modelljét, amelyet az OpenRouter szolgáltat. A vállalat szerint a modell szöveggenerálás nélkül, rögzített címkék közül választva használható rangsorolásra, változatosság növelésére és lekérdezések értelmezésére.
- A Jev címkézett tanítás nélkül, rögzített kategóriákra osztályoz.
- A Qdrant 100 NFCorpus-lekérdezésen tesztelte a rangsorolást.
- A Jev Score 0,0665 és 0,0741 nDCG@10 javulást ért el.
- A Jev és az MMR kombinációja csökkentette az ismétlődő találatokat.
- A kategóriaalapú használat fél és két másodperc közötti többletet adott.
A Jev a leírásra épülő osztályozást célozza
A Qdrant október 8-i bejegyzése szerint a gépi tanulásban az osztályozás régi feladatnak számít. A korábbi megközelítések között szerepelt saját, címkézett adatokkal tanított osztályozó készítése, zérólövéses osztályozó használata, illetve nagy nyelvi modell promptolása.
A vállalat a Jevet olyan döntési modellként írja le, amelynél nem szükséges minden feladathoz új modellt tanítani. A felhasználó leírhatja a kívánt osztályozást, a modell pedig a megadott címkékhez kötött kimenetet ad. A Qdrant összehasonlítása szerint a Jev gyors, nem igényel tanítást vagy új címkék létrehozását futás közben, és a kimenete eleve korlátozható a címkékre.
A megközelítés a Qdrant értelmezésében az úgynevezett „describe it, don’t train it”, vagyis „írd le, ne tanítsd” irányt viszi tovább. A cég szerint a Jev az általános célú nyelvi modellekhez képest a lassú válaszokat, a költségeket és a nem kívánt, címkéken kívüli válaszokat kezeli célzottabban.
Rangsorolásban a Jev minden vizsgált változata javított
A keresőrendszerekben a hibrid keresés gyakran megtalálja a hasznos találatokat, de azok sorrendje további javításra szorulhat. A Qdrant ezért 100 NFCorpus-lekérdezésen tesztelte a Jevet, a Qdrantból BGE-small modellel kiválasztott 30 és 50 találat újrarangsorolásával.
A Jev Score 0,0665, illetve 0,0741 nDCG@10 javulást ért el a top 30 és top 50 jelöltnél. A Jev Choice eredménye 0,0583 és 0,0673, a tíz kérést használó Jev Iterative eredménye pedig 0,0746 és 0,0789 volt. Összehasonlításként a helyben futtatott ms-marco-MiniLM-L-6-v2 0,0313 és 0,0258 javulást hozott, a bge-reranker-base pedig mínusz 0,0015 és mínusz 0,0127 értéket.
A Qdrant szerint a legdrágább, iteratív módszer csak kis különbséggel bizonyult jobbnak, ezért alapértelmezettként a Jev Score-t választották. A Jev numerikus pontszámot ad, így a találatok közvetlenül rendezhetők, szöveg feldolgozása nélkül.
A változatosság és a lekérdezés értelmezése is javítható
A Qdrant egy 240 lekérdezésből álló WANDS-teszten azt vizsgálta, hogyan csökkenthető az első tíz találat ismétlődése. A Jev önálló újrarangsorolása 0,769 nDCG@10 értéket ért el, de 1,25 közeli duplikátum maradt oldalanként, és átlagosan 2,41 termékkategória jelent meg. A Qdrant MMR 0,5-ös diverzitással szélesebb választékot adott, 4,74 kategóriával és nulla közeli duplikátummal, ugyanakkor az nDCG@10 értéke 0,561 lett.
A Jev pontszámának MMR-rel való kombinálása 0,04 közeli duplikátumot, 3,12 kategóriát és 0,723 nDCG@10 értéket eredményezett. Ez a Qdrant szerint a hibrid keresésnél jobb relevanciát és kisebb ismétlődést adott.
A vállalat a lekérdezések értelmezését is tesztelte. A kategória legalább 0,9-es Jev-pontszámnál szűrhetett, 0,5 és 0,9 között pedig csak erősíthette a megfelelő termékeket. A 300 Amazon-C4 keresésen vizsgált beállítások közül ez a kombináció teljesített a legjobban. A Jev lekérdezésenként fél és két másodperc közötti többletet adott, a kategóriák számától függően. A Qdrant példái szerint ez segített a „kitchen faucet replacement” keresésnél, viszont az „apple” lekérdezésnél a túl szűk kategória eltávolította a releváns MacBook- és laptopdekal-találatokat is.


