A LanceDB szerint a Jev gyors és versenyképes reranker

A LanceDB öt adathalmazon és 19, előre elkészített reranker-konfigurációval vetette össze a TypeSafe Jev modelljét. A vállalat szerint a Jev gyors és versenyképes, miközben a keresés pontosságát jelentősen befolyásolja, hogyan fogalmazzák meg a relevanciára vonatkozó kérdést.
- A LanceDB 19 reranker-konfigurációt vizsgált öt adathalmazon.
- A Jev pontszáma a relevanciára vonatkozó kérdés megfogalmazásától is függ.
- HotpotQA-n a szélesebb utasítás 92,67 százalékról 97,70 százalékra javította a hibrid Hit@10 értéket.
- A TypeSafeReranker vektoros, teljes szöveges és hibrid kereséssel is használható.
- A LanceDB szerint nincs minden feladaton legjobb reranker.
A Jev a találatok relevanciáját értékeli
A LanceDB szeptember 27-én közzétett mérnöki bemutatója szerint a vektorkeresés szemantikailag hasonló, a teljes szöveges keresés pedig szó szerinti egyezéseket talál. A reranker ezután a lekérdezés és a visszakapott dokumentumok alapján pontozza a jelölteket, hogy az alkalmazás átrendezhesse őket, vagy szemantikai szűrést alkalmazhasson.
A Jev a TypeSafe System One modellje. Állapotot és típusos kérdéseket fogad, Noul primitívje pedig egy nulla és egy közötti becsült valószínűséget ad vissza arra, hogy igaz-e egy állítás. A LanceDB beépített TypeSafeReranker komponense ezt az értéket relevanciapontszámként használja. A találatok így sorba rendezhetők, vagy küszöbérték alapján szűrhetők.
A rendszer előnye, hogy a relevancia feltétele a kérdésben is megadható. Egy szálláskereső alkalmazás például külön vizsgálhatja, hogy egy értékelés alátámasztja-e a csendes éjszakákra, a gyors házigazdai válaszokra vagy a gyermekbarát környezetre vonatkozó elvárást. A LanceDB ezt a Stay Lens bemutatóval szemlélteti, amely Barcelona szállásait jeleníti meg térképen, az egyes szempontokhoz tartozó pontszámokkal és értékelésrészletekkel.
A kérdés átírása javította a HotpotQA eredményét
A benchmark alapértelmezett utasítása azt kérdezte, hogy a dokumentum megválaszolja-e vagy közvetlenül tárgyalja-e a lekérdezést. A LanceDB szerint ez túl szűk lehet többlépcsős kérdéseknél, ahol egy dokumentum csak egy köztes tényt vagy entitást azonosít.
A HotpotQA hibrid keresésében az alapértelmezett Jev 92,67 százalékos Hit@10 értéket ért el, szemben az RRF alapvonal 96,19 százalékával. Amikor az utasítást erre módosították: „Releváns a dokumentum a lekérdezéshez?”, és már a részleges választ segítő információt is relevánsnak számították, a Hit@10 97,70 százalékra, a Hit@1 pedig 72,87 százalékról 85,24 százalékra nőtt.
A szélesebb értelmezés a 45 adathalmaz, keresési mód és vágópont kombinációjából 41 esetben elérte vagy meghaladta az alapértelmezett változat eredményét. A négy kivétel mind a FiQA adathalmazhoz tartozott, a visszaesés legfeljebb 0,77 százalékpont volt. A LanceDB hangsúlyozza, hogy a relevanciára vonatkozó utasítást minden feladathoz külön kell validálni, például elkülönített tesztlekérdezéseken.
Öt adathalmazon vizsgálták a rerankereket
A tesztben a GooAQ, az NQ, a HotpotQA, a FiQA és a SciDocs szerepelt. A kutatók mindegyik reranker számára ugyanazokat a jelölteket biztosították: a LanceDB 50 vektortalálatot és 50 BM25-találatot gyűjtött, a hibrid keresés pedig ezek legfeljebb 100 elemes, duplikációktól megtisztított unióját használta. Az összevetésben 19 konfiguráció, köztük három ColBERT-modell háromféle token-összevonási tényezővel szerepelt.
A GooAQ esetében 20 000 véletlenszerűen kiválasztott lekérdezést vetettek össze 100 000 válasszal. A többi adathalmaz minden tesztlekérdezése bekerült a mérésbe: az NQ 3452, a HotpotQA 7405, a FiQA 648, a SciDocs pedig 1000 lekérdezést tartalmazott. A nyílt modelleket egy H100 GPU-n, a Jevet API-n futtatták. A LanceDB következtetése szerint nincs minden feladaton legjobb reranker, ezért a választásnál a munkafolyamat relevanciafogalma, sebességigénye és keresési módja közötti kompromisszumokat kell mérlegelni.
A Jev közvetlenül használható LanceDB-ben
A LanceDB példája a TypeSafeRerankert használja vektoros, teljes szöveges és hibrid találatok újrarangsorolására. A bemutatott kód egyszerre legfeljebb 40 független dokumentumértékelést küld, és legfeljebb négy kérés futhat párhuzamosan. A keresés először 20 jelöltet gyűjt, majd az újrarangsorolás után öt találatot ad vissza.
A natív komponens a hibrid találatokat összevonja és eltávolítja a duplikátumokat, megőrzi a sorazonosítókat, valamint hozzáadja a _relevance_score mezőt. A LanceDB szerint a megoldás nagyobb korpuszokon is lehetővé teszi, hogy a kezdeti lista alsóbb helyeiről relevánsabb szövegrészek kerüljenek előre. A konkrét felhasználási feladatokra azonban a megfelelő kérdés megfogalmazását külön kell ellenőrizni.
LanceDB: How Jev Compares to Other Rerankers


