A Qdrant Constella modelljeivel újraágyazás nélkül váltható a keresőmodell

A Qdrant bemutatta a Constella kutatási előzetesét, amely lehetővé teszi, hogy ugyanazon dokumentumvektorok mellett változtassák a lekérdezésekhez használt embeddingmodellt. A Zero, Nano és Stella modellek között kérésenként lehet váltani, így a számítási igény a feladathoz igazítható.
- A Constella lehetővé teszi a lekérdezési modell cseréjét dokumentum-újraágyazás nélkül.
- A Zero, Nano és Stella ugyanazokat a Stella dokumentumvektorokat használja.
- A 15 BEIR-adatkészlet átlaga szerint a Nano a Stella pontszámának körülbelül 91 százalékát érte el.
- Egy 20 szavas lekérdezés kódolása a Zeronál 0,081, a Nanónál 3,131 ezredmásodperc volt.
- A Constella jelenleg kutatási előzetes, a teljes kiadás belső felülvizsgálat alatt áll.
Egy dokumentumindex, három lekérdezési modell
A Qdrant szeptember 29-én ismertetett Constella modellcsaládja a Hugging Face-en érhető el kutatási előzetesként. A megoldás alapja a 400 millió paraméteres Stella angol nyelvű embeddingmodell. A dokumentumokat Stella kódolja, a lekérdezésekhez pedig a Constella Zero, a Constella Nano vagy maga a Stella használható.
A dokumentumvektort több ezer kereséshez újra fel lehet használni, miközben egy lekérdezési vektor jellemzően csak egy kereséshez készül. A Qdrant ezért a nagyobb számítási igényt a dokumentumoldalra helyezi, a lekérdezési oldalon pedig többféle modellt kínál. A modellek ugyanabban a Qdrant-gyűjteményben keresnek, ezért a lekérdezési modell cseréje nem igényli a dokumentumok újraágyazását.
- Constella Zero: tokenek vektorait keresi ki, összevonja és normalizálja, így minimális lekérdezési számítást igényel.
- Constella Nano: egy 34,5 millió paraméteres transzformátor, amely figyelembe veszi a tokenek közötti kapcsolatokat és azok sorrendjét.
- Full Stella: 400 millió paraméteres transzformátor, a család legmagasabb általános visszakeresési pontosságával.
A Nano közel marad a Stella pontosságához
A Qdrant a három modellt 15 BEIR-adatkészleten vizsgálta. A tesztekben mindegyik lekérdezési modell ugyanazokat a Stella által létrehozott dokumentumvektorokat használta. Az értékelt mutató az nDCG@10 volt, amely azt méri, mennyire jól kerülnek a releváns dokumentumok az első tíz találat közé.
A 15 adatkészlet átlaga alapján a Zero 0,4572-es, a Nano 0,5081-es, a teljes Stella pedig 0,5614-es értéket ért el. A Qdrant szerint a Nano a Stella átlagos pontszámának körülbelül 91 százalékát őrizte meg, miközben jóval kisebb transzformátort használ. A Zero összességében gyengébb eredményt adott, de a FEVER, a HotpotQA és a Climate-FEVER adatkészleten megelőzte a Nanót.
A Nano 199 999 721 példán tanult, hogy a rögzített Stella-embeddingeket utánozza, és a Stella 1024 dimenziós terébe vetíti a jellemzőket. A Qdrant külön figyelmeztetett arra, hogy négy adatkészletnél a Stella tanítási vagy értékelési kitettséget jelzett. Ezek eredményeit ezért a modellek családon belüli összehasonlításaként kell kezelni, nem teljesen ismeretlen adatokon végzett tesztként.
A Zero a sebességre, a Nano a kontextusra épít
Az Apple M5 Pro processzorán, CPU-n mérve egy 20 szavas, már felmelegített lekérdezés kódolása a teljes Stellával 38,952 ezredmásodpercig tartott. A Nanónál ez 3,131 ezredmásodperc, a Zeronál pedig 0,081 ezredmásodperc volt. Ez a Qdrant mérése szerint körülbelül 12-szeres, illetve 480-szoros gyorsulás a teljes Stellához képest.
A teszt FastEmbed és ONNX Runtime használatával, négy szállal és egyes kötegmérettel készült. A számok csak a lekérdezés kódolási idejét jelentik, a Qdrant-keresés és a hálózati idő nincs bennük. A Qdrant azt javasolja, hogy a modelleket tartsák betöltve, így modellváltáskor nem kell újra megfizetni az indítás költségét.
A Constella többféle felhasználást céloz. A Zero alacsony fogyasztású eszközökön helyi keresést tehet lehetővé, ha a dokumentumokat előzőleg egy szerveren Stella kódolta. A keresőmezőbe gépelés közben használható a Zero, majd a lekérdezés elküldésekor választható a Nano. Ismételten kereső ügynököknél szintén csökkenthető a köztes keresések kódolási ideje. A Qdrant a Zerót BM25-tel kombinált hibrid kereséshez is ajánlja.
A modellek és a FastEmbed natív támogatása már elérhető a kutatási előzeteshez kapcsolódó csatornákon. A Constella teljes kiadása előtt belső felülvizsgálat alatt áll, ezért a Qdrant a felhasználói visszajelzésekre és a kipróbálás során létrehozott megoldásokra is kíváncsi.

