A több számítás jelentősen javítja a Weaviate keresési pontosságát

A Weaviate új effort paramétere szabályozhatóvá teszi, mennyi számítási kapacitást fordítson a Query Agent egy keresésre. A vállalat tesztjeiben az ultrahigh szint a BRIGHT Biology benchmarkon 13,0-ról 57,5-re emelte az nDCG@10 értékét a Hybrid Search eredményéhez képest.
- Az effort paraméter három szinten szabályozza a Search Mode számítási munkáját.
- BRIGHT Biology esetén az ultrahigh nDCG@10 értéke 57,5 lett a Hybrid Search 13,0 értékével szemben.
- A legnagyobb javulás a több lépéses gondolkodást igénylő kereséseknél jelent meg.
- IRPAPERS és WixQA esetén a medium szint a nyereség nagy részét már elérte.
- A funkció a weaviate-agents 1.8.0 és az agents-typescript-client 1.7.0 verzióban érhető el.
Három szinten állítható a keresésre fordított munka
A Weaviate a Query Agent Search Mode módjához adta hozzá az effort paramétert. Ezzel kérésenként szabályozható, mennyi munkát végezzen az ügynök a keresés során. A beállítás három szintet kínál: medium, high és ultrahigh.
A különbség a Search Mode két fő szakaszában jelenik meg. A rendszer a lekérdezés megfogalmazására és a találatok újrarangsorolására fordít több számítási kapacitást. Magasabb effort mellett hosszabban elemzi, hogyan lehet felbontani a kérdést, és alaposabban rangsorolja újra az eredményeket. Alacsonyabb szinten a gyorsaság és a költség kap nagyobb súlyt.
A funkció a weaviate-agents 1.8.0 és az agents-typescript-client 1.7.0 verzióban érhető el. A Weaviate szerint a Search Mode olyan rendszerekbe illeszthető be, amelyek rangsorolt találatokat várnak, például RAG-rendszerekbe, ügynöki munkafolyamatokba vagy keresőmezők mögé.
A legnehezebb kérdéseknél nőtt a legjobban a pontosság
A Weaviate nyolc benchmarkon hasonlította össze a három effort szintet a saját Hybrid Search megoldásával. A vizsgálatban a BRIGHT öt részhalmaza, az IRPAPERS, a WixQA és az OBLIQ-Bench egyik részhalmaza szerepelt. A Hybrid Search a BM25 szöveges keresést és a Snowflake Arctic 2.0 beágyazásaira épülő vektoros keresést kombinálja, az eredményeket Reciprocal Rank Fusion segítségével egyesítve.
A cég közlése szerint mindhárom Search Mode szint felülmúlta a Hybrid Search eredményét, és átlagosan a nagyobb effort magasabb pontosságot hozott. A különbség a több lépéses gondolkodást igénylő feladatoknál volt a legnagyobb.
A BRIGHT Biology részhalmazán az ultrahigh effort 57,5-ös nDCG@10 értéket ért el, szemben a Hybrid Search 13,0 értékével. Psychology esetén ugyanez a mutató 22,2-ről 54,4-re emelkedett. A BRIGHT Robotics tesztjén a medium szint 25,7-es Success@1 értékéről high szinten 45,9-re nőtt az eredmény. A Weaviate szerint ezen a részhalmazon voltak a leghosszabbak a kérdések, átlagosan 819 tokennel.
Nem minden adatállomány igényel ultrahigh beállítást
A benchmarkok alapján az effort hatása az adott feladattól függ. A BRIGHT Earth Science részhalmazán már a medium szint megháromszorozta a Hybrid Search alapértékét, a további szintek pedig kisebb javulást hoztak. Az IRPAPERS és a WixQA tesztjein szintén a medium fogta be a teljes nyereség nagy részét, a high és az ultrahigh csak néhány ponttal javított tovább.
A WixQA technikai ügyféltámogatási kérdéseket vizsgál. A Weaviate szerint medium effort mellett a rendszer a támogatási szakértő által első helyre sorolt dokumentumot nagyjából minden harmadik kérdésből kettőnél adta vissza, míg Hybrid Search esetében ez két válasz volt ötből.
Az OBLIQ-Bench olyan kérdéseket tesztel, amelyeknél a relevancia nem szerepel közvetlenül a dokumentum felszíni szövegében. Ezen a teszten a Hybrid Search a releváns szövegrészt a legjobb húsz találat között is kevesebb mint minden tizenkettedik kérdésnél hozta elő. Az ultrahigh effort 24,4-es Success@1 értéket ért el, ami a Weaviate szerint nagyjából hétszeres javulás.
A beállítás a pontosság és a késleltetés között választ
A Search Mode a Query Agent egyik módja. A Query Agent természetes nyelvű utasításból állít össze lekérdezéseket, szűrőket és aggregációkat a Weaviate gyűjteményeihez. Az Ask Mode válaszokat generál, a Search Mode magukat a dokumentumokat adja vissza, a Suggest Queries Mode pedig a felhasználó felfedezését segítő lekérdezéseket javasol.
A Weaviate tesztjeiben a Search Mode véletlenszerűsége miatt minden konfigurációt háromszor futtattak, majd az átlagot és a szórást közölték. A vállalat szerint az egyes futások közötti következetes eredmények arra utalnak, hogy a javulás nem egyetlen véletlen mintából származik. Egyes részhalmazokon a szomszédos szintek eredményei átfedhetik egymást, ezért az effort kiválasztása a feladat nehézségétől, valamint a megengedhető késleltetéstől és költségtől függhet.
A Search Mode strukturált feltételeket is felismerhet a természetes nyelvű kérdésekben. A Weaviate példája szerint a „70 dollár alatti vintage cipők” lekérdezésben az ügynök az árat kemény szűrési feltételként értelmezi, majd a feltételnek megfelelő eredmények között keres.
Weaviate: Scaling Test-Time Compute in Search Mode


