A Qdrant és a Minima 2,92-szer több sikeres RAG-feladatot ért el

A Qdrant és a Minima közös tesztjében 2,92-szeresére nőtt a sikeres, ügynökalapú RAG-feladatok száma GPU-óránként. A rendszer a keresést és a Qwen3.6-27B futtatását is hatékonyabbá tette.
- A közös tesztben 3158 sikeres feladat jutott egy GPU-órára.
- A medián késleltetés 21,3 másodpercről 7,7 másodpercre csökkent.
- Az első keresés a feladatok 87 százalékában elegendő bizonyítékot adott.
- A teszt 1800 feladatot és 10 000 teljes ügynöki epizódot tartalmazott.
Kevesebb keresés, rövidebb kontextus
A Qdrant augusztus 13-án közzétett esettanulmánya szerint a Minima egy korlátozott keresési ciklusú RAG-ügynököt épített. Az ügynök megtervezte a lekérdezést, keresett a Qdrantban, ellenőrizte a kapott bizonyítékokat, szükség esetén egyszer újrafogalmazta a lekérdezést, majd hivatkozásokkal ellátott választ készített a Qwen3.6-27B modellel.
A Qdrant hibrid keresést, metaadat-szűrést és késői interakciós újrarangsorolást (late-interaction reranking) alkalmazott. A hibrid megoldás a sűrű vektoros keresést BM25-alapú ritka kereséssel egészítette ki, majd a találatokat reciprok rangfúzióval és token szintű újrarangsorolással rendezte.
A hibrid keresésnél a releváns bizonyíték az esetek 87 százalékában már az első keresés után elegendő volt, a sűrű keresés 72 százalékával szemben. Az egy feladatra jutó kontextus körülbelül 5,2 ezer tokenről 2,3 ezerre csökkent, miközben az átlagos Qdrant-hívások száma 1,28-ról 1,13-ra esett.
1800 feladaton és 10 000 epizódon mérték
A Minima három nyilvános adathalmazon, a SciFact, a FiQA és a HotpotQA feladatain, valamint egy saját, metaadat-szűrést vizsgáló adathalmazon összesen 1800 többlépéses feladatot tesztelt. Emellett egymillió, egyenként 400 tokenes szövegrészleten 10 000 teljes ügynöki epizódot játszottak vissza. A külön szűrési próbában 50 000 lekérdezést futtattak.
Minden konfiguráció ugyanazon a hardveren futott, egy 96 GB-os NVIDIA RTX PRO 6000 Blackwell GPU-n, azonos Qwen3.6-27B ellenőrzőponttal, mintavételi beállításokkal, ügynökutasítással és párhuzamossággal. A Minima a modell súlyait NVFP4 W4A4 formátumban tárolta, a friss és horgonyként használt gyorsítótárat FP8-ban, a régebbi oldalakat pedig 3 bites TQ3 rétegben kezelte.
A forrás szerint a modell súlyainak névleges mérete 54,0 GB-ról 16,9 GB-ra csökkent. Az egy aktív tokenre jutó figyelmi gyorsítótár 64,0 KiB-ról 18,3 KiB-ra esett. A külön mért, 512 bemeneti és 256 kimeneti tokenes teljesítmény 206,4 tokenről 392,2 tokenre nőtt másodpercenként.
3158 sikeres feladat GPU-óránként
A kiinduló konfiguráció, sűrű kereséssel és BF16-os modellfuttatással, 1350 feladatot teljesített GPU-óránként. A Qdrant hibrid keresésével és újrarangsorolásával ez 1980-ra nőtt, a Minima teljes beállításával pedig 3750-re. A sikerességi arányt is figyelembe véve a mutató 1081-ről 3158 sikeres feladatra emelkedett GPU-óránként.
A medián feladatkésleltetés 21,3 másodpercről 7,7 másodpercre csökkent, a 95. percentilis pedig 33,8 másodpercről 11,0 másodpercre. A megalapozott feladatok aránya közben 80,1 százalékról 84,2 százalékra változott. A Qdrant és a Minima szerint a teszteléshez használt, GPU-óránkénti 1,50 dolláros költséggel számolva ezer sikeres ügynöki feladat költsége 1,39 dollárról 0,48 dollárra esett.
A számítás csak a dedikált következtetési GPU költségét tartalmazza, a Qdrant gazdagépét és a beágyazásokat készítő szolgáltatásokat nem. A vállalatok szerint az eredmények azt mutatják, hogy az ügynökalapú RAG teljesítményét a keresési stratégia és a modellfuttatás együtt határozza meg. Sergii Kozyrev, a Minima AI társalapítója és vezérigazgatója úgy fogalmazott: „Egy ügynöki ciklusban a gyenge első keresés többe kerül, mint egy további keresés.”


