Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Qdrant és a Minima 2,92-szer több sikeres RAG-feladatot ért el

2026. augusztus 13.Forrás: Qdrant
A Qdrant és a Minima 2,92-szer több sikeres RAG-feladatot ért el
Kép: Qdrant

A Qdrant és a Minima közös tesztjében 2,92-szeresére nőtt a sikeres, ügynökalapú RAG-feladatok száma GPU-óránként. A rendszer a keresést és a Qwen3.6-27B futtatását is hatékonyabbá tette.

A lényeg röviden
  • A közös tesztben 3158 sikeres feladat jutott egy GPU-órára.
  • A medián késleltetés 21,3 másodpercről 7,7 másodpercre csökkent.
  • Az első keresés a feladatok 87 százalékában elegendő bizonyítékot adott.
  • A teszt 1800 feladatot és 10 000 teljes ügynöki epizódot tartalmazott.

Kevesebb keresés, rövidebb kontextus

A Qdrant augusztus 13-án közzétett esettanulmánya szerint a Minima egy korlátozott keresési ciklusú RAG-ügynököt épített. Az ügynök megtervezte a lekérdezést, keresett a Qdrantban, ellenőrizte a kapott bizonyítékokat, szükség esetén egyszer újrafogalmazta a lekérdezést, majd hivatkozásokkal ellátott választ készített a Qwen3.6-27B modellel.

A Qdrant hibrid keresést, metaadat-szűrést és késői interakciós újrarangsorolást (late-interaction reranking) alkalmazott. A hibrid megoldás a sűrű vektoros keresést BM25-alapú ritka kereséssel egészítette ki, majd a találatokat reciprok rangfúzióval és token szintű újrarangsorolással rendezte.

A hibrid keresésnél a releváns bizonyíték az esetek 87 százalékában már az első keresés után elegendő volt, a sűrű keresés 72 százalékával szemben. Az egy feladatra jutó kontextus körülbelül 5,2 ezer tokenről 2,3 ezerre csökkent, miközben az átlagos Qdrant-hívások száma 1,28-ról 1,13-ra esett.

1800 feladaton és 10 000 epizódon mérték

A Minima három nyilvános adathalmazon, a SciFact, a FiQA és a HotpotQA feladatain, valamint egy saját, metaadat-szűrést vizsgáló adathalmazon összesen 1800 többlépéses feladatot tesztelt. Emellett egymillió, egyenként 400 tokenes szövegrészleten 10 000 teljes ügynöki epizódot játszottak vissza. A külön szűrési próbában 50 000 lekérdezést futtattak.

Minden konfiguráció ugyanazon a hardveren futott, egy 96 GB-os NVIDIA RTX PRO 6000 Blackwell GPU-n, azonos Qwen3.6-27B ellenőrzőponttal, mintavételi beállításokkal, ügynökutasítással és párhuzamossággal. A Minima a modell súlyait NVFP4 W4A4 formátumban tárolta, a friss és horgonyként használt gyorsítótárat FP8-ban, a régebbi oldalakat pedig 3 bites TQ3 rétegben kezelte.

A forrás szerint a modell súlyainak névleges mérete 54,0 GB-ról 16,9 GB-ra csökkent. Az egy aktív tokenre jutó figyelmi gyorsítótár 64,0 KiB-ról 18,3 KiB-ra esett. A külön mért, 512 bemeneti és 256 kimeneti tokenes teljesítmény 206,4 tokenről 392,2 tokenre nőtt másodpercenként.

3158 sikeres feladat GPU-óránként

A kiinduló konfiguráció, sűrű kereséssel és BF16-os modellfuttatással, 1350 feladatot teljesített GPU-óránként. A Qdrant hibrid keresésével és újrarangsorolásával ez 1980-ra nőtt, a Minima teljes beállításával pedig 3750-re. A sikerességi arányt is figyelembe véve a mutató 1081-ről 3158 sikeres feladatra emelkedett GPU-óránként.

A medián feladatkésleltetés 21,3 másodpercről 7,7 másodpercre csökkent, a 95. percentilis pedig 33,8 másodpercről 11,0 másodpercre. A megalapozott feladatok aránya közben 80,1 százalékról 84,2 százalékra változott. A Qdrant és a Minima szerint a teszteléshez használt, GPU-óránkénti 1,50 dolláros költséggel számolva ezer sikeres ügynöki feladat költsége 1,39 dollárról 0,48 dollárra esett.

A számítás csak a dedikált következtetési GPU költségét tartalmazza, a Qdrant gazdagépét és a beágyazásokat készítő szolgáltatásokat nem. A vállalatok szerint az eredmények azt mutatják, hogy az ügynökalapú RAG teljesítményét a keresési stratégia és a modellfuttatás együtt határozza meg. Sergii Kozyrev, a Minima AI társalapítója és vezérigazgatója úgy fogalmazott: „Egy ügynöki ciklusban a gyenge első keresés többe kerül, mint egy további keresés.”

Kapcsolódó hírek

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása
Kutatás2026. október 2.

Az olcsóbb működéshez önmagában nem elég a promptok gyorsítótárazása

A promptok gyorsítótárazása csökkentheti az ismétlődő bemenetek feldolgozásának költségét, de az Arize AI tesztje szerint a magas cache újraolvasási arány önmagában nem…

Új eszközökkel bővíti AI-infrastruktúráját a CoreWeave
Termékek és eszközök2026. október 2.

Új eszközökkel bővíti AI-infrastruktúráját a CoreWeave

A CoreWeave három új képességgel bővíti Mission Control platformját, amely az AI-munkafolyamatok felügyeletét és hibakeresését szolgálja. A Telemetry Relay általános…

Az Anthropic Claude-ja éles ügynökök nyomaiból épít teszteket
Fejlesztőknek2026. október 2.

Az Anthropic Claude-ja éles ügynökök nyomaiból épít teszteket

Az Anthropic Claude-ja két új paranccsal támogatja az AI-ügynökök tesztelését és fokozatos javítását. Az Arize AI szerint a módszer akkor válik igazán használhatóvá, ha…