Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

10 milliárd dokumentumos vektorkeresési benchmarkot adott ki a Qdrant

2026. szeptember 1. 16:24Forrás: Vultr
10 milliárd dokumentumos vektorkeresési benchmarkot adott ki a Qdrant
Kép: Vultr

A Qdrant kiadta a Qdrant-Fineweb-10B nevű nyilvános adatkészletet, amely 10 milliárd FineWeb-dokumentum vektorágyazásait és 120 ezer lekérdezés pontos eredményeit tartalmazza. A benchmark célja, hogy a fejlesztők a milliárdos méretű adathalmazokhoz közelebb álló környezetben mérhessék a vektorkereső rendszerek pontosságát.

A lényeg röviden
  • A Qdrant-Fineweb-10B 10 milliárd FineWeb-dokumentumot tartalmaz.
  • Az adatkészlethez 120 ezer lekérdezés és pontos referenciaeredmények tartoznak.
  • A dokumentumokhoz sűrű és ritka vektorok készültek.
  • A teljes korpusz feldolgozása körülbelül öt napig tartott.
  • A projekt mintegy 500 ezer fájlt és 25 terabájtnyi adatot eredményezett.

Nagyobb léptékű tesztelést tesz lehetővé

A Vultr szeptember 1-jei közleménye szerint a Qdrant-Fineweb-10B olyan nyilvános benchmark-adatkészlet, amellyel a fejlesztők megvizsgálhatják, hogyan változik a keresés minősége, amikor az adatbázis mérete több milliárd rekordra nő. A csomag 10 milliárd, a FineWebből származó dokumentumot tartalmaz.

Minden dokumentumhoz sűrű és ritka vektorok (dense és sparse vectors) készültek. Az adatkészlet emellett 120 ezer lekérdezést, valamint ezek pontos, úgynevezett ground-truth eredményeit is magában foglalja. Az eredmények legfeljebb 1000 találatig állnak rendelkezésre.

Ez lehetőséget ad a csapatoknak arra, hogy azonos, nagyméretű adatkészleten hasonlítsák össze a különböző vektorkeresési beállításokat, és mérjék a találatok visszakeresési pontosságát.

A teljes korpusz feldolgozása körülbelül öt napig tartott

A Qdrant a Vultr felhős infrastruktúráját használta a FineWeb korpusz feldolgozásához. A dokumentumok vektorágyazásai az Alibaba gte-multilingual-base modelljével készültek, minden rekordhoz sűrű és ritka vektorokkal.

A feladatnál a GPU-k teljesítménye önmagában nem volt elegendő. Az adatokat elő kellett készíteni, majd megfelelő sebességgel el kellett juttatni a grafikus processzorokhoz. A munkafolyamatban CPU-s dolgozók párhuzamosan végezték a tokenizálást, mielőtt az adatok a GPU-khoz kerültek.

A Vultr közlése szerint ez a megközelítés körülbelül 19 ezer sor feldolgozását tette lehetővé másodpercenként és csomópontonként. A teljes, 10 milliárd dokumentumból álló korpusz feldolgozása körülbelül öt nap alatt fejeződött be. Az eredmény mintegy 500 ezer fájlt és 25 terabájtnyi adatot tett ki.

A létrejött vektorágyazásokat a Vultr Object Storage ideiglenesen tárolta, amíg a Qdrant le nem töltötte őket a projekt következő szakaszához.

RAG-rendszerek és AI-ügynökök fejlesztéséhez is használható

A vektorkeresés többek között a visszakereséssel kiegészített szöveggenerálást, vagyis a RAG-alkalmazásokat, a szemantikus keresést, az ajánlórendszereket és az AI-ügynököket szolgálja ki. A közlemény szerint a kisebb vagy véletlenszerűen létrehozott adatkészletek nem feltétlenül viselkednek úgy, mint az éles környezetek adatai.

Az adatmennyiség növekedésével változhatnak a memóriaigények, az indexek felépítéséhez szükséges idő, a felosztás, vagyis a sharding működése, valamint a visszakeresés pontossága. A Qdrant-Fineweb-10B ezeket a körülményeket nagyobb léptékben teszi vizsgálhatóvá, és sűrű, ritka, illetve szűrt keresésekhez is tartalmaz adatokat és pontos referenciaeredményeket.

André Zayarni, a Qdrant vezérigazgatója és társalapítója szerint az adatkészlet elkészítése olyan méretű feldolgozást igényelt, ahol az infrastruktúra és a végrehajtás egyaránt fontos. A Qdrant vezetője hozzátette, hogy a Vultr számítási és tárolási kapacitást, valamint gyakorlati támogatást biztosított a projekthez.

Kevin Cochrane, a Vultr marketingigazgatója szerint 10 milliárd dokumentum feldolgozásához a GPU-knak, a CPU-knak, a tárolásnak és az adatfeldolgozási folyamatnak együtt kell hatékonyan működnie. A projekt így a fejlesztők és kutatók számára olyan benchmarkot kínál, amely a forrás szerint közelebb áll a gyártási környezetek méretéhez.

Kapcsolódó hírek

Chipek és infrastruktúra
Chipek és infrastruktúra2026. szeptember 30. 15:15

A Vultr 1,2 milliárd dolláros rendelése az első AMD Helios-megrendelés a HPE-nél

A HPE 1,2 milliárd dolláros megrendelést kapott a Vultrtól AMD Helios AI Rack by HPE rendszerek telepítésére. Ez a HPE első rendelése az AMD új, rackméretű…

Chipek és infrastruktúra
Chipek és infrastruktúra2026. szeptember 30. 15:15

1,2 milliárd dolláros AMD Helios-megrendelést kapott a HPE a Vultrtól

A Vultr 1,2 milliárd dollár értékben rendel AMD Helios AI Rack by HPE rendszereket, amelyeket amerikai felhőadatközpontjaiban telepít. A megállapodás a HPE első…

A Qdrant 10 milliárd vektoros benchmarkot és nyílt eszközöket ad ki
Kutatás2026. szeptember 1.

A Qdrant 10 milliárd vektoros benchmarkot és nyílt eszközöket ad ki

A Qdrant bemutatta a Qdrant-FineWeb-10B nevű, 10 milliárd vektort tartalmazó nyílt benchmarkot, valamint a hozzá készített Supernova keretrendszert. A vállalat szerint…