Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Qdrant 10 milliárd vektoros benchmarkot és nyílt eszközöket ad ki

2026. szeptember 1.Forrás: Qdrant
A Qdrant 10 milliárd vektoros benchmarkot és nyílt eszközöket ad ki
Kép: Qdrant

A Qdrant bemutatta a Qdrant-FineWeb-10B nevű, 10 milliárd vektort tartalmazó nyílt benchmarkot, valamint a hozzá készített Supernova keretrendszert. A vállalat szerint az eszközök reprodukálhatóbbá teszik a nagy léptékű vektorkereső rendszerek összehasonlítását.

A lényeg röviden
  • A Qdrant-FineWeb-10B 10,07 milliárd sűrű és 10,07 milliárd ritka vektort tartalmaz.
  • A benchmark 24,47 terabájtnyi vektoradatot és 28,66 terabájt forrásszöveget, illetve metaadatot foglal magában.
  • A Qdrant a teljes vektortéren pontos top-1000 igazságkészletet számított GPU-kon.
  • A Supernova nyílt forráskódú keretrendszerként támogatja a generálást, betöltést és kiértékelést.
  • A csomaghoz a PubMed-Multi-Vector és a Coyo-Vector-Embeddings adatkészlet is csatlakozik.

A Qdrant szerint a régi benchmarkok nem elég életszerűek

A Qdrant szeptember 1-jei bejelentése szerint a vállalatok vektorkeresési rendszerei ma már milliárdnyi vektorral és másodpercenként több ezer kéréssel dolgoznak, miközben a faroklatenciának 50 ezredmásodperc alatt kell maradnia. A vállalat úgy látja, hogy ehhez képest sok benchmark szintetikus adatokat használ, a lekérdezéseket elrejti, vagy fizetős, zárt szolgáltatásokra épít.

A Qdrant szerint egy 90 százalékos recall@10 érték egy szintetikus RAG-teszten nem feltétlenül elegendő olyan e-kereskedelmi vagy piactéri rendszerekben, amelyek több mint 1000 találatot adnak tovább egy második szakaszban működő újrarangsorolónak. A vállalat által megcélzott kutatási feltételek között legalább 95 százalékos visszahívás, nagy találati mélység, magas áteresztőképesség és 100 ezredmásodperc alatti p99 késleltetés szerepel.

10 milliárd vektor egy nyílt adatkészletben

A Qdrant a Vultr közreműködésével készítette el a Qdrant-FineWeb-10B adatkészletet a Hugging Face FineWeb korpuszára támaszkodva, a gte-multilingual-base modell használatával. A részletes leírás szerint az adatkészlet 10,07 milliárd sűrű és 10,07 milliárd ritka vektort, 24,47 terabájtnyi vektoradatot, valamint 28,66 terabájt forrásszöveget és metaadatot tartalmaz.

A készítők GPU-gyorsított hardveren számították ki a teljes 10 milliárd vektoros tér pontos, legközelebbi 1000 szomszédját. A bejelentés egyik része 120 000 sűrű, ritka és szűrt lekérdezést említ, a részletes FineWeb-10B leírás viszont 100 000 lekérdezésről beszél. A Qdrant mindkét helyen több mint egy kvadrillió távolságszámítást ír le.

A csomag mellett két további nyílt adatkészlet is megjelent. A PubMed-Multi-Vector a hibrid keresést vizsgálja sűrű, ritka és ColBERT-stílusú többvektoros reprezentációkkal, összesen több mint 8,37 milliárd többvektoros tokenen és csaknem 35 terabájtnyi adaton. A Coyo-Vector-Embeddings multimodális kereséshez használja a Qwen3-VL-Embedding-2B modellt, 2048 dimenziós reprezentációkkal.

A Supernova a teljes benchmarkfolyamatot lefedi

A Qdrant nem csak statikus adatkészleteket tett közzé. A Supernova ingyenes, teljesen nyílt forráskódú keretrendszer, amellyel a közösség saját infrastruktúráján generálhat, előkészíthet, ellenőrizhet és mérhet internetes léptékű adatkészleteket.

A rendszer négy fő szakaszt automatizál: a beágyazások létrehozását, a nyers erővel végzett pontos igazságkészlet-számítást, az adatbázis betöltését és a kiértékelést. A nova-embed különböző beágyazási és tárhelyháttereket egységesít, a nova-bf GPU-n számítja a pontos szomszédokat, a nova-load a párhuzamos betöltést, a nova-storm pedig a keresési terhelést méri.

A keretrendszer Qdrant, Milvus és Elasticsearch háttérrendszerekkel is használható. A nova-storm többek között a lekérdezések másodpercenkénti számát, a p50, p95 és p99 késleltetést, a felépítési időt és a recallt követi. A SkyPilotra épülő nova-dist AWS, GCP, Azure, Kubernetes és Slurm HPC környezetben kezeli a fürtök létrehozását, az ütemezést és a hibakezelést.

QdrantQdrant LabsVultrQdrant-FineWeb-10BSupernovaPubMed-Multi-VectorCoyo-Vector-Embeddingsgte-multilingual-basebenchmarknyílt forráskódú modellekkereséskutatási eredmény

Kapcsolódó hírek

A Qdrant Constella modelljeivel újraágyazás nélkül váltható a keresőmodell
Kutatás2026. szeptember 29.

A Qdrant Constella modelljeivel újraágyazás nélkül váltható a keresőmodell

A Qdrant bemutatta a Constella kutatási előzetesét, amely lehetővé teszi, hogy ugyanazon dokumentumvektorok mellett változtassák a lekérdezésekhez használt…

A Qdrant Constella modelljei újrabeágyazás nélkül cserélhetők
Kutatás2026. szeptember 29.

A Qdrant Constella modelljei újrabeágyazás nélkül cserélhetők

A Qdrant bemutatta a Constella kutatási előzetesét, amely lehetővé teszi, hogy ugyanabban a vektoradatbázisban a lekérdezésekhez használt modellt újrabeágyazás nélkül…

10 milliárd dokumentumos vektorkeresési benchmarkot adott ki a Qdrant
Kutatás2026. szeptember 1. 16:24

10 milliárd dokumentumos vektorkeresési benchmarkot adott ki a Qdrant

A Qdrant kiadta a Qdrant-Fineweb-10B nevű nyilvános adatkészletet, amely 10 milliárd FineWeb-dokumentum vektorágyazásait és 120 ezer lekérdezés pontos eredményeit…