Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az EmbeddingGemma 2 akár 77-szer kevesebb memóriával is működhet

2026. október 6.Forrás: Qdrant
Az EmbeddingGemma 2 akár 77-szer kevesebb memóriával is működhet
Kép: Qdrant

A Google új EmbeddingGemma 2 modellje telefonon is futtatható, a hozzá tartozó vektorok azonban nagy memóriát foglalhatnak. A Qdrant tesztje szerint tömörítéssel akár 77-szer is csökkenthető a vektormemória igénye, 94,5 százalékos keresési minőség megtartása mellett.

A lényeg röviden
  • Az EmbeddingGemma 2 768 dimenziós vektorokat állít elő.
  • A teljes méretű, 1 bites vektorok 99,0 százalékos minőséget tartottak meg a Quora tesztjén.
  • A 256 dimenziós, 1 bites konfiguráció újrarangsorolással 94,5 százalékot ért el.
  • A Qdrant szerint a vektormemória akár 77-szer is csökkenthető.
  • A modell szöveget, kódot, képet, videót és hangot is közös térbe képez le.

A vektorok jelentik a memóriaigény fő részét

A Qdrant október 6-án közzétett beszámolója szerint a vállalat korai hozzáférést kapott az EmbeddingGemma 2-höz, még a Google DeepMind kiadása előtt. A tesztben azt vizsgálták, mennyi memória takarítható meg a modell által létrehozott vektorok Qdrantban történő tárolásakor.

Tízmillió dokumentum esetén a teljes méretű, float32 formátumú vektorok önmagukban 30,7 GB RAM-ot igényelnek. A Qdrant két módszert hasonlított össze: a vektorok dimenziószámának csökkentését, illetve az egy dimenzióra jutó bitek számának mérséklését.

Az eredményeket öt szöveges keresési adathalmazon mérték. A minőséget az alapértékhez viszonyított nDCG@10 mutatta, amely azt jelzi, hogy a legjobb tíz találat mennyire jól rangsorolja a releváns dokumentumokat. A közölt memóriaadatok csak a vektorokra vonatkoznak, a gráfindexeket, a hasznos adatokat és az újrarangsoroláshoz tárolt eredeti vektorokat nem tartalmazzák.

A teljes méretű, egypites vektorokkal kezdené a Qdrant

A Qdrant elsőként azt javasolja kipróbálni, hogy mind a 768 dimenzió megmaradjon, miközben a vektorokat 1 bites TurboQuant formátumban tárolják. Így egy vektor 3072 bájt helyett 104 bájtot foglal, tízmillió dokumentum esetén pedig körülbelül 1 GB RAM is elegendő lehet.

A Quora 523 ezer dokumentumot tartalmazó adathalmazán ez a beállítás a float32 alapú keresés idejének kevesebb mint felét igényelte, miközben az alapértékhez képest a keresési minőség 99,0 százaléka megmaradt. Az azonos találatok aránya ugyanakkor körülbelül 74 százalék volt a legjobb tíz eredmény között. A Qdrant ezért újrarangsorolást javasolhat azokban az alkalmazásokban, ahol fontos ugyanazon szomszédos találatok visszanyerése.

A teszt arra is utal, hogy a dimenziók csökkentése előtt érdemes lehet erősebben tömöríteni az egyes dimenziókat. Az 512 dimenziós, 1 bites beállítás 72 bájtot használt vektoronként, és az alapérték 97,3 százalékát tartotta meg. Hasonló memóriaigénynél a 128 dimenziós, 4 bites változat 84,0 százalékos értéket ért el.

77-szer kevesebb memória újrarangsorolással

Aki minden bájttal takarékoskodni szeretne, 256 dimenzióval is próbálkozhat. Az 1 bites TurboQuant használatával egy vektor 40 bájtot foglal. Újr rangsorolással ez a konfiguráció az alapérték 94,5 százalékát őrizte meg, ami a Qdrant szerint 77-szer kisebb vektormemória-igényt jelent.

Újrarangsorolás nélkül a megtartott minőség 88,1 százalékra esett. A módszer ilyenkor több memóriát takarít meg, de az alkalmazásnak el kell bírnia a relevancia csökkenését és az újrarangsorolás idejét. A Qdrant felhívja a figyelmet arra is, hogy a tesztben nem próbálták ki a float16 vagy a turbo4 formátumot az eredeti vektorok lemezen történő tárolására.

Az EmbeddingGemma 2 nyílt embeddingmodell, amely a Gemma 4-re épül. Szöveget, kódot, képet, videót és hangot egy közös, 768 dimenziós térbe képez le. A csak szöveget kezelő útvonal 270 millió paraméteres, a modell kontextusablaka pedig 8 ezer tokenes. A Google szerint a kódkeresésben 14 százalékos javulást ért el az első EmbeddingGemma verzióhoz képest. A Matryoshka Representation Learning lehetővé teszi az első 512, 256 vagy 128 dimenzió megtartását újrabeágyazás nélkül.

A Qdrant azt javasolja, hogy a felhasználók saját lekérdezéseiken hasonlítsák össze a teljes méretű, tömörítetlen gyűjteményt a teljes méretű, 1 bites konfigurációval. Ha ezután is túl nagy a memóriaigény, következhet a dimenziók rövidítése.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A Google új multimodális modellje internet nélkül keres a telefonon
Modellek2026. október 6.

A Google új multimodális modellje internet nélkül keres a telefonon

A Google DeepMind bemutatta az EmbeddingGemma 2 nyílt súlyú, multimodális beágyazási modellt, amely szöveget, képeket, videoképkockákat és hangot egyetlen vektortérben…

A Qdrant Constella modelljeivel újraágyazás nélkül váltható a keresőmodell
Kutatás2026. szeptember 29.

A Qdrant Constella modelljeivel újraágyazás nélkül váltható a keresőmodell

A Qdrant bemutatta a Constella kutatási előzetesét, amely lehetővé teszi, hogy ugyanazon dokumentumvektorok mellett változtassák a lekérdezésekhez használt…

A Qdrant Constella modelljei újrabeágyazás nélkül cserélhetők
Kutatás2026. szeptember 29.

A Qdrant Constella modelljei újrabeágyazás nélkül cserélhetők

A Qdrant bemutatta a Constella kutatási előzetesét, amely lehetővé teszi, hogy ugyanabban a vektoradatbázisban a lekérdezésekhez használt modellt újrabeágyazás nélkül…