Az EmbeddingGemma 2 akár 77-szer kevesebb memóriával is működhet

A Google új EmbeddingGemma 2 modellje telefonon is futtatható, a hozzá tartozó vektorok azonban nagy memóriát foglalhatnak. A Qdrant tesztje szerint tömörítéssel akár 77-szer is csökkenthető a vektormemória igénye, 94,5 százalékos keresési minőség megtartása mellett.
- Az EmbeddingGemma 2 768 dimenziós vektorokat állít elő.
- A teljes méretű, 1 bites vektorok 99,0 százalékos minőséget tartottak meg a Quora tesztjén.
- A 256 dimenziós, 1 bites konfiguráció újrarangsorolással 94,5 százalékot ért el.
- A Qdrant szerint a vektormemória akár 77-szer is csökkenthető.
- A modell szöveget, kódot, képet, videót és hangot is közös térbe képez le.
A vektorok jelentik a memóriaigény fő részét
A Qdrant október 6-án közzétett beszámolója szerint a vállalat korai hozzáférést kapott az EmbeddingGemma 2-höz, még a Google DeepMind kiadása előtt. A tesztben azt vizsgálták, mennyi memória takarítható meg a modell által létrehozott vektorok Qdrantban történő tárolásakor.
Tízmillió dokumentum esetén a teljes méretű, float32 formátumú vektorok önmagukban 30,7 GB RAM-ot igényelnek. A Qdrant két módszert hasonlított össze: a vektorok dimenziószámának csökkentését, illetve az egy dimenzióra jutó bitek számának mérséklését.
Az eredményeket öt szöveges keresési adathalmazon mérték. A minőséget az alapértékhez viszonyított nDCG@10 mutatta, amely azt jelzi, hogy a legjobb tíz találat mennyire jól rangsorolja a releváns dokumentumokat. A közölt memóriaadatok csak a vektorokra vonatkoznak, a gráfindexeket, a hasznos adatokat és az újrarangsoroláshoz tárolt eredeti vektorokat nem tartalmazzák.
A teljes méretű, egypites vektorokkal kezdené a Qdrant
A Qdrant elsőként azt javasolja kipróbálni, hogy mind a 768 dimenzió megmaradjon, miközben a vektorokat 1 bites TurboQuant formátumban tárolják. Így egy vektor 3072 bájt helyett 104 bájtot foglal, tízmillió dokumentum esetén pedig körülbelül 1 GB RAM is elegendő lehet.
A Quora 523 ezer dokumentumot tartalmazó adathalmazán ez a beállítás a float32 alapú keresés idejének kevesebb mint felét igényelte, miközben az alapértékhez képest a keresési minőség 99,0 százaléka megmaradt. Az azonos találatok aránya ugyanakkor körülbelül 74 százalék volt a legjobb tíz eredmény között. A Qdrant ezért újrarangsorolást javasolhat azokban az alkalmazásokban, ahol fontos ugyanazon szomszédos találatok visszanyerése.
A teszt arra is utal, hogy a dimenziók csökkentése előtt érdemes lehet erősebben tömöríteni az egyes dimenziókat. Az 512 dimenziós, 1 bites beállítás 72 bájtot használt vektoronként, és az alapérték 97,3 százalékát tartotta meg. Hasonló memóriaigénynél a 128 dimenziós, 4 bites változat 84,0 százalékos értéket ért el.
77-szer kevesebb memória újrarangsorolással
Aki minden bájttal takarékoskodni szeretne, 256 dimenzióval is próbálkozhat. Az 1 bites TurboQuant használatával egy vektor 40 bájtot foglal. Újr rangsorolással ez a konfiguráció az alapérték 94,5 százalékát őrizte meg, ami a Qdrant szerint 77-szer kisebb vektormemória-igényt jelent.
Újrarangsorolás nélkül a megtartott minőség 88,1 százalékra esett. A módszer ilyenkor több memóriát takarít meg, de az alkalmazásnak el kell bírnia a relevancia csökkenését és az újrarangsorolás idejét. A Qdrant felhívja a figyelmet arra is, hogy a tesztben nem próbálták ki a float16 vagy a turbo4 formátumot az eredeti vektorok lemezen történő tárolására.
Az EmbeddingGemma 2 nyílt embeddingmodell, amely a Gemma 4-re épül. Szöveget, kódot, képet, videót és hangot egy közös, 768 dimenziós térbe képez le. A csak szöveget kezelő útvonal 270 millió paraméteres, a modell kontextusablaka pedig 8 ezer tokenes. A Google szerint a kódkeresésben 14 százalékos javulást ért el az első EmbeddingGemma verzióhoz képest. A Matryoshka Representation Learning lehetővé teszi az első 512, 256 vagy 128 dimenzió megtartását újrabeágyazás nélkül.
A Qdrant azt javasolja, hogy a felhasználók saját lekérdezéseiken hasonlítsák össze a teljes méretű, tömörítetlen gyűjteményt a teljes méretű, 1 bites konfigurációval. Ha ezután is túl nagy a memóriaigény, következhet a dimenziók rövidítése.
Qdrant: How Small Can Google's New EmbeddingGemma 2 Get?


