A Google új multimodális modellje internet nélkül keres a telefonon

A Google DeepMind bemutatta az EmbeddingGemma 2 nyílt súlyú, multimodális beágyazási modellt, amely szöveget, képeket, videoképkockákat és hangot egyetlen vektortérben kezel. A modell helyben futó keresési és médiavisszakeresési funkciókat kínál, internetkapcsolat nélkül.
- Az EmbeddingGemma 2 szöveget, képet, videót és hangot közös vektortérben kezel.
- A modell 740 millió paraméteres, és helyi eszközökön való futtatásra készült.
- Az AI Edge Gallery fotókban és videók konkrét jeleneteiben kínál offline keresést.
- A Foresight Macen helyben segít a meetingek jegyzetelésében és visszakeresésében.
- Az ML Kit és a MediaPipe Tasks támogatása a következő hetekben érkezik.
Kompakt modell helyi feldolgozáshoz
Az EmbeddingGemma 2 a Google AI Edge Team és az Android ML Team közleménye szerint 740 millió paraméterrel dolgozik, és kifejezetten helyi, adatvédelmi szempontból előnyös alkalmazásokhoz készült. A modell a szöveget, a képi tartalmakat, a videó képkockáit és a hangot közös vektortérbe képezi le.
Ez csökkentheti annak szükségességét, hogy a fejlesztők külön képfeliratozó, beszédfelismerő és szöveges beágyazási modelleket kapcsoljanak össze. A Google mérései szerint a szöveges súlyok körülbelül 191 MB aktív memóriával is futtathatók, a teljes multimodális modell pedig egy Google Pixel 11 Pro készüléken körülbelül 567 MB aktív memóriát használ.
A Google szerint az EmbeddingGemma 2 különösen alacsony késleltetésű döntési motorként is alkalmazható. Tanítóadatok és finomhangolás nélkül képes a felhasználói bemeneteket osztályozási címkékkel és leírásokkal összevetni, így ezredmásodpercek alatt végezhet nulla mintás szándékfelismerést és útválasztást.
Keresés fotókban és videókban, közvetlenül az eszközön
Az EmbeddingGemma 2 két új bemutatóban jelenik meg a Google AI Edge Gallery alkalmazásban. Az Instant Media Search természetes nyelvű lekérdezésekkel vagy példaképekkel keres a telefonon tárolt képek és videók között. A médiatartalmak beágyazási vektorait helyi SQLite-adatbázis tárolja, a találatokat pedig a koszinusz-hasonlóság alapján rangsorolja a rendszer.
A keresés gépelés közben frissül. A Google példája szerint a „Katze” lekérdezés a macskákat ábrázoló képeket jeleníti meg, a „Katze schläft auf Tastatur” kifejezés pedig újrarendezi a találatokat, és előrébb sorolja a billentyűzeten alvó macskáról készült fotót. A felhasználó saját képet vagy élő kameraképet is használhat vizuálisan és szemantikailag hasonló tartalmak keresésére.
A Video Moments Finder helyi videókban keres konkrét jeleneteket. A kiválasztott felvétel képi és hangdarabjait az eszköz indexeli, majd olyan lekérdezésekre keres egyező időpontokat, mint a „gyerekek nevetnek”, „kutya frizbit kap el” vagy „valaki elfújja a születésnapi gyertyákat”. A funkcióhoz nincs szükség hangátirat vagy köztes képfelirat létrehozására.
Foresight és fejlesztői eszközök
A Google AI Edge Foresight új, kísérleti Mac-alkalmazásként érhető el. A helyi feldolgozásra épülő meetingasszisztens jegyzetel, indexeli és visszakeresi a beszélgetések átiratait, valamint a személyes fájlokat. A rendszer közvetlenül a számítógép hangrendszeréhez és mikrofonjához kapcsolódik, ezért a Google szerint bármely meetingplatformmal működhet, teljesen offline is.
Az EmbeddingGemma 2 és a Gemma 4 modellek segítségével a Foresight kiegészíti a rövid jegyzeteket a megbeszélésből valós időben visszakeresett részletekkel, továbbá természetes nyelven keres képek, dokumentumok, átiratok és jegyzetek között. A Google kiemeli, hogy az érzékeny adatok nem hagyják el az eszközt, és a használathoz nincs szükség felhő-előfizetésre.
A fejlesztők számára az EmbeddingGemma 2 támogatása a következő hetekben érkezik az Androidhoz készült ML Kitbe. Az integráció NPU-gyorsítást is használhat, ha az adott eszköz támogatja, és automatikus modellfrissítéseket kínálhat. A MediaPipe Tasks Embedder és Semantic Retriever felületei iOS, macOS, Windows, Linux és webes célokra is egységes fejlesztési lehetőséget adnak.
A MediaPipe Universal Embedder Task nyers képekből vagy szövegből 768 dimenziós, illetve 128 és 512 dimenzió közötti csonkolt, normalizált vektorokat készít. A Semantic Retriever Task helyben indexel, és egy számjegyű ezredmásodperces hozzávetőleges legközelebbi szomszéd keresést kínál. Az EmbeddingGemma 2 a MediaPipe Decision Task segítségével képi, szöveges vagy hangbemenetek finomhangolás nélküli osztályozására is használható.
Google for Developers: Bring multimodal semantic search to the edge with EmbeddingGemma 2- Google Developers Blog
Google for Developers: EmbeddingGemma 2: The Developer Guide- Google Developers Blog

