Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Google új multimodális modellje internet nélkül keres a telefonon

2026. október 6.Forrás: Google for Developers
A Google új multimodális modellje internet nélkül keres a telefonon
Kép: Google for Developers

A Google DeepMind bemutatta az EmbeddingGemma 2 nyílt súlyú, multimodális beágyazási modellt, amely szöveget, képeket, videoképkockákat és hangot egyetlen vektortérben kezel. A modell helyben futó keresési és médiavisszakeresési funkciókat kínál, internetkapcsolat nélkül.

A lényeg röviden
  • Az EmbeddingGemma 2 szöveget, képet, videót és hangot közös vektortérben kezel.
  • A modell 740 millió paraméteres, és helyi eszközökön való futtatásra készült.
  • Az AI Edge Gallery fotókban és videók konkrét jeleneteiben kínál offline keresést.
  • A Foresight Macen helyben segít a meetingek jegyzetelésében és visszakeresésében.
  • Az ML Kit és a MediaPipe Tasks támogatása a következő hetekben érkezik.

Kompakt modell helyi feldolgozáshoz

Az EmbeddingGemma 2 a Google AI Edge Team és az Android ML Team közleménye szerint 740 millió paraméterrel dolgozik, és kifejezetten helyi, adatvédelmi szempontból előnyös alkalmazásokhoz készült. A modell a szöveget, a képi tartalmakat, a videó képkockáit és a hangot közös vektortérbe képezi le.

Ez csökkentheti annak szükségességét, hogy a fejlesztők külön képfeliratozó, beszédfelismerő és szöveges beágyazási modelleket kapcsoljanak össze. A Google mérései szerint a szöveges súlyok körülbelül 191 MB aktív memóriával is futtathatók, a teljes multimodális modell pedig egy Google Pixel 11 Pro készüléken körülbelül 567 MB aktív memóriát használ.

A Google szerint az EmbeddingGemma 2 különösen alacsony késleltetésű döntési motorként is alkalmazható. Tanítóadatok és finomhangolás nélkül képes a felhasználói bemeneteket osztályozási címkékkel és leírásokkal összevetni, így ezredmásodpercek alatt végezhet nulla mintás szándékfelismerést és útválasztást.

Keresés fotókban és videókban, közvetlenül az eszközön

Az EmbeddingGemma 2 két új bemutatóban jelenik meg a Google AI Edge Gallery alkalmazásban. Az Instant Media Search természetes nyelvű lekérdezésekkel vagy példaképekkel keres a telefonon tárolt képek és videók között. A médiatartalmak beágyazási vektorait helyi SQLite-adatbázis tárolja, a találatokat pedig a koszinusz-hasonlóság alapján rangsorolja a rendszer.

A keresés gépelés közben frissül. A Google példája szerint a „Katze” lekérdezés a macskákat ábrázoló képeket jeleníti meg, a „Katze schläft auf Tastatur” kifejezés pedig újrarendezi a találatokat, és előrébb sorolja a billentyűzeten alvó macskáról készült fotót. A felhasználó saját képet vagy élő kameraképet is használhat vizuálisan és szemantikailag hasonló tartalmak keresésére.

A Video Moments Finder helyi videókban keres konkrét jeleneteket. A kiválasztott felvétel képi és hangdarabjait az eszköz indexeli, majd olyan lekérdezésekre keres egyező időpontokat, mint a „gyerekek nevetnek”, „kutya frizbit kap el” vagy „valaki elfújja a születésnapi gyertyákat”. A funkcióhoz nincs szükség hangátirat vagy köztes képfelirat létrehozására.

Foresight és fejlesztői eszközök

A Google AI Edge Foresight új, kísérleti Mac-alkalmazásként érhető el. A helyi feldolgozásra épülő meetingasszisztens jegyzetel, indexeli és visszakeresi a beszélgetések átiratait, valamint a személyes fájlokat. A rendszer közvetlenül a számítógép hangrendszeréhez és mikrofonjához kapcsolódik, ezért a Google szerint bármely meetingplatformmal működhet, teljesen offline is.

Az EmbeddingGemma 2 és a Gemma 4 modellek segítségével a Foresight kiegészíti a rövid jegyzeteket a megbeszélésből valós időben visszakeresett részletekkel, továbbá természetes nyelven keres képek, dokumentumok, átiratok és jegyzetek között. A Google kiemeli, hogy az érzékeny adatok nem hagyják el az eszközt, és a használathoz nincs szükség felhő-előfizetésre.

A fejlesztők számára az EmbeddingGemma 2 támogatása a következő hetekben érkezik az Androidhoz készült ML Kitbe. Az integráció NPU-gyorsítást is használhat, ha az adott eszköz támogatja, és automatikus modellfrissítéseket kínálhat. A MediaPipe Tasks Embedder és Semantic Retriever felületei iOS, macOS, Windows, Linux és webes célokra is egységes fejlesztési lehetőséget adnak.

A MediaPipe Universal Embedder Task nyers képekből vagy szövegből 768 dimenziós, illetve 128 és 512 dimenzió közötti csonkolt, normalizált vektorokat készít. A Semantic Retriever Task helyben indexel, és egy számjegyű ezredmásodperces hozzávetőleges legközelebbi szomszéd keresést kínál. Az EmbeddingGemma 2 a MediaPipe Decision Task segítségével képi, szöveges vagy hangbemenetek finomhangolás nélküli osztályozására is használható.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az EmbeddingGemma 2 akár 77-szer kevesebb memóriával is működhet
Kutatás2026. október 6.

Az EmbeddingGemma 2 akár 77-szer kevesebb memóriával is működhet

A Google új EmbeddingGemma 2 modellje telefonon is futtatható, a hozzá tartozó vektorok azonban nagy memóriát foglalhatnak. A Qdrant tesztje szerint tömörítéssel akár…

Élő avatárt kapott a Gemini 3.8 Live
Termékek és eszközök2026. szeptember 24. 18:20

Élő avatárt kapott a Gemini 3.8 Live

A Google DeepMind bemutatta a Gemini 3.8 Live with Live Avatar rendszert, amely valós idő közeli videógenerálással egészíti ki a hangalapú párbeszédet. A vállalat…

Új Gemini hangmodellek érkeztek egyedi beszédhangokhoz
Modellek2026. szeptember 23. 17:25

Új Gemini hangmodellek érkeztek egyedi beszédhangokhoz

Két új szövegfelolvasó modellel bővül a Gemini család: a Gemini 3.8 Flash TTS a kreatív hangtervezésre, a Gemini 3.8 Flash-Lite TTS pedig nagy volumenű használatra…