Jelnyelvről szövegre fordító modellt mutatott be a Google DeepMind
A Google DeepMind 2026. augusztus 12-én bemutatta SL2T nevű jelnyelvről szövegre fordító modelljét. A technológia elsőként az amerikai jelnyelv, ASL angol szöveggé alakítását támogatja Gboardban és Live Transcribe-ban Pixel 11-en.
- A Google DeepMind 2026. augusztus 12-én bemutatta az SL2T jelnyelvről szövegre fordító modellt.
- Az első funkciók ASL-ről angolra fordítanak Gboardban és Live Transcribe-ban Pixel 11-en.
- A modell több mint 100 000 órányi adaton tanult, több mint 50 jelnyelvből.
- Az SL2T a nyers videó helyett testpontok koordinátáit használja, a Google szerint adatvédelmi okokból.
- A Google további eszközöket és jelnyelveket ígér későbbre.
Jelnyelvi diktálás kerül a telefonokra
A Google DeepMind szerint az SL2T egy nagymértékben többnyelvű jelnyelvről szövegre fordító modell, amelyet a vállalat áttörésként ír le a minőség és az általánosíthatóság terén. A modell a Google közlése alapján először viszi ki a jelnyelvi AI-t a laborból fogyasztói termékekbe: az SL2T hajtja a jelnyelvről szövegre diktálást a Gboardban és a Live Transcribe-ban Pixel 11-en, kezdetben American Sign Language, ASL nyelvről angolra.
A vállalat azt írja, hogy további eszközök hamarosan érkeznek, később pedig újabb nyelvek is követik az első bevezetést. A funkció célja, hogy a siket és nagyothalló felhasználók ott használhassanak jelnyelvi bevitelt, ahol egyébként gépelnének. A Google példái szerint így lehet weben keresni, üzeneteket vagy dokumentumokat írni, illetve a Geminit kérdések megválaszolására vagy feladatok végrehajtására használni.
A Live Transcribe esetében a funkció arra szolgál, hogy beszélgetésekben a felhasználók gépelés helyett jelelhessék a válaszaikat. A Google DeepMind szerint a tesztelők úgy ítélték meg, hogy ASL-ben jelelni gyorsabb, természetesebb és kellemesebb, mint angolul gépelni.
Miért nehéz a jelnyelvi fordítás
A Google DeepMind a bejelentésben azt írja, hogy a világon több mint 200 jelnyelv létezik, és becslése szerint 70 millió siket és nagyothalló ember használja ezeket. A vállalat szerint a beszélt nyelvek feldolgozása az elmúlt évtizedekben gyorsan fejlődött, például az automatikus fordítás, a diktálás és a társalgási felületek területén, de ez a technológiai fejlődés eddig nem érte el ugyanilyen módon a jelnyelveket.
A forrás két fő kihívást emel ki. Az egyik, hogy a beszédleírás általában hangból szövegbe történő leképezés ugyanazon a nyelven, a jelnyelvek viszont önálló természetes nyelvek saját nyelvtannal és szókinccsel. Ezért valódi gépi fordításra van szükség, nem egyszerű jelről szóra alakításra. A másik nehézség, hogy a modellnek látnia és értelmeznie kell a fizikai mozgást.
A jelnyelvek jelentést hordoznak a kéz, a kar, a törzs, a fej és az arc egyidejű mozgásain keresztül. Ezek pontos követése nagy képkockasebességnél a Google szerint nehéz és számításigényes számítógépes látási feladat. A vállalat ezért bírálja az olyan korai megközelítéseket, mint a jelnyelvi kesztyűk, mert a jelnyelvek nem egyszerűen angol szavak kézmozdulatokkal, hanem összetett vizuális és nyelvi rendszerek.
Több mint 100 000 órányi adat és pózpontok
Az SL2T-t a Google DeepMind egy felhasználóközpontú, kulturálisan tájékozott megközelítés és nagy léptékű adatskálázás kombinációjaként írja le. A modell több mint 100 000 órányi adaton tanult, több mint 50 jelnyelv alapján. Az adatok nagyjából negyede ASL volt. A vállalat szerint a különböző nyelveken, dialektusokon és jártassági szinteken végzett közös tanítás segített a modellnek közös alapstruktúrákat megtanulni, és a kísérletekben felülmúlta az egyetlen nyelvre épített modelleket.
Adatvédelmi okokból az SL2T nem nyers kameraképként dolgozza fel a jelnyelvet. A telefonon futó MediaPipe Holistic modell pontokat követ a jelelő testén, és a fordításhoz csak ezek a geometriai koordináták kerülnek a szerverre. A Google szerint így az eredeti videó azonnal eldobható.
A rendszer a koordinátasorozatot közvetlenül szöveggé fordítja, kihagyva a korábbi kutatásokban gyakran használt köztes annotációkat, az úgynevezett glosszákat. A Google DeepMind szerint ezek nem ragadják meg megfelelően a jelnyelvek gazdag, nem lineáris elemeit, például a nem manuális jelölőket és a térbeli szerkezeteket. A közvetlen, landmarkokból történő fordítás a vállalat szerint megszünteti a mesterséges szókincs-korlátokat, és lehetővé teszi, hogy a fordítás minősége az adatokkal együtt skálázódjon.
Benchmarkok, hibák és közösségi részvétel
A Google DeepMind állítása szerint az SL2T a legjobb képességű jelnyelvi fordítómodell a kulcsfontosságú mérőfeladatokon, például az ASL-ről angolra fordítás minőségét vizsgáló FLEURS-ASL sd-test benchmarkon. A modell ezen a teszten 70 BLEURT zero-shot pontszámot ért el, amit a vállalat jelentősen magasabbnak nevez minden korábban közölt eredménynél.
A cég ugyanakkor azt is hangsúlyozza, hogy az akadémiai benchmarkok önmagukban nem garantálják a valós használhatóságot. A fejlesztés során ezért foglalkoztak a streamelési késleltetés csökkentésével, a nem jelelő bemenetekre adott hallucinációk megelőzésével, a balkezes jelelők igazságos kezelésével, valamint az egykezes jelelés javításával. A forrás szerint a jelelők 10 százaléka balkezes, az egykezes jelelés pedig például akkor fordul elő, amikor valaki a másik kezében okostelefont tart.
A DeepMind példákat is közölt a FLEURS-ASL benchmarkból, és jelezte, hogy hibák továbbra is előfordulnak. A felsorolt problémák közé tartoznak a ritka jelek, a gyors betűzés, a passzív szerkezetek, a classifier depictions egyes elemeinek elhagyása, valamint az időkezelés kontextus nélküli bizonytalansága.
A projektben a Google DeepMind szerint a siket közösség szempontjai a kezdetektől szerepet kaptak. A koncepció Sam Sepah, egy siket Google-munkatárs részvételével indult, az adatgyűjtés siket partnerekkel zajlott, az értékelésben siket felhasználói vizsgálatok és siket szakértők vettek részt. A vállalat létrehozta az AI Sign Language Advisory Committee, AISLAC nevű testületet is, amely globális siket szervezeteket és szakértőket von be. Az SL2T 1.0 Gboard és Live Transcribe kiadásához közös hatásjelentést is készítettek.
Mit jelent ez a felhasználóknak
Az első bevezetés gyakorlati jelentősége az, hogy az ASL-t használó siket és nagyothalló felhasználók a támogatott Google-alkalmazásokban a megszokott gépelési helyzetek egy részét jelnyelvi bevitellel válthatják ki. A Google példái a keresést, az üzenetírást, a dokumentumkészítést, a Geminivel végzett feladatokat és a Live Transcribe-ban folytatott beszélgetéseket emelik ki.
A hatás egyelőre korlátozott: a funkció kezdetben ASL-ről angolra működik, Pixel 11-en, Gboardban és Live Transcribe-ban. A Google azt írja, hogy további eszközök és nyelvek később érkeznek. A vállalat hosszabb távon további jelnyelvekre, jelnyelv-generálásra és fejlettebb AI-képességekre szeretné kiterjeszteni a technológiát, azzal a céllal, hogy a jelnyelveken keresztüli hozzáférés a digitális környezetben szabványossá váljon.
Google DeepMind: Putting sign language AI into users’ hands


