Apple-kutatás segítene olcsóbban annotálni a jelnyelvi videókat

A jelnyelvi értelmezést támogató AI-rendszerek egyik fő akadálya a jó minőségű, annotált adat hiánya. Az Apple kutatói olyan eljárást dolgoztak ki, amely jelnyelvi videókból és angol szövegből rangsorolt, időzített annotációs javaslatokat készít.
- Az Apple-kutatás jelnyelvi videókhoz készít pszeudoannotációs javaslatokat.
- A folyamat videót és angol szöveget használ bemenetként, időintervallumokat is ad.
- A kutatók 6,7 százalékos CER-t értek el FSBoardon és 74 százalékos top-1 pontosságot ASL Citizenön.
- Egy professzionális tolmács közel 500 ASL STEM Wiki videót annotált referenciaanyagként.
- Több mint 300 órányi pszeudoannotáció jelenik meg kiegészítő anyagként.
Részben kihasznált adatkészletekre épít az új módszer
Az Apple gépi tanulási kutatási oldalán szereplő, Bootstrapping Sign Language Annotations with Sign Language Models című munka a hozzáférhetőség és a számítógépes látás területéhez kapcsolódik. A publikáció a CVPR-konferenciához kötődik, a forrás szerint 2026 áprilisában jelent meg, az Apple oldala pedig 2026. szeptember 11-i dátummal hivatkozik rá.
A kutatók szerint az AI-alapú jelnyelvi értelmezés fejlődését korlátozza, hogy kevés a jó minőségű, annotált adat. Bár az ASL STEM Wiki és a FLEURS-ASL újabb adatkészletei professzionális tolmácsokat és több száz órányi anyagot tartalmaznak, csak részben vannak annotálva. A forrás szerint ennek egyik oka, hogy ekkora léptékben az annotálás költségei visszatartó erejűek.
Videóból és angol szövegből készülnek annotációs javaslatok
A bemutatott pszeudoannotációs folyamat jelnyelvi videót és angol nyelvű bemenetet használ, majd rangsorolt javaslatokat ad vissza. Ezek az annotációk időintervallumokat is tartalmaznak, és a forrás három típust említ: glosszákat, betűzött szavakat és jelosztályozókat.
Az eljárás több összetevőből épül fel. A kutatók a betűzésfelismerő és az izolált jelfelismerő, vagyis ISR modell ritka előrejelzéseit használják, valamint egy K-Shot LLM megközelítést alkalmaznak az annotációk becslésére. A munka részeként egyszerű, de a szerzők szerint hatékony alapmodelleket is létrehoztak betűzésfelismeréshez és ISR-hez.
Az Apple oldalán közölt eredmények szerint a betűzésfelismerő modell az FSBoard adatkészleten 6,7 százalékos CER értéket ért el, míg az izolált jelfelismerő modell az ASL Citizen adatkészleten 74 százalékos top-1 pontosságot. A forrás ezeket state-of-the-art eredményként jelöli meg.
Emberi referencia és több mint 300 órányi gépi annotáció
A módszer ellenőrzéséhez és egy arany standard benchmark létrehozásához egy professzionális tolmács az ASL STEM Wiki közel 500 videóját annotálta. Ezek az emberi annotációk szekvenciaszintű glosszcímkéket tartalmaznak, köztük glosszákat, osztályozókat és betűzési jeleket.
A forrás szerint az emberi annotációkat, valamint több mint 300 órányi pszeudoannotációt kiegészítő anyagként tesznek közzé. A szerzők között Colin Lea, Vasileios Baltatzis, Connor Gillis, Raja Kushalnagar, Lorna Quandt és Leah Findlater szerepel. A forrás jelöli, hogy Raja Kushalnagar és Lorna Quandt a Gallaudet Universityhez kapcsolódik, és a munka az Apple-nél töltött idő alatt készült.
Mit jelenthet ez a felhasználóknak és a kutatóknak
A hír jelentősége abban áll, hogy a jelnyelvi AI-rendszerekhez szükséges adatok előállítása a forrás szerint költséges és korlátozó tényező. Egy olyan folyamat, amely meglévő videókhoz automatikusan annotációs javaslatokat készít, segítheti a részben annotált adatkészletek jobb kihasználását.
A felhasználók számára ebből közvetlen termékbejelentés nem következik, a forrás kutatási munkáról és kiegészítő anyagként kiadott annotációkról szól. A piac és a kutatói közösség szempontjából a lényeg az, hogy az Apple kutatása több jelnyelvi adatra és összehasonlíthatóbb benchmarkra adhat alapot, ami a jelnyelvi feldolgozás későbbi fejlesztéseit támogathatja.


