A Murf szerint a jó AI-szinkron alapja a kontextusos fordítás

A Murf szerint az AI-szinkronizálás minőségét elsősorban a fordítás határozza meg, nem önmagában a hang természetessége. A vállalat saját benchmarkjében a Murf, a HeyGen és az ElevenLabs megoldásait vizsgálta MQM-alapú értékeléssel, miközben bemutatta kontextusérzékeny fordítási rendszerét.
- A Murf szerint az AI-szinkron minőségét alapvetően a fordítás pontossága határozza meg.
- A vállalat kontextusérzékeny nyelvi modellt és külön Judge ellenőrző réteget használ.
- A rendszer a beszédet először elválasztja a háttérzajtól és a zenei elemektől.
- Az időzítési eltéréseket rövidebb újrafordítással kezeli a Murf.
- A benchmark a Murf, a HeyGen és az ElevenLabs megoldását hasonlítja össze MQM-pontozással.
A szó szerinti fordítás kevés lehet
A Murf augusztus 20-án közzétett elemzése szerint az AI-szinkronizálás egyik legfontosabb problémája a fordítás minősége. A vállalat úgy látja, hogy a legtermészetesebb mesterséges hang sem tudja megmenteni a videót, ha a felolvasott szöveg ügyetlen, túl szó szerinti vagy pontatlan.
A cég szerint a lokalizációban hosszú ideig elterjedt neurális gépi fordítás (NMT) mondatról mondatra alakítja át a szöveget, és kevéssé veszi figyelembe, ki beszél, ki hallgatja a tartalmat, illetve milyen célra készült a videó. Emiatt kimaradhatnak mondatok vagy fontos pontosítások, megjelenhetnek a forrásban nem szereplő fordulatok, és hibás lehet a szakterminológia.
A Murf további problémaként említi a formális és közvetlen megszólítás váltakozását, a márkahanghoz nem illő stílust, valamint a nemekre, névmásokra és szerepekre vonatkozó pontatlanságokat. Ezek miatt a lokalizációs csapatoknak jelentős utómunkára lehet szükségük.
A vállalat felhasználói a kontextust hiányolják
A Murf vállalati ügyfelekkel készített interjúi alapján a felhasználók nem pusztán helyes szavakat várnak. A vállalat közlése szerint a képzési vezetőknek fontos, hogy egyetlen pontosítás se maradjon ki, mert ez megváltoztathatja az oktatási anyag jelentését, és megfelelési kockázatot okozhat.
A lokalizációs minőségbiztosítással foglalkozó szakemberek a névmások, a nemek és a szerepek pontos megőrzését tartják lényegesnek. A marketingvezetők a nem szándékolt jelentésváltozást és a márkakockázatot emelték ki, míg a márkamenedzserek a címek, megnevezések és cégnevek változatlan kezelését várják el.
A videószerkesztők számára az időzítés különösen fontos. A Murf példája szerint ha a spanyol nyelvű szöveg 30 százalékkal hosszabb az eredetinél, a szinkronhangnak fel kell gyorsulnia, ami természetellenes hatást kelthet.
Többlépcsős fordítási folyamatot használ a Murf
A Murf saját megoldása több, nagy nyelvi modellekre épülő lépésből áll. A folyamat először a beszédet választja le a háttérzenéről, a hanghatásokról és a környezeti zajról. A vállalat szerint ezzel elkerülhető, hogy a rendszer háttérben szóló dalszöveget vagy visszhangot beszédként kezeljen.
Ezután egy kontextusérzékeny nyelvi modell a felhasználási célt, a közönséget és a hangnemet is figyelembe veszi. Más megközelítés szükséges egy vállalati képzési anyagnál, egy technikai termékbemutatónál és egy közösségi médiás reklámnál.
A létrehozott fordítást egy második, úgynevezett Judge modell ellenőrzi. A Murf szerint ez a réteg a jelentést, a kontextust és a szöveg koherenciáját vizsgálja. Ellenőrzi többek között, hogy nem maradt-e ki mondat, nem torzult-e a jelentés, illeszkedik-e a hangnem a célközönséghez, és következetesek maradtak-e a kulcsfontosságú kifejezések hosszabb videókban is.
Az utolsó lépés az időtartamhoz igazítás. Ha a fordítás nem fér bele az eredeti szegmens idejébe, a rendszer rövidebb változatot készít úgy, hogy közben megőrizze a kontextust, a hangnemet és a fontos szakmai kifejezéseket. A Murf szerint ezzel elkerülhető a hang mesterséges felgyorsítása.
MQM-alapú összehasonlítást készített a cég
A bejegyzés címe szerint a Murf MQM-pontozást használó benchmarkben vetette össze a Murf, a HeyGen és az ElevenLabs megoldását. Az értékelés a fordítás pontosságára, a kontextus kezelésére és az időzítésre összpontosít.
A közzétett részlet a vizsgálat módszertanát és a Murf fordítási architektúráját ismerteti, konkrét pontszámokat vagy rangsort azonban nem közöl. A felhasználók számára a bejelentés fő üzenete az, hogy a vállalat az AI-szinkront teljes fordítási folyamatként kezeli, amelyben a hanggenerálás előtt a jelentés, a stílus, a következetesség és a videó időzítése is ellenőrzést kap.


