A Resemble AI fizikai világot modellező deepfake-detektort mutatott be

A Resemble AI bemutatta a DETECT-World deepfake-detektort, amely a manipulációk felismeréséhez a tartalom fizikai koherenciáját is vizsgálja. A vállalat szerint a modell az új, korábban nem látott generátorokkal szemben is gyorsabban alkalmazkodhat.
- A DETECT-World a fizikai koherenciát is vizsgálja a deepfake-felismerés során.
- A modell képekhez, videókhoz és hanganyagokhoz is használható.
- A belső teszteken a videófelismerés pontossága 98,2 százalékot ért el.
- A hangfelismerés 54 nyelvet támogat.
- A Resemble AI szerint a modell korábban nem látott generátorokkal szemben is gyorsabban alkalmazkodhat.
A generátorok jelei helyett a fizikai valóság is számít
A Resemble AI augusztus 12-én ismertette a DETECT-World modellt, amelyet a cég a deepfake-felismerés első világmodelljeként mutatott be. A vállalat szerint a korábbi detektorok elsősorban a pixelek, frekvenciák és biometrikus jelek alapján keresték a már ismert generátorokra jellemző mintázatokat.
Ez a megközelítés az új generátorok megjelenésekor gyengülhet. A Resemble AI a Vector Institute 2026-os kutatásaira és a Hugging Face adatára hivatkozva azt írja, hogy a platformon már több mint 2,2 millió AI-modellváltozat található, számuk pedig évről évre csaknem megduplázódik.
A DETECT-World ezért azt is vizsgálja, hogy egy jelenet megfelel-e a fizikai valóság szabályainak. A modell ellenőrzi többek között a fényviszonyokat, a geometriát, a mozgást, valamint a hang és a kép szinkronját. Így nem feltétlenül kell korábban találkoznia azzal a generátorral, amely a manipulált tartalmat létrehozta.
Háromféle kimenetet ad a képekhez és videókhoz
A DETECT-World a Resemble AI detektormodelljeinek harmadik generációja. A DETECT-2B hangfelismerő modell volt, amely a vállalat szerint 30-nál több nyelven 94 százalékos pontosságot ért el, 200 ezredmásodperces késleltetés mellett. A DETECT-3B Omni már a hangot, a képet és a videót is egyetlen API-n keresztül kezelte.
Az új modell World-Vision Hybrid Encoder nevű feldolgozót használ. A videókat 4 másodperces ablakokban, másodpercenként 40 képkockával dolgozza fel, a képeket pedig statikus klipekként kezeli. Az eredményekből háromféle kimenet készül: a manipuláció általános valószínűsége, a videó azon képkockái, ahol az eltérés jelentkezik, valamint egy térbeli hőtérkép arról, hogy a képen hol koncentrálódik a manipuláció.
A modell többek között azt keresheti, hogy az arc megvilágítása összhangban van-e a jelenet fényforrásaival, a vetett árnyék megfelel-e a fény irányának és erősségének, illetve a háttér mozgása összhangban van-e az előtér mozgásával.
Belső teszteken javultak a mutatók
A modellt több száz különböző manipulált kép- és videóforráson tanították. A források között arccserék, ajakszinkronos és beszélőfejes újraanimálások, teljesen szintetikus szövegből videót és képből videót létrehozó rendszerek, részleges szerkesztések, valamint GAN- és diffúziós modellek szerepeltek.
A Resemble AI belső tesztjein a DETECT-World hangfelismerési pontossága 99,47 százalék volt a Podonos külsőleg validált tesztjén, szemben a DETECT-3B Omni 98,05 százalékával. A képfelismerés 86,70 százalékról 95,8 százalékra, a videófelismerés pedig 80,96 százalékról 98,2 százalékra javult. A kép- és videóeredményeket a vállalat belső tesztként jelölte meg, külső validálásuk folyamatban van.
A cég egy Haotian-stílusú, valós idejű arccseretámadást is tesztelt. Állítása szerint a DETECT-World ezt hozzávetőleg 95 százalékos pontossággal ismerte fel úgy, hogy korábban nem találkozott vele. A hangdetektor 54 nyelvet támogat, és a Resemble AI szerint javult a VoIP-streaming és a csomagvesztéses helyzetek kezelése is.
Resemble AI: Introducing DETECT-World: The First World Model for Deepfake Detection


