Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Pika Soundtrack teljes hangkulisszát generál videókhoz

2026. augusztus 18.Forrás: Pika
A Pika Soundtrack teljes hangkulisszát generál videókhoz
Kép: Pika

A Pika Soundtrack videókhoz készít szinkronizált, teljes hangkulisszát, beleértve a hangeffekteket, a beszédet, a zenét és a környezeti hangokat. A Pika közlése szerint a modell a teljes bemeneti jelenet hosszán működik, és akár 2× költséghatékonyabb lehet a versenytárs videóból hangot generáló modelleknél.

A lényeg röviden
  • A Pika Soundtrack videóból teljes, szinkronizált hangkulisszát generál.
  • Hangeffekteket, beszédet, zenét és környezeti hangokat is készíthet.
  • A modell opcionális természetes nyelvű utasítást is figyelembe vesz.
  • A Pika saját benchmarkjában erős szemantikai illeszkedést és alacsony időbeli eltérést jelzett.
  • A szolgáltatás a Pika API Clubban érhető el.

A videó eseményeihez igazítja a hangokat

A Pika augusztus 18-án mutatta be a Pika Soundtracket. A modell egy feltöltött videóból olyan új hangsávot készít, amely követi a látható mozgást és az események időzítését. A rendszer mozgásérzékeny hangeffekteket, beszédet, zenét és atmoszférát generál, a felhasználó pedig természetes nyelvű utasítással meghatározhatja, mit emeljen ki, mit tartalmazzon a hangkulissza, illetve mit hagyjon ki.

A Pika példája szerint egyetlen, harminc másodperces, fokozatosan intenzívebbé váló dob szólója is kérhető. A videóhoz nem szükséges külön hangforrást biztosítani, a modell a látott jelenet és az utasítás alapján állítja elő a teljes hangsávot.

A háttérben videó, szöveg és hang együtt dolgozik

A Pika Soundtrack transformer-alapú látens diffúziós modell. A rendszer a videót először tömörített vizuális tokenek sorozatává alakítja, amelyek megőrzik többek között az időzítést, a tárgyak mozgását, a jelenet elrendezését és a képkockánkénti cselekvések jeleit. A szöveges utasítás szemantikai tokenekké alakul, amelyek olyan elemeket írhatnak le, mint a lépések, a szél, a víz, az ütközések vagy az atmoszféra.

A hangot a modell szintén tömörített látens térben hozza létre. A zajos hangreprezentációt fokozatosan tisztítja, miközben minden lépésben figyelembe veszi a videó és a szöveg tokenjeit. Így egyszerre próbálja meghatározni, milyen hang szóljon, és azt is, mikor jelenjen meg.

A fejlesztés egyik fő nehézsége a Pika szerint a jelenet hosszán át fennmaradó időbeli összhang. A rendszernek a közeli hangeffekteket, a háttérzajt, a tér akusztikáját, a kamera mozgását és a hallgató feltételezett helyzetét is kezelnie kell. A Pika a teljes jelenetek gyorsabb feldolgozásához desztillációt, aktivációs és kontextus-gyorsítótárat, valamint ritkított figyelmet használ.

A Pika saját méréseiben erős összehangolást jelzett

A vállalat benchmarkjában különböző felbontású videók szerepeltek, köztük fizikai ütközések, állatok, időjárási jelenségek, víz, sport, emberi mozgás, zenei előadás, beszédszerű tevékenység, természetes atmoszféra és filmes jelenetek. A Pika Soundtracket az LTX-2.3 Foley V2A, a HunyuanVideo-Foley és az MMAudio v2 modellekkel vetették össze.

A Pika beszámolója szerint saját tesztjükben a Soundtrack érte el a legerősebb szemantikai illeszkedést és a legalacsonyabb audiovizuális időbeli eltérést, miközben a teljes bemeneti időtartamot lefedte. A hangminőséget és változatosságot mérő osztályozó alapú mutatókban az MMAudio v2 végzett az élen.

A sebességadatokat eltérő környezetekben mérték: egyes modelleknél hosztolt, végponttól végpontig működő API-kat, másoknál összeadott részhosszúságú következtetést vagy melegített, saját üzemeltetésű futtatást használtak. A Pika ezért ezeket működési megfigyelésként, nem azonos hardveren végzett kontrollált összehasonlításként mutatja be. A vállalat szerint az elért sebesség akár 2× költséghatékonyságot tesz lehetővé a vizsgált modellekhez képest.

A Soundtrack már elérhető a Pika API Clubban

A modell használható néma felvételek természetes zörejekkel való kiegészítésére, jelenetek atmoszférájának felépítésére, filmes hangtervezésre vagy ugyanahhoz a vizuális forráshoz készített eltérő hangirányokra. A Pika Soundtrack jelenleg a Pika API Clubban érhető el.

A vállalat jövőbeli tervei között szerepel a hosszabb időtartamú generálás, az eseményszintű vezérlés javítása, a térbeli és akusztikai perspektíva pontosítása, valamint a beszéd és a többnyelvű szinkronizálás célzott kutatása. A Soundtrack a Pika korábbi, szövegből hanghatást készítő Real-Time Text-to-SFX eszközétől abban különbözik, hogy a kiindulópontja egy vizuális sorozat, amelyből a rendszer időben meghatározza a hallható eseményeket.

Kapcsolódó hírek

A Pika egy platformba vonja össze a videó-, kép- és hangkészítést
Termékek és eszközök2026. szeptember 17.

A Pika egy platformba vonja össze a videó-, kép- és hangkészítést

Megújult a Pika: az AI kreatív platform egy helyen kínál videó-, kép- és hangkészítő eszközöket. A szeptember 17-én bemutatott szolgáltatás több mint 25 alkalmazással…

A Pika négy új hangmodellt indított, akár húszszoros árkülönbséget ígér
Modellek2026. augusztus 14.

A Pika négy új hangmodellt indított, akár húszszoros árkülönbséget ígér

Négy generatív hangmodellt mutatott be a Pika, amelyek videók hangosítására, zeneszerzésre, hangeffektek készítésére és beszédszintézisre használhatók. A vállalat…

A Pika egyetlen API-ba gyűjt több mint 100 AI-modellt
Termékek és eszközök2026. augusztus 5.

A Pika egyetlen API-ba gyűjt több mint 100 AI-modellt

A Pika elindította a Pika API Clubot, amely egyetlen API-kulccsal több mint 100 videó-, kép-, hang-, beszéd- és nyelvi modellhez ad hozzáférést. A vállalat szerint a…