A Pika négy új hangmodellt indított, akár húszszoros árkülönbséget ígér

Négy generatív hangmodellt mutatott be a Pika, amelyek videók hangosítására, zeneszerzésre, hangeffektek készítésére és beszédszintézisre használhatók. A vállalat szerint az új modellek akár húszszor költséghatékonyabbak más hangmodelleknél, és már elérhetők a Pika API Clubban.
- A Pika Soundtrack videóhoz igazított zenét, beszédet, környezeti hangokat és hangeffekteket készít.
- A Pika Music szövegből, dalszövegből és referenciahangokból generálhat legfeljebb hatperces dalokat.
- A Pika SFX legfeljebb 20 másodperces, 44,1 kHz-es sztereó hangeffekteket hoz létre.
- A Pika Speech hangklónozást, 48 kHz-es hangot és legfeljebb ötperces kéréseket támogat.
- A modellek a Pika API Clubban érhetők el, a vállalat szerint akár 20-szor alacsonyabb költséggel.
Négy modell a generatív hang teljes spektrumára
A Pika 2026. augusztus 14-én jelentette be első, generatív hangmodellekből álló termékcsaládját. A Pika Soundtrack videóból készít összehangolt hangkulisszát, amely zenét, beszédet, környezeti hangokat és a mozgáshoz igazított hangeffekteket is tartalmazhat.
A Pika Music szöveges utasításokból, dalszövegekből, hangokból és referenciafelvételekből állít össze teljes dalokat. A Pika SFX természetes nyelvű leírás alapján generál hangeffekteket, míg a Pika Speech szöveget alakít kifejező beszéddé előre beállított hangokkal vagy a felhasználó hangklónjával.
A modellek külön-külön is használhatók, de a Pika szerint kombinálhatók is. Így a Soundtrack egy jelenet teljes hangzását készítheti el, az SFX egyetlen részletet adhat hozzá, a Speech megszólaltathatja a szereplőket, a Music pedig elkészítheti a filmzenét.
A Pika az alacsony költségre épít
A vállalat állítása szerint az új modellek a piac legalacsonyabb árú hangmodelljei közé tartoznak, és akár 20-szor olcsóbbak más hangmodelleknél. A Pika ezt hatékonyabb tanítási és következtetési technikákkal, kevés lépésből álló generálással, valamint sebességre optimalizált infrastruktúrával magyarázza.
A Pika Soundtrack egy generált videómásodpercet átlagosan 0,617 másodperc alatt dolgoz fel, és a cég szerint kétszer költséghatékonyabb a hasonló videóból hangot készítő Hunyuan Foley modellnél. A Pika SFX az alternatíváknál akár 20-szor költséghatékonyabb lehet. A Pika Speech a vállalat összehasonlítása alapján 9-szer költséghatékonyabb az ElevenLabs v3-nál, 4,5-szer az ElevenLabs Turbo és a Cartesia modelljénél, valamint kétszer a Fish Audiónál. A Pika Music esetében a cég akár tízszeres költséghatékonyságot állít a hasonló zenei modellekhez képest. Az összehasonlítások 2026. augusztus 14-i hivatalos listaárakon alapulnak.
Videóhangosítás és zenekészítés
A Pika Soundtrack üres prompttal teljes hangképet készíthet, vagy a felhasználó megadhatja, mit emeljen ki, mit tartalmazzon, illetve mit hagyjon ki. A modellnek a Pika szerint fel kell ismernie, mi történik a képen, a megfelelő pillanatban kell elhelyeznie a hangokat, és a teljes videón keresztül következetes hangzást kell fenntartania.
A vállalat teljes időtartamú tesztjében a Soundtrack érte el a legerősebb szemantikai illeszkedést és a legalacsonyabb hang-kép elcsúszást a vizsgált modellek között. A tesztben 529 másodpercnyi videót fedett le, generált másodpercenként 0,617 másodperces feldolgozási idővel. Az összevetésben az LTX-2.3 Foley V2A, a HunyuanVideo-Foley és az MMAudio v2 szerepelt.
A Pika Music legfeljebb hatperces számokat készít. A bemenet lehet szöveges prompt, dalszöveg, énekhang- vagy zenei referencia, illetve ezek kombinációja. A Pika tesztje szerint egy 90 másodperces dal generálása átlagosan 6,21 másodpercig tartott, ami nagyjából a lejátszási idő 14,5-szerese.
Hangeffektek és beszéd a Pika API Clubban
A Pika SFX egyetlen hangeseményt vagy hosszabb jelenetet is létrehozhat, például üvegtörést, fémajtó csapódását vagy egy ital kitöltését. A leírásban megadható az anyag, a tér, a perspektíva, az időzítés, a textúra és a hangulat. A modell legfeljebb 20 másodperces, 44,1 kHz-es sztereó hangot generálhat. A Pika helyi tesztjében a teljes generálási folyamat átlagosan 0,847 másodpercet vett igénybe.
A Pika Speech 48 kHz-es hangot készít, és legfeljebb ötperces kéréseket támogat. A felhasználó előre beállított hangot választhat, vagy néhány másodpercnyi referenciahangból klónt hozhat létre, majd a beszéd előadásmódját is irányíthatja. A Pika helyi tesztjeiben a modell 0,02-es valós idejű szorzót ért el, vagyis egy percnyi beszéd elkészítése körülbelül egy másodpercig tartott.
A négy modell jelenleg kizárólag a Pika API Clubban érhető el. A bejelentés alapján a szolgáltatás filmkészítéshez, játékprototípusokhoz, termékek fejlesztéséhez, történetmeséléshez és más kreatív munkafolyamatokhoz kínál hanggenerálási lehetőségeket.
Pika: Everything You Want to Hear


