Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Pika négy új hangmodellt indított, akár húszszoros árkülönbséget ígér

2026. augusztus 14.Forrás: Pika
A Pika négy új hangmodellt indított, akár húszszoros árkülönbséget ígér
Kép: Pika

Négy generatív hangmodellt mutatott be a Pika, amelyek videók hangosítására, zeneszerzésre, hangeffektek készítésére és beszédszintézisre használhatók. A vállalat szerint az új modellek akár húszszor költséghatékonyabbak más hangmodelleknél, és már elérhetők a Pika API Clubban.

A lényeg röviden
  • A Pika Soundtrack videóhoz igazított zenét, beszédet, környezeti hangokat és hangeffekteket készít.
  • A Pika Music szövegből, dalszövegből és referenciahangokból generálhat legfeljebb hatperces dalokat.
  • A Pika SFX legfeljebb 20 másodperces, 44,1 kHz-es sztereó hangeffekteket hoz létre.
  • A Pika Speech hangklónozást, 48 kHz-es hangot és legfeljebb ötperces kéréseket támogat.
  • A modellek a Pika API Clubban érhetők el, a vállalat szerint akár 20-szor alacsonyabb költséggel.

Négy modell a generatív hang teljes spektrumára

A Pika 2026. augusztus 14-én jelentette be első, generatív hangmodellekből álló termékcsaládját. A Pika Soundtrack videóból készít összehangolt hangkulisszát, amely zenét, beszédet, környezeti hangokat és a mozgáshoz igazított hangeffekteket is tartalmazhat.

A Pika Music szöveges utasításokból, dalszövegekből, hangokból és referenciafelvételekből állít össze teljes dalokat. A Pika SFX természetes nyelvű leírás alapján generál hangeffekteket, míg a Pika Speech szöveget alakít kifejező beszéddé előre beállított hangokkal vagy a felhasználó hangklónjával.

A modellek külön-külön is használhatók, de a Pika szerint kombinálhatók is. Így a Soundtrack egy jelenet teljes hangzását készítheti el, az SFX egyetlen részletet adhat hozzá, a Speech megszólaltathatja a szereplőket, a Music pedig elkészítheti a filmzenét.

A Pika az alacsony költségre épít

A vállalat állítása szerint az új modellek a piac legalacsonyabb árú hangmodelljei közé tartoznak, és akár 20-szor olcsóbbak más hangmodelleknél. A Pika ezt hatékonyabb tanítási és következtetési technikákkal, kevés lépésből álló generálással, valamint sebességre optimalizált infrastruktúrával magyarázza.

A Pika Soundtrack egy generált videómásodpercet átlagosan 0,617 másodperc alatt dolgoz fel, és a cég szerint kétszer költséghatékonyabb a hasonló videóból hangot készítő Hunyuan Foley modellnél. A Pika SFX az alternatíváknál akár 20-szor költséghatékonyabb lehet. A Pika Speech a vállalat összehasonlítása alapján 9-szer költséghatékonyabb az ElevenLabs v3-nál, 4,5-szer az ElevenLabs Turbo és a Cartesia modelljénél, valamint kétszer a Fish Audiónál. A Pika Music esetében a cég akár tízszeres költséghatékonyságot állít a hasonló zenei modellekhez képest. Az összehasonlítások 2026. augusztus 14-i hivatalos listaárakon alapulnak.

Videóhangosítás és zenekészítés

A Pika Soundtrack üres prompttal teljes hangképet készíthet, vagy a felhasználó megadhatja, mit emeljen ki, mit tartalmazzon, illetve mit hagyjon ki. A modellnek a Pika szerint fel kell ismernie, mi történik a képen, a megfelelő pillanatban kell elhelyeznie a hangokat, és a teljes videón keresztül következetes hangzást kell fenntartania.

A vállalat teljes időtartamú tesztjében a Soundtrack érte el a legerősebb szemantikai illeszkedést és a legalacsonyabb hang-kép elcsúszást a vizsgált modellek között. A tesztben 529 másodpercnyi videót fedett le, generált másodpercenként 0,617 másodperces feldolgozási idővel. Az összevetésben az LTX-2.3 Foley V2A, a HunyuanVideo-Foley és az MMAudio v2 szerepelt.

A Pika Music legfeljebb hatperces számokat készít. A bemenet lehet szöveges prompt, dalszöveg, énekhang- vagy zenei referencia, illetve ezek kombinációja. A Pika tesztje szerint egy 90 másodperces dal generálása átlagosan 6,21 másodpercig tartott, ami nagyjából a lejátszási idő 14,5-szerese.

Hangeffektek és beszéd a Pika API Clubban

A Pika SFX egyetlen hangeseményt vagy hosszabb jelenetet is létrehozhat, például üvegtörést, fémajtó csapódását vagy egy ital kitöltését. A leírásban megadható az anyag, a tér, a perspektíva, az időzítés, a textúra és a hangulat. A modell legfeljebb 20 másodperces, 44,1 kHz-es sztereó hangot generálhat. A Pika helyi tesztjében a teljes generálási folyamat átlagosan 0,847 másodpercet vett igénybe.

A Pika Speech 48 kHz-es hangot készít, és legfeljebb ötperces kéréseket támogat. A felhasználó előre beállított hangot választhat, vagy néhány másodpercnyi referenciahangból klónt hozhat létre, majd a beszéd előadásmódját is irányíthatja. A Pika helyi tesztjeiben a modell 0,02-es valós idejű szorzót ért el, vagyis egy percnyi beszéd elkészítése körülbelül egy másodpercig tartott.

A négy modell jelenleg kizárólag a Pika API Clubban érhető el. A bejelentés alapján a szolgáltatás filmkészítéshez, játékprototípusokhoz, termékek fejlesztéséhez, történetmeséléshez és más kreatív munkafolyamatokhoz kínál hanggenerálási lehetőségeket.

Kapcsolódó hírek

A Pika egy platformba vonja össze a videó-, kép- és hangkészítést
Termékek és eszközök2026. szeptember 17.

A Pika egy platformba vonja össze a videó-, kép- és hangkészítést

Megújult a Pika: az AI kreatív platform egy helyen kínál videó-, kép- és hangkészítő eszközöket. A szeptember 17-én bemutatott szolgáltatás több mint 25 alkalmazással…

A Pika Soundtrack teljes hangkulisszát generál videókhoz
Modellek2026. augusztus 18.

A Pika Soundtrack teljes hangkulisszát generál videókhoz

A Pika Soundtrack videókhoz készít szinkronizált, teljes hangkulisszát, beleértve a hangeffekteket, a beszédet, a zenét és a környezeti hangokat. A Pika közlése szerint…

Valós időben készít hanghatásokat szövegből a Pika új modellje
Modellek2026. augusztus 18.

Valós időben készít hanghatásokat szövegből a Pika új modellje

A Pika bemutatta a Pika SFX modellt, amely szöveges leírásból készít felhasználásra kész hanghatásokat valós időben. A rendszer egyetlen eseményt, összetett…