Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Pika Speech: öt másodpercnyi hangból készít beszédet a modell

2026. augusztus 18.Forrás: Pika
Pika Speech: öt másodpercnyi hangból készít beszédet a modell
Kép: Pika

A Pika bemutatta a Pika Speech nevű szövegfelolvasó modelljét, amely néhány másodpercnyi referenciahangból képes hangot klónozni, és egy kérésben akár öt percnyi beszédet generálni. A vállalat szerint a rendszer 48 kHz-es hangot készít, miközben a beszéd tempója, stílusa és hossza is szabályozható.

A lényeg röviden
  • A Pika Speech néhány másodpercnyi hangmintából képes hangot klónozni.
  • Egy kérésben legfeljebb öt perc beszédet generál.
  • A modell 48 kHz-es hangot készít, a tempó és az időtartam szabályozható.
  • A tanításához 403 000 órányi szűrt beszédet használtak.
  • A Pika szerint a szolgáltatás ára 0,01 dollár percenként.

Hangklónozás néhány másodpercnyi mintából

A Pika Speech egy 3 milliárd paraméteres, úgynevezett flow-matching transzformer. A Pika leírása szerint a modell néhány másodpercnyi referenciahang alapján képes egy hang karakterét átvenni, majd a megadott szöveget azzal megszólaltatni.

A rendszer a beszéd stílusát, tempóját és időtartamát is vezérelhetővé teszi. A Pika bemutatója többféle példát említ, köztük hangklónozást, előre beállított hangot, reklámszöveget és narrációt. A modell egy kérésben legfeljebb öt perc beszédet készít.

A vállalat szerint a Pika Speech a Pika API Clubon próbálható ki.

A modell a beszéd végét is előre látja

A Pika Speech a hangot egy tömörített, látens térben dolgozza fel. A variációs autoenkóder, vagyis VAE, a 48 kHz-es sztereó hangot másodpercenként 25 látens képkockára és képkockánként 128 csatornára tömöríti. Egyperces hanganyag így 1500 tokenből áll.

A generálást egy 48 blokkból álló, 3 milliárd paraméteres diffúziós transzformer végzi. A Pika szerint a flow matching lehetővé teszi, hogy a zajból beszéddé alakuló folyamatot mindössze nyolc vagy még kevesebb lépésre sűrítsék.

A beszéd hosszát és tempóját a modellbe épített EOS latent vezérli. Ez egy olyan jel, amely megmutatja, hogy a beszédnek hol kell véget érnie. Korábbi pozíció tömörebb előadást, későbbi pozíció lassabb, szellősebb megszólalást eredményezhet. A streaming változat külön előrejelzőt használ annak meghatározására, hogy véget ért-e már a beszéd.

403 ezer órányi beszéden tanították

A végső tanítási adathalmaz 403 000 órányi szűrt beszédet tartalmaz. Ebben nyílt adatbázisokból származó társalgási, felolvasott és kifejező angol, illetve kínai beszéd, valamint nagy mennyiségű, valós környezetből gyűjtött hanganyag is szerepel.

A felvételeket beszédaktivitás alapján szegmentálták, zajszűrést és hangerő-normalizálást alkalmaztak, majd minőség alapján szűrték őket. A beszédhez automatikus átirat készült, a felvételeket pedig a modell vezérlésére szolgáló stílusleírásokkal látták el. A Pika azt írja, hogy a jövőben további nyelvi adatokat is hozzáad a modellekhez.

A Pika szerint az egyik leggyorsabb és legolcsóbb megoldás

A Pika helyi tesztjeiben a háromperces kérések real-time faktora, vagyis a generálási idő és a kész hang hosszának aránya, 0,02 volt. Ez azt jelenti, hogy a vállalat meghatározása szerint egy perc beszéd elkészítése körülbelül 1,2 másodpercet vesz igénybe.

A kis késleltetéshez a Pika több technikát használ, köztük FlashAttention-3-at, a hosszú kérések mondathatárok mentén történő csomagolását, lefordított hangkódolót és CUDA-grafikonokat. A cég szerint ezekkel az egyperces generálás idejét 1,29 másodpercről 1,04 másodpercre csökkentették.

A Pika saját, 2026. augusztus 14-én rögzített áradatai alapján a modell percenként 0,01 dollárba kerül. A vállalat ezt 9-szer költséghatékonyabbnak írja az ElevenLabs v3-nál, 4,5-szer kedvezőbbnek a Cartesia és az ElevenLabs Turbo megoldásainál, valamint kétszer kedvezőbbnek a Fish Audiónál.

A bemutatott összehasonlító táblázatban a Pika Speech angol WER-értéke 1,990 százalék, kínai CER-értéke 1,727 százalék, a beszélőhöz való hasonlóság mérőszáma pedig angolul 80,30, kínaiul 75,41. A közölt eredmények szerint a szolgáltatás alacsony ár és gyors generálás mellett hangklónozást, hosszabb narrációkat és szabályozható előadásmódot kínálhat a Pika API felhasználóinak.

Kapcsolódó hírek

A Pika egy platformba vonja össze a videó-, kép- és hangkészítést
Termékek és eszközök2026. szeptember 17.

A Pika egy platformba vonja össze a videó-, kép- és hangkészítést

Megújult a Pika: az AI kreatív platform egy helyen kínál videó-, kép- és hangkészítő eszközöket. A szeptember 17-én bemutatott szolgáltatás több mint 25 alkalmazással…

A Pika négy új hangmodellt indított, akár húszszoros árkülönbséget ígér
Modellek2026. augusztus 14.

A Pika négy új hangmodellt indított, akár húszszoros árkülönbséget ígér

Négy generatív hangmodellt mutatott be a Pika, amelyek videók hangosítására, zeneszerzésre, hangeffektek készítésére és beszédszintézisre használhatók. A vállalat…

Érzelmesebb hangot ad a hangalapú ügynököknek a LiveKit új módja
Termékek és eszközök2026. augusztus 12.

Érzelmesebb hangot ad a hangalapú ügynököknek a LiveKit új módja

A LiveKit expressive mode funkciója a beszélgetés érzelmi kontextusához igazítja a hangalapú ügynökök előadásmódját. A vállalat szerint az új lehetőség egyetlen…