Pika Speech: öt másodpercnyi hangból készít beszédet a modell

A Pika bemutatta a Pika Speech nevű szövegfelolvasó modelljét, amely néhány másodpercnyi referenciahangból képes hangot klónozni, és egy kérésben akár öt percnyi beszédet generálni. A vállalat szerint a rendszer 48 kHz-es hangot készít, miközben a beszéd tempója, stílusa és hossza is szabályozható.
- A Pika Speech néhány másodpercnyi hangmintából képes hangot klónozni.
- Egy kérésben legfeljebb öt perc beszédet generál.
- A modell 48 kHz-es hangot készít, a tempó és az időtartam szabályozható.
- A tanításához 403 000 órányi szűrt beszédet használtak.
- A Pika szerint a szolgáltatás ára 0,01 dollár percenként.
Hangklónozás néhány másodpercnyi mintából
A Pika Speech egy 3 milliárd paraméteres, úgynevezett flow-matching transzformer. A Pika leírása szerint a modell néhány másodpercnyi referenciahang alapján képes egy hang karakterét átvenni, majd a megadott szöveget azzal megszólaltatni.
A rendszer a beszéd stílusát, tempóját és időtartamát is vezérelhetővé teszi. A Pika bemutatója többféle példát említ, köztük hangklónozást, előre beállított hangot, reklámszöveget és narrációt. A modell egy kérésben legfeljebb öt perc beszédet készít.
A vállalat szerint a Pika Speech a Pika API Clubon próbálható ki.
A modell a beszéd végét is előre látja
A Pika Speech a hangot egy tömörített, látens térben dolgozza fel. A variációs autoenkóder, vagyis VAE, a 48 kHz-es sztereó hangot másodpercenként 25 látens képkockára és képkockánként 128 csatornára tömöríti. Egyperces hanganyag így 1500 tokenből áll.
A generálást egy 48 blokkból álló, 3 milliárd paraméteres diffúziós transzformer végzi. A Pika szerint a flow matching lehetővé teszi, hogy a zajból beszéddé alakuló folyamatot mindössze nyolc vagy még kevesebb lépésre sűrítsék.
A beszéd hosszát és tempóját a modellbe épített EOS latent vezérli. Ez egy olyan jel, amely megmutatja, hogy a beszédnek hol kell véget érnie. Korábbi pozíció tömörebb előadást, későbbi pozíció lassabb, szellősebb megszólalást eredményezhet. A streaming változat külön előrejelzőt használ annak meghatározására, hogy véget ért-e már a beszéd.
403 ezer órányi beszéden tanították
A végső tanítási adathalmaz 403 000 órányi szűrt beszédet tartalmaz. Ebben nyílt adatbázisokból származó társalgási, felolvasott és kifejező angol, illetve kínai beszéd, valamint nagy mennyiségű, valós környezetből gyűjtött hanganyag is szerepel.
A felvételeket beszédaktivitás alapján szegmentálták, zajszűrést és hangerő-normalizálást alkalmaztak, majd minőség alapján szűrték őket. A beszédhez automatikus átirat készült, a felvételeket pedig a modell vezérlésére szolgáló stílusleírásokkal látták el. A Pika azt írja, hogy a jövőben további nyelvi adatokat is hozzáad a modellekhez.
A Pika szerint az egyik leggyorsabb és legolcsóbb megoldás
A Pika helyi tesztjeiben a háromperces kérések real-time faktora, vagyis a generálási idő és a kész hang hosszának aránya, 0,02 volt. Ez azt jelenti, hogy a vállalat meghatározása szerint egy perc beszéd elkészítése körülbelül 1,2 másodpercet vesz igénybe.
A kis késleltetéshez a Pika több technikát használ, köztük FlashAttention-3-at, a hosszú kérések mondathatárok mentén történő csomagolását, lefordított hangkódolót és CUDA-grafikonokat. A cég szerint ezekkel az egyperces generálás idejét 1,29 másodpercről 1,04 másodpercre csökkentették.
A Pika saját, 2026. augusztus 14-én rögzített áradatai alapján a modell percenként 0,01 dollárba kerül. A vállalat ezt 9-szer költséghatékonyabbnak írja az ElevenLabs v3-nál, 4,5-szer kedvezőbbnek a Cartesia és az ElevenLabs Turbo megoldásainál, valamint kétszer kedvezőbbnek a Fish Audiónál.
A bemutatott összehasonlító táblázatban a Pika Speech angol WER-értéke 1,990 százalék, kínai CER-értéke 1,727 százalék, a beszélőhöz való hasonlóság mérőszáma pedig angolul 80,30, kínaiul 75,41. A közölt eredmények szerint a szolgáltatás alacsony ár és gyors generálás mellett hangklónozást, hosszabb narrációkat és szabályozható előadásmódot kínálhat a Pika API felhasználóinak.
Pika: Say Hello to Pika Speech


