A Pika egyetlen modellben egyesíti a dalszöveg, a hang és a zenei referencia használatát

A Pika bemutatta a Pika Music nevű zene-generáló modellt, amely egyetlen munkafolyamatban képes szöveges leírásból, kész dalszövegből, hangreferenciából vagy meglévő zenéből teljes számot készíteni. A vállalat szerint a rendszer a különböző bemeneteket kombinálni is tudja.
- A Pika Music szövegből, dalszövegből, hangreferenciából és meglévő zenéből is teljes dalt generál.
- A különböző bemenetek egyetlen munkafolyamatban kombinálhatók.
- A Pika helyi tesztjeiben egy 90 másodperces dal átlagosan 6,21 másodperc alatt készült el.
- A hang- és zenei referenciák használatához a felhasználónak igazolnia kell a szükséges jogokat.
- A Pika 15 promptból álló, rögzített dalszöveges benchmarkot használ a rendszerek összehasonlítására.
Négyféle bemenetből indulhat a dal
A Pika Music használható egyszerű szöveges utasítással, amelyben a felhasználó megadhatja a műfajt, a hangulatot, a hangszereket, az ének karakterét, a hangszerelést vagy a dal felépítését. A Pika példája egy modern pop-R&B dalt ír le B-dúr mollban, 69 BPM-es tempóval, lo-fi textúrákkal, zongoradallammal, vinillemezes zajjal, szintetizátorpárnákkal és női főénekessel.
A dalszöveg külön bemenetként is megadható. A Pika szerint a szöveg a generálás részeként kerül a modellbe, így nem egy elkészült zenére illesztik rá utólag. A [verse] és [chorus] jelölések a dalszerkezetet, a versszakokat és a refrént is jelezhetik. A felhasználó ugyanazt a dalszöveget többféle zenei irányban is újragenerálhatja, például akusztikus balladaként, dance-pop dalként vagy filmszerű rockszámként.
A harmadik lehetőség egy rövid énekhang-referencia használata. Ez a hangszínt, az előadásmódot, a hang energiáját és karakterét irányíthatja, akár dalszöveggel és szöveges zenei leírással együtt. A Pika közlése szerint a felhasználónak igazolnia kell, hogy rendelkezik a feltöltött hang használatához szükséges jogokkal.
Zenei referencia is megadható. Ez a készülő dal textúráját, hangszerelését, energiáját és általános hangulatát befolyásolja, miközben a dalszöveg és a szöveges utasítás határozza meg a tartalmat. A vállalat ehhez is megköveteli annak elismerését, hogy a felhasználó jogosult a feltöltött zeneszám használatára.
Egy modell hangolja össze az eltérő utasításokat
A Pika Music többféle vezérlője különböző információkat ad át a rendszernek. A nyelvi leírás a műfajt, a hangulatot, a hangszerelést, az énekstílust és a dal felépítését írja le. A dalszöveg a szavakat és a szerkezet egy részét határozhatja meg, a hangreferencia az előadói karaktert, a zenei referencia pedig az új dal hangzásvilágát befolyásolja. A generálás további szabályozó elemei között a hossz és a seed is szerepel.
A bemenetek azonban ellentmondhatnak egymásnak. Egy dalszöveg más szerkezetet sugallhat, mint a referenciazene, a kért stílus eltérhet a forrás hangszerelésétől, a hangazonosság és a szöveg érthetősége pedig egymással is versenghet. A rendszer ezeket a jeleket egyetlen koherens előadássá rendezi össze.
A Pika leírása szerint a szövegeket és a dalszövegeket előkészítik, a hangreferenciákból a hasznos vokális jellemzőket elemzik, a forrászenét pedig a generálás előtt szétválasztják és normalizálják. Az új szám ezután egyetlen teljes előadásként készül el, nem több, egymás után létrehozott rész összefűzésével.
Gyors iteráció és technikai háttér
A modell a Pika helyi tesztjeiben átlagosan 6,21 másodperc alatt generált egy 90 másodperces dalt. Ez a vállalat számítása szerint körülbelül 14,5-szer gyorsabb a lejátszási sebességnél. A Pika szerint ez lehetővé teszi, hogy az alkotók új dalszövegekkel, hangokkal vagy hangszerelésekkel kísérletezzenek anélkül, hogy kilépnének a kreatív folyamatból.
Technikai szempontból a Pika Music egy látens diffúziós transzformer, amely helyi és teljes figyelmi rétegeket is használ. A modell tömörített akusztikai reprezentációban dolgozik, majd a kész látens szekvenciát sztereó hullámformává alakítja. A különféle bemenetek speciális vezérlési útvonalakon keresztül jutnak el egy közös generatív dekóderbe.
A Pika flow matching célfüggvényt használ a tanításhoz. A tanítás során a vezérlési információkat részben módosítják vagy elhagyják, hogy a rendszer tökéletlen referenciák mellett is használható maradjon. A vállalat szerint ez a megközelítés egyszerre segíti az új bemenetek használatának megtanulását és az általános zeneszerzési képesség megőrzését.
Rögzített dalszöveges teszten mérik a rendszereket
A Pika egy rögzített dalszövegekre épülő mérési összeállítást is készített a zene-generáló rendszerek összehasonlítására. A teljes teszt 15, többek között akusztikus folk, pop, R&B, rap, rock, country, elektronikus zene, metal, jazz, filmes zene, gyermekzene, Afrobeats és többnyelvű dal kategóriájába tartozó promptot tartalmaz.
Minden prompt meghatározza a stílust, a dalszöveget, a kívánt időtartamot, a nyelvet, a BPM-et, a hangnemet és az ütemmutatót. Egy vizsgált rendszer promptonként két kimenetet készít, így rendszerenként 30 eredményt értékelnek. A zenei minőséget az Audiobox Aesthetics és a SongEval mutatóival vizsgálják. Előbbi többek között az élvezhetőséget, a hasznosságot, a produkció összetettségét és minőségét méri, utóbbi pedig a koherenciát, a zeneiséget, a megjegyezhetőséget, a tisztaságot és a természetességet.
A Pika Music bejelentését a vállalat 2026. augusztus 18-án tette közzé. A bemutatott munkafolyamatok alapján a felhasználók ugyanazon a rendszeren belül válthatnak a szöveges komponálás, a dalszöveg-alapú készítés, a hangkarakter irányítása és a zenei újraértelmezés között.
Pika: Introducing Pika Music


