A Daily bemutatta a PhoneLLM Alpha 1 hangügynök-modellt

A Daily kiadta a PhoneLLM Alpha 1-et, egy nyílt súlyú, telefonos hangügynökökhöz fejlesztett nyelvi modellt. A vállalat szerint a modell alacsonyabb költséggel és késleltetéssel kínál a célzott feladatokban a nagy általános modellekhez mérhető teljesítményt.
- A PhoneLLM Alpha 1 telefonos hangügynökös feladatokra készült.
- A modell a Daily szerint 94 százalékkal olcsóbb és 1300 ezredmásodperccel gyorsabb volt a GPT 5.6 Terránál a megadott összehasonlításban.
- A PhoneLLM 3,5 milliárd aktív paraméteres MoE-modell, amely a Nemotron 3 Nano 30B-A3B alapjára épül.
- A modell BSD licenc alatt, kereskedelmi korlátozások nélkül érhető el.
- A Daily a PhoneBench v1 benchmarkot is bemutatta a hangügynökök értékelésére.
Telefonos ügyfélszolgálatra készült
A Daily augusztus 27-én jelentette be a PhoneLLM Alpha 1 megjelenését. A modell olyan hangügynökös feladatokra készült, amelyeknél fontos a gyors válasz és a többfordulós párbeszéd kezelése.
A Pipecat keretrendszerhez, valamint beszédfelismerő és szövegfelolvasó modellekhez kapcsolva a PhoneLLM bejövő hívásokat kezelhet pénzügyi szolgáltatások, egészségügy, kiskereskedelem és vendéglátás területén. A Daily szerint gyakori kimenő hívásos ügynöki feladatokra is használható.
A vállalat összehasonlítása szerint a PhoneLLM a GPT 5.6 Terra modellhez hasonlóan teljesített az általuk vizsgált feladatokban, miközben 94 százalékkal olcsóbb, a P95 első tokenig eltelt ideje pedig 1300 ezredmásodperccel rövidebb volt. Ezek a számok a Daily saját méréseihez kapcsolódnak.
Nyílt modell, 3,5 milliárd aktív paraméterrel
A PhoneLLM Alpha 1 teljes paraméteres finomhangolással készült az NVIDIA Nemotron 3 Nano 30B-A3B modelljéből, az NVIDIA NeMo keretrendszer használatával. A modell kevert szakértői architektúrát, vagyis MoE-t alkalmaz, amelynél 3,5 milliárd paraméter aktív.
A PhoneLLM nyílt modellként saját infrastruktúrán is futtatható. A Daily BSD licenc alatt tette közzé, kereskedelmi korlátozások nélkül. A fejlesztőcsapat szerint a modellt kifejezetten arra tanították, hogy a megfelelő eszközt a megfelelő időben hívja meg, gondolkodási mód bekapcsolása nélkül is.
Ez a telefonos ügynököknél azért fontos, mert a modellnek nem elég természetesnek hangzó választ adnia. A műveletet ténylegesen végre is kell hajtania. A Daily példaként azt a hibát említi, amikor egy rendszer azt állítja, hogy lefoglalt egy asztalt, miközben valójában nem indította el a szükséges eszközhívást.
A PhoneBench a hangügynökök szempontjait méri
A PhoneLLM mellett a Daily bemutatta a PhoneBench v1 nevű értékelési rendszert is. A benchmark a pontosság mellett a beszédstílust, a késleltetést és a becsült percenkénti futtatási költséget vizsgálja.
A rendszer nyelvi modellekből álló értékelői panelt használ, amelyet emberi címkézéssel kalibráltak. Így olyan szempontokat is mér, amelyek programozottan nehezen ellenőrizhetők. Ilyen a telefonos beszédstílus, az eszközhívások pontossága, a kimondott és ténylegesen végrehajtott műveletek összhangja, a ténybeli megalapozottság, a párbeszéd koherenciája, a hitelesítési és eszkalációs szabályok betartása, valamint a hívó fél eredménye.
A benchmark forgatókönyvei, eszközlistái és rendszerutasításai elkülönülnek a PhoneLLM tanításához használt adatoktól. A Daily szerint ez lehetővé teszi annak vizsgálatát, hogy a modell korábban nem látott forgatókönyvekben, üzleti felhasználási esetekben, eszközlistákban és utasítások mellett is általánosít-e.
A késleltetés és az üzemeltetési költség is számít
A Daily szerint a hangalapú beszélgetésekben a teljes, hangból hangba mért késleltetésnek általában körülbelül 1500 ezredmásodperc körül kell maradnia. Ebbe beletartozik a hálózati többlet, a hangfeldolgozás, az alkalmazási logika, valamint a beszédfelismerő, nyelvi és szövegfelolvasó modellek futása.
A vállalat mérése szerint a GPT 5.6 Terra gyors módban futó P95 első tokenig eltelt ideje körülbelül 1900 ezredmásodperc. A Daily ezért 650 ezredmásodperces célt állított fel a nyelvi modell első tokenjéig tartó szakaszra. A PhoneLLM fejlesztői szerint a nyílt súlyú modellek lehetőséget adnak arra, hogy a következtetési rendszert kifejezetten hangügynökös használatra optimalizálják, és a költség, illetve a késleltetés között a feladathoz illeszkedő egyensúlyt válasszanak.
A PhoneLLM Alpha 1 a Daily értelmezésében azt mutatja, hogy egy kisebb, meghatározott célra finomhangolt modell saját infrastruktúrán is alkalmas lehet telefonos ügynökök építésére. A felhasználók számára ez nyílt licencet és önálló üzemeltetési lehetőséget jelent, miközben a tényleges költség az infrastruktúrától, a párhuzamos kérések számától és a kihasználtságtól függ.
Daily: Announcing Pipecat PhoneLLM Alpha 1


