Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Daily bemutatta a PhoneLLM Alpha 1 hangügynök-modellt

2026. augusztus 27.Forrás: Daily
A Daily bemutatta a PhoneLLM Alpha 1 hangügynök-modellt
Kép: Daily

A Daily kiadta a PhoneLLM Alpha 1-et, egy nyílt súlyú, telefonos hangügynökökhöz fejlesztett nyelvi modellt. A vállalat szerint a modell alacsonyabb költséggel és késleltetéssel kínál a célzott feladatokban a nagy általános modellekhez mérhető teljesítményt.

A lényeg röviden
  • A PhoneLLM Alpha 1 telefonos hangügynökös feladatokra készült.
  • A modell a Daily szerint 94 százalékkal olcsóbb és 1300 ezredmásodperccel gyorsabb volt a GPT 5.6 Terránál a megadott összehasonlításban.
  • A PhoneLLM 3,5 milliárd aktív paraméteres MoE-modell, amely a Nemotron 3 Nano 30B-A3B alapjára épül.
  • A modell BSD licenc alatt, kereskedelmi korlátozások nélkül érhető el.
  • A Daily a PhoneBench v1 benchmarkot is bemutatta a hangügynökök értékelésére.

Telefonos ügyfélszolgálatra készült

A Daily augusztus 27-én jelentette be a PhoneLLM Alpha 1 megjelenését. A modell olyan hangügynökös feladatokra készült, amelyeknél fontos a gyors válasz és a többfordulós párbeszéd kezelése.

A Pipecat keretrendszerhez, valamint beszédfelismerő és szövegfelolvasó modellekhez kapcsolva a PhoneLLM bejövő hívásokat kezelhet pénzügyi szolgáltatások, egészségügy, kiskereskedelem és vendéglátás területén. A Daily szerint gyakori kimenő hívásos ügynöki feladatokra is használható.

A vállalat összehasonlítása szerint a PhoneLLM a GPT 5.6 Terra modellhez hasonlóan teljesített az általuk vizsgált feladatokban, miközben 94 százalékkal olcsóbb, a P95 első tokenig eltelt ideje pedig 1300 ezredmásodperccel rövidebb volt. Ezek a számok a Daily saját méréseihez kapcsolódnak.

Nyílt modell, 3,5 milliárd aktív paraméterrel

A PhoneLLM Alpha 1 teljes paraméteres finomhangolással készült az NVIDIA Nemotron 3 Nano 30B-A3B modelljéből, az NVIDIA NeMo keretrendszer használatával. A modell kevert szakértői architektúrát, vagyis MoE-t alkalmaz, amelynél 3,5 milliárd paraméter aktív.

A PhoneLLM nyílt modellként saját infrastruktúrán is futtatható. A Daily BSD licenc alatt tette közzé, kereskedelmi korlátozások nélkül. A fejlesztőcsapat szerint a modellt kifejezetten arra tanították, hogy a megfelelő eszközt a megfelelő időben hívja meg, gondolkodási mód bekapcsolása nélkül is.

Ez a telefonos ügynököknél azért fontos, mert a modellnek nem elég természetesnek hangzó választ adnia. A műveletet ténylegesen végre is kell hajtania. A Daily példaként azt a hibát említi, amikor egy rendszer azt állítja, hogy lefoglalt egy asztalt, miközben valójában nem indította el a szükséges eszközhívást.

A PhoneBench a hangügynökök szempontjait méri

A PhoneLLM mellett a Daily bemutatta a PhoneBench v1 nevű értékelési rendszert is. A benchmark a pontosság mellett a beszédstílust, a késleltetést és a becsült percenkénti futtatási költséget vizsgálja.

A rendszer nyelvi modellekből álló értékelői panelt használ, amelyet emberi címkézéssel kalibráltak. Így olyan szempontokat is mér, amelyek programozottan nehezen ellenőrizhetők. Ilyen a telefonos beszédstílus, az eszközhívások pontossága, a kimondott és ténylegesen végrehajtott műveletek összhangja, a ténybeli megalapozottság, a párbeszéd koherenciája, a hitelesítési és eszkalációs szabályok betartása, valamint a hívó fél eredménye.

A benchmark forgatókönyvei, eszközlistái és rendszerutasításai elkülönülnek a PhoneLLM tanításához használt adatoktól. A Daily szerint ez lehetővé teszi annak vizsgálatát, hogy a modell korábban nem látott forgatókönyvekben, üzleti felhasználási esetekben, eszközlistákban és utasítások mellett is általánosít-e.

A késleltetés és az üzemeltetési költség is számít

A Daily szerint a hangalapú beszélgetésekben a teljes, hangból hangba mért késleltetésnek általában körülbelül 1500 ezredmásodperc körül kell maradnia. Ebbe beletartozik a hálózati többlet, a hangfeldolgozás, az alkalmazási logika, valamint a beszédfelismerő, nyelvi és szövegfelolvasó modellek futása.

A vállalat mérése szerint a GPT 5.6 Terra gyors módban futó P95 első tokenig eltelt ideje körülbelül 1900 ezredmásodperc. A Daily ezért 650 ezredmásodperces célt állított fel a nyelvi modell első tokenjéig tartó szakaszra. A PhoneLLM fejlesztői szerint a nyílt súlyú modellek lehetőséget adnak arra, hogy a következtetési rendszert kifejezetten hangügynökös használatra optimalizálják, és a költség, illetve a késleltetés között a feladathoz illeszkedő egyensúlyt válasszanak.

A PhoneLLM Alpha 1 a Daily értelmezésében azt mutatja, hogy egy kisebb, meghatározott célra finomhangolt modell saját infrastruktúrán is alkalmas lehet telefonos ügynökök építésére. A felhasználók számára ez nyílt licencet és önálló üzemeltetési lehetőséget jelent, miközben a tényleges költség az infrastruktúrától, a párhuzamos kérések számától és a kihasználtságtól függ.

Kapcsolódó hírek

64 GB memóriával jön az NVIDIA DGX Spark új változata
Chipek és infrastruktúra2026. október 2.

64 GB memóriával jön az NVIDIA DGX Spark új változata

Az NVIDIA 2026. október 2-án bejelentette a DGX Spark 64 GB-os, egyesített memóriával szerelt konfigurációját. A rendszer október 23-án érkezik az Acer, ASUS, Dell…

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható
Kutatás2026. október 1.

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható

Az NVIDIA olyan finomhangolási munkafolyamatot mutatott be, amellyel a Nemotron 3.5 ASR a szaúdi najdi és hidzsázi arab dialektusok felismerésére szabható. A vállalat…

Az NVIDIA Nemotron a szaúdi arab nyelvjárásokhoz is finomhangolható
Kutatás2026. október 1.

Az NVIDIA Nemotron a szaúdi arab nyelvjárásokhoz is finomhangolható

Az NVIDIA olyan finomhangolási munkafolyamatot mutatott be, amellyel a Nemotron 3.5 ASR a szaúdi arab Najdi és Hijazi nyelvjárásokhoz igazítható. A vállalat szerint a…