GPT-Live érkezik, természetesebb beszélgetést ígér a ChatGPT Voice-ban
Az OpenAI bemutatta a GPT-Live hangmodelleket, amelyek egyszerre tudnak figyelni és beszélni, így természetesebb, gyorsabb párbeszédet tesznek lehetővé. A GPT-Live-1 és a GPT-Live-1 mini globálisan elindul a ChatGPT felhasználói számára.
- A GPT-Live teljes duplex architektúrával egyszerre hallgat és beszél.
- A GPT-Live-1 és a GPT-Live-1 mini globálisan elindult a ChatGPT-ben.
- A rendszer az összetettebb keresést és gondolkodást háttérben a GPT-5.5-re delegálja.
- Az új ChatGPT Voice vizuális kártyákat, több gondolkodási módot és jobb zajszűrést kínál.
- A támogatott GPT-Live-hangfájlok SynthID-vízjelet és ellenőrizhető eredetjelzést kapnak.
Folyamatos párbeszéd a hangalapú AI-jal
Az OpenAI július 8-án jelentette be a GPT-Live-ot, a hangmodellek új generációját. A rendszer teljes duplex architektúrát használ, vagyis a beszélgetés közben egyszerre képes hallgatni és beszélni. Így a modell olyan rövid visszajelzésekkel is jelezheti, hogy figyel, mint az „mhmm” vagy a „yeah”, miközben gyors oda-vissza párbeszédet folytat, vagy csendben marad, ha a felhasználónak időre van szüksége.
A korábbi, egymásra épülő hangrendszerek külön beszédfelismerő, nyelvi és beszédszintetizáló modelleket használtak. Ez az OpenAI szerint információvesztéshez, hosszú szünetekhez és darabos válaszokhoz vezethetett. A ChatGPT Advanced Voice Mode már egyetlen modellben dolgozta fel a hangot, de továbbra is meg kellett várnia, amíg a felhasználó befejezi a beszédet.
A GPT-Live folyamatosan dolgozza fel a bemenetet, miközben választ generál. A modell másodpercenként többször is dönthet arról, hogy megszólal, tovább hallgat, szünetet tart, közbeszól vagy eszközt használ. Az OpenAI szerint ez természetesebb időzítést, aktívabb figyelést és akár élő fordítást is lehetővé tesz.
A nehezebb feladatokat más modellek végzik a háttérben
A GPT-Live a folyamatos interakcióért felel, míg a keresést, az összetettebb gondolkodást és az ügynöki képességeket igénylő feladatokat egy másik modellre delegálhatja. A bejelentés szerint induláskor a GPT-5.5 dolgozik a háttérben, miközben a GPT-Live folytatni tudja a beszélgetést.
Az OpenAI ezt a felépítést arra is használja, hogy a GPT-Live idővel újabb frontier modelleket és ügynöki rendszereket vehessen igénybe. A vállalat értékeléseiben a GPT-Live-1 és a GPT-Live-1 mini a 5 és 10 perc közötti, összehasonlított beszélgetésekben erős felhasználói preferenciát mutatott az Advanced Voice Mode-dal szemben. A vizsgálatok a természetességet, a megszakításokat, a beszédváltást és a beszélgetés folyamatosságát is mérték.
Az OpenAI szerint a GPT-Live-1 jelentősen jobb eredményt ért el a szakértői tudományos gondolkodást mérő GPQA teszten, valamint erős javulást mutatott a nehezen megtalálható információk keresését vizsgáló BrowseComp feladaton. A vállalat belső, távközlési ügyfélszolgálati feladatokat mérő τ³-Voice Telecom tesztjén szintén jobb eredményt ért el az Advanced Voice Mode-nál.
Új ChatGPT Voice élmény
A ChatGPT Voice bekapcsolásakor a felhasználók természetesebb beszélgetést, intelligensebb válaszokat és jobb hallgatási képességet kapnak. A rendszer megvárja a felhasználót, ha az gondolkodik, és akkor is csendben marad, ha erre kérik. A háttérzaj, például a forgalom vagy a közelben zajló beszélgetések, kevésbé zavarja a hang felismerését.
A ChatGPT kilenc hangját a GPT-Live-hoz újramasterelték. A felhasználó az azonnali válaszokat adó Instant módot, illetve a Medium és High beállítást választhatja, ha több gondolkodási időt szeretne. A hangalapú élmény keresést, memóriát, képeket és fájlfeltöltést is támogat.
Beszélgetés közben a ChatGPT időjárással, részvényekkel, sporttal és más témákkal kapcsolatban vizuális kártyákat is megjeleníthet. Az OpenAI közlése szerint hetente több mint 150 millió ember használja a ChatGPT Voice és Dictation funkcióit.
Biztonsági tesztek és hangos eredetjelölés
Az OpenAI a GPT-Live-hoz külön biztonsági képzést és kifejezetten hangalapú használatra tervezett védelmi intézkedéseket vezetett be. A vállalat új, hangra épülő értékeléseket készített, valamint generált hanggal végzett szintetikus vizsgálatokat is alkalmazott. A tesztelt területek között az önsértés, a pszichózis és mánia, a mesterséges intelligenciától való érzelmi függés, az erőszak és a szexuális tartalom szerepelt.
A július 31-i frissítés szerint a ChatGPT Voice-on és az OpenAI API-n keresztül GPT-Live-val létrehozott támogatott hangfájlok SynthID-vízjelet kapnak. Az OpenAI nyilvános ellenőrzőeszköze képes felismerni a vállalat eredetjelzéseit a támogatott hangfájlokban, az API-hozzáférés pedig lehetővé teszi, hogy fejlesztők és szervezetek saját munkafolyamataikba építsék az ellenőrzést.
A GPT-Live-1 és a GPT-Live-1 mini már elérhető a ChatGPT felhasználói számára. Az OpenAI a modelleket később az API-ban is elérhetővé kívánja tenni, a fejlesztők és vállalatok pedig értesítést kérhetnek a megjelenésről.
OpenAI: Introducing GPT-Live

