Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az OpenAI új architektúrát épített a gyorsabb hangalapú AI-hoz

2026. augusztus 3. 09:00Forrás: OpenAI

Az OpenAI 2026. augusztus 3-án ismertette, hogyan épített hat hónap alatt valós idejű rendszert a GPT-Live hangalapú AI-hoz. A cég szerint az új megközelítés a korábbi, fordulóalapú hangrendszerek késleltetését csökkenti.

A lényeg röviden
  • A GPT-Live az OpenAI harmadik generációs hangrendszere.
  • A rendszer teljes duplex hangmodellt használ, külön fordulódetektor nélkül.
  • A médiafolyam külön gyors útvonalon fut, az eszközhasználat és a delegálás aszinkron.
  • Az OpenAI Go nyelvű média frontendre és WebRTC alapú továbbításra építette az új rendszert.
  • Az architektúra a ChatGPT Voice új képességeit is kiszolgálja az asztali alkalmazásban.

Kikerül a külön fordulódetektor az audioútból

Az OpenAI szerint a hangalapú AI egyik nehézsége, hogy a rendszernek pontosan el kell találnia, mikor beszéljen. A korábbi rendszerek apró, fordulódetektornak nevezett modellekre támaszkodtak: ha ezek túl korán döntöttek, félbeszakították a felhasználót, ha túl későn, a válasz lassúnak érződött. A nagyobb nyelvi modell csak ezután kezdhetett dolgozni.

A GPT-Live, az OpenAI harmadik generációs hangrendszere ezt a külön detektort eltávolítja az audioútból. A hangmodell teljes duplex működésű, vagyis egyszerre tud figyelni és beszélni. A cég állítása szerint ettől a beszélgetés közvetlenebbnek és természetesebbnek hat.

A rendszer a mélyebb következtetést vagy eszközhasználatot igénylő helyzetekben frontier modellekhez, például a GPT-5.5-höz is fordulhat, anélkül, hogy a beszélgetés folyama megszakadna. Az OpenAI ezt úgy írja le, hogy a beszédhez szükséges gyors reakciót és a bonyolultabb gondolkodási feladatokat külön kezeli.

Folyamatos következtetésre tervezték át a rendszert

Az OpenAI közlése szerint a hagyományos kérés-válasz alapú következtetés helyett a rendszer folyamatosan továbbítja a beérkező hangot a hangmodellbe, és ugyanígy streameli vissza a beszédet a felhasználónak. A delegálás, vagyis például a frontier modellek és eszközök bevonása külön, aszinkron útvonalon fut.

A cég az elmúlt hat hónapban a modellkövetkeztetést, a kontextuskezelést és a médiatovábbítást is átdolgozta, hogy a beszéd a teljes láncon keresztül simábban haladjon. A rendszer egyik fontos tervezési döntése az volt, hogy a médiafolyamot leválasztották az alkalmazáslogikáról és az üzleti logikáról. Így egy lassú eszközhívás vagy háttérszolgáltatás késleltetheti a saját eredményét, de nem állíthatja meg a hang továbbítását.

A média frontend és a következtetési logika Go nyelven készült, lecserélve a korábbi Python asyncio megvalósítást. Az OpenAI szerint ez jelentősen javította a képkockák, illetve audioframe-ek továbbításának egyenletességét: az új rendszer p95 értéke megegyezik a korábbi rendszer p50 értékével. A szállítási alapot a WebRTC adja, amely alacsony késleltetésű médiára készült, és képes működni csomagvesztés, óraeltolódás és klienskapcsolat-változás mellett is.

A WebRTC későn érkező csomagok esetén finoman nyújthatja a hangot, hogy ne keletkezzen rés, majd röviden gyorsíthatja a lejátszást, hogy visszaérjen a valós időhöz. Az OpenAI szerint a pufferelés és a blokkolás csökkentésével érhető el az a másodperc alatti reakcióidő, amelyet az emberek a beszélgetésben elvárnak.

Hosszú beszélgetéseknél is kezelni kell az állapotot

A GPT-Live állapottartó következtetést használ, ami külön működési kompromisszumokkal jár. Egy hangos munkamenet hosszú ideig aktív maradhat, miközben a kontextusa folyamatosan nő, a modellpéldányok pedig a kereslettől függően indulnak el és állnak le.

Erre az OpenAI zökkenőmentes átadási mechanizmust épített a modellpéldányok között. Ha váltásra van szükség, a rendszer előmelegíthet egy cserepéldányt a meglévő mellett, feltöltheti az aktuális munkamenet-környezettel, párhuzamosan futtathatja a következtetést mindkettőn, majd akkor válthat át, amikor az új példány teljesen készen áll.

Ugyanez az alapmechanizmus a dinamikus kontextustömörítést is támogatja. Ahogy egy beszélgetés halad, a felhalmozott kontextus elérheti a modell kontextuskorlátját. A tömörítés csökkentheti a méretet, de időbe telik, és érvényteleníti a modell kulcs-érték gyorsítótárát, amely a korábban feldolgozott tokenek attention kulcsait és értékeit tárolja.

Az OpenAI ezért a tömörítést is kezelt átmenetként kezeli. Miközben az eredeti modellpéldány folytatja a beszélgetést, a rendszer tömöríti a kontextust, és előkészít egy új modellpéldányt az új kontextussal. Amikor ez készen áll, médiamegszakítás nélkül lehet átváltani.

Mit jelent ez a ChatGPT Voice felhasználóinak

Az OpenAI szerint az új architektúra alapot ad a ChatGPT Voice bővülő képességeihez. A forrás külön megemlíti az újonnan elindított lehetőséget, amellyel a felhasználó a ChatGPT asztali alkalmazásában vezérelheti a számítógépét és koordinálhatja az ügynökeit.

A felhasználói élmény szempontjából a lényeg az, hogy a beszédhez szükséges gyors médiaút külön marad azoktól a feladatoktól, amelyek hosszabb feldolgozást igényelhetnek. A hangmodell így röviden mozgásban tarthatja a párbeszédet, miközben egy frontier modell a háttérben következtet vagy eszközöket használ.

A rendszer alkalmazásfejlesztési oldalról is tisztább határt ad: az eszközök, szabályok és háttérrendszerek módosíthatók anélkül, hogy ez közvetlenül érintené a hang folyamatos továbbításáért felelős média frontendet. Ez a forrás alapján azért fontos, mert a természetes beszélgetésben a késleltetés, a kimaradás vagy a rossz időzítés azonnal hallhatóvá válik.

Kapcsolódó hírek

Az Arize Alyx ügynöke egyetlen fájlban tárolja a hosszú távú memóriát
Fejlesztőknek2026. október 1. 16:02

Az Arize Alyx ügynöke egyetlen fájlban tárolja a hosszú távú memóriát

Az Arize AI az Alyx AI-mérnöki ügynök hosszú távú memóriáját egyetlen, strukturált szövegfájlra építette fel felhasználónként és Arize space-enként. A vállalat szerint…

Az Arize AI egyetlen fájlra építette Alyx hosszú távú memóriáját
Fejlesztőknek2026. október 1. 16:02

Az Arize AI egyetlen fájlra építette Alyx hosszú távú memóriáját

Az Arize AI egy strukturált szövegfájlra egyszerűsítette Alyx, az Arize AX mesterségesintelligencia-mérnöki ügynökének hosszú távú memóriáját. A cég szerint a megoldás…

A Kilo Code-ba is bejelentkezhetünk ChatGPT-fiókkal
Termékek és eszközök2026. szeptember 29. 19:45

A Kilo Code-ba is bejelentkezhetünk ChatGPT-fiókkal

A Kilo Code fejlesztői mostantól ChatGPT-fiókjukkal is létrehozhatják vagy elérhetik Kilo-fiókjukat. A kapcsolt ChatGPT-előfizetés a Kilo összes kódolási felületén…