Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Pydantic AI ügynökei mostantól hangalapú beszélgetésre is képesek

2026. augusztus 26.Forrás: Pydantic
A Pydantic AI ügynökei mostantól hangalapú beszélgetésre is képesek
Kép: Pydantic

A Pydantic AI realtime támogatással bővült, így a fejlesztők ugyanazokat a Python-alapú ügynököket hangalapú beszélgetésekhez is használhatják. A rendszer több szolgáltató realtime modelljeit egységes programozási felületen kezeli.

A lényeg röviden
  • A Pydantic AI ügynökei realtime hangalapú párbeszédet is kezelhetnek.
  • Az OpenAI Realtime, az Azure OpenAI, a Gemini Live és az xAI Grok Voice támogatott.
  • A szerveroldali eszközök, előzmények és API-kulcsok változatlanul a backendhez köthetők.
  • A hangos munkamenet előzménye átadható szöveges ügynöknek is.
  • A realtime támogatás a pydantic-ai[realtime] csomagban érhető el.

Egy ügynök többféle felületen

A Pydantic AI ügynökei egyszerű Python-objektumok, amelyekhez nincs előre rögzített felhasználói felület kötve. Eddig ugyanaz az ügynök futtatható volt a run() meghívásával, terminálban, beépített webes csevegés mögött vagy egy saját frontendhez kapcsolva. A Pydantic 2026. augusztus 26-i bejelentése szerint ehhez most a folyamatos, beszéddel zajló párbeszéd is hozzáadható.

A háttérben realtime beszéd-beszéd modell működik. A támogatott szolgáltatók között az OpenAI Realtime, az Azure OpenAI, a Gemini Live és az xAI Grok Voice szerepel. A hangfeldolgozás közvetlenül a modellnél történik, így nincs szükség külön átírási, szöveggenerálási és beszédszintézis-láncra. A Pydantic szerint ez alacsony késleltetést és természetesebb megszakításokat tesz lehetővé.

A hang, az eszközök és az előzmények a szerveren maradnak

A hangalapú munkamenetben az ügynök továbbra is a fejlesztő backendjén fut. Így a használt eszközök, a beszélgetési előzmények és az API-kulcs szerveroldalon maradhatnak. Böngészős alkalmazásnál a hang WebRTC-n közvetlenül a böngésző és a szolgáltató között utazhat, miközben a backend ugyanahhoz a híváshoz kapcsolódik oldalsávos kapcsolaton keresztül. A Pydantic ehhez futtatható FastAPI-példát is kínál, az OpenAI és az Azure OpenAI WebRTC-támogatásával.

A fejlesztők a meglévő eszközöket is használhatják. A @agent.tool vagy @agent.tool_plain segítségével regisztrált, típusos eszközök, függőségek, ellenőrzések és újrapróbálkozások továbbra is érvényesek. Az eszközhívások a háttérben futnak, ezért nem blokkolják a munkamenetet. Az, hogy a modell közben folytatja-e a beszédet, szolgáltatónként eltérhet.

A hangos fordulók ugyanabba az üzenetelőzménybe kerülnek, amelyet a szöveges futtatások is használnak. Ide tartozhatnak a modellkérések, a modellválaszok, az eszközhívások és a szolgáltató által biztosított átiratok. A session.usage az audióhoz és a gyorsítótárazott tartalomhoz kapcsolódó tokenhasználatot is követi, a használati korlátok pedig egy elszabaduló munkamenetet is korlátozhatnak.

A hangbeszélgetésből szöveges feldolgozás lehet

A Pydantic AI lehetővé teszi, hogy egy hangalapú munkamenet után egy szöveges ügynök dolgozza fel a teljes előzményt. A bemutatott példában egy ügyfélszolgálati hívásból strukturált támogatási jegy készül, amely összefoglalót, súlyossági szintet és következő lépést tartalmaz. Fordítva is működik: egy korábbi szöveges beszélgetés előzményei betölthetők egy realtime munkamenetbe, így a hívó onnan folytathatja a beszélgetést.

A csomag minden támogatott szolgáltatónál ugyanazt a RealtimeModel felületet használja, és egységes, típusos eseményeket ad. A modellek külön jelzik képességeiket, például a kézi fordóváltást, a beszédbe vágás kezelését, a nem blokkoló eszközhívásokat és az egyes szolgáltatók saját eszközeit.

A realtime támogatás a Pydantic szerint már elérhető a pydantic-ai[realtime] csomaggal. Ez az OpenAI, az Azure OpenAI és a Gemini Live használatához szükséges SDK-kat is tartalmazza, az xAI Grok Voice támogatásához pedig a [xai-realtime] kiegészítő kell. A böngészős és terminálos hangasszisztens mellett kameraügynököt és hanghívásból szöveges ügynöknek átadott munkamenetet bemutató példák is készültek.

A hívások megfigyelhetőségét a Pydantic Logfire és más OpenTelemetry-kompatibilis rendszerek is kezelhetik. A forrásban bemutatott hívás 61,87 másodpercig tartott, költsége 0,08 dollár volt. A Pydantic számítása szerint ez az adott díjazással körülbelül 4,50 dollárt jelentene egyórányi beszéd esetén, ami a szolgáltatói audióalapú vagy percalapú számlázás miatt a költségkorlátok jelentőségére is felhívja a figyelmet.

Kapcsolódó hírek

A Pydantic AI már Jevvel is osztályozza az ügynökök döntéseit
Fejlesztőknek2026. szeptember 29.

A Pydantic AI már Jevvel is osztályozza az ügynökök döntéseit

A Pydantic AI 2.50.0 támogatja a TypeSafe Jev döntési modelljét, amely szöveges válaszok generálása helyett előre meghatározott kérdésekre ad típusos válaszokat. A…

Tartós futtatást kapnak a Pydantic AI ügynökei AWS Lambdán
Termékek és eszközök2026. szeptember 9.

Tartós futtatást kapnak a Pydantic AI ügynökei AWS Lambdán

A Pydantic AI Harness új AWSLambdaDurability képessége ellenőrzőpontokkal teszi folytathatóvá az AWS Lambda alatt futó AI-ügynökök munkameneteit. Egy megszakítás vagy…

A Pydantic szerint az AI-k egymástól tanulják a furcsa szavakat
Kutatás2026. szeptember 8.

A Pydantic szerint az AI-k egymástól tanulják a furcsa szavakat

A Pydantic szerint a frontier modellek egyre gyakrabban használnak olyan kifejezéseket, amelyek korábban ritkák vagy szokatlanok voltak a fejlesztők számára. A cég ezt…