Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Datadog telemetria alapján becsüli meg az agentek felhasználói értékelését

2026. szeptember 22.Forrás: Datadog
A Datadog telemetria alapján becsüli meg az agentek felhasználói értékelését
Kép: Datadog

A Datadog olyan módszert és nyilvános osztályozási készséget mutatott be, amely a felhasználói visszajelzések hiányában telemetria alapján becsüli meg, pozitív vagy negatív volt-e egy agenttel folytatott munkamenet. A vállalat belső tesztjén a három adatforrást használó változat 82 százalékos pontosságot ért el.

A lényeg röviden
  • A Datadog telemetria alapján becsüli meg az agentekről szóló felhasználói visszajelzést.
  • Az Agent Observability, a RUM és az Audit Trail adatait kapcsolja össze.
  • A három adatforrást használó változat 82 százalékos pontosságot ért el.
  • A módszer a Datadog Labs agent skills tárházában érhető el.
  • A vállalat további telemetria, például APM és naplóadatok bevonásától várhat javulást.

A gombnyomások helyett telemetria

A felhasználók ritkán kattintanak a hüvelykujj fel vagy le gombokra, noha az agentek fejlesztéséhez fontos lenne tudni, hogyan értékelték a választ. A Datadog szerint az ilyen explicit visszajelzés az Agent Observability egyik fontos része, de az alkalmazások készítői nem kényszeríthetik ki a használatát.

A vállalat ezért a gyenge címkézésnek (weak labeling) nevezett technikát alkalmazta. Ennek lényege, hogy a rendelkezésre álló adatokból heurisztikák, betanított modellek vagy más automatizálható módszerek segítségével közelítő címkéket állítanak elő. Ezek általában kevésbé pontosak, mint a valódi, kézzel megadott visszajelzések, ezért egy kisebb, kézzel címkézett úgynevezett arany adathalmazon kell ellenőrizni őket.

Három adatforrás rajzolja ki a munkamenetet

A Datadog megoldása háromféle telemetriát kapcsol össze. Az Agent Observability részletes nyomkövetési adatokat gyűjt az agentek munkameneteiről, többek között a beszélgetések átiratait, amelyekből a felhasználói hangulat is vizsgálható.

A Real User Monitoring, röviden RUM, azt mutatja meg, hogyan viselkedik a felhasználó a felületen. Ide tartozhat, hogy azonnal elhagyja-e a munkamenetet, mire kattint, vagy elfogadja-e az agent javaslatait. Az Audit Trail pedig azt rögzíti, milyen változások történtek a Datadog platformon, például módosult-e egy irányítópult vagy egy metrika.

A három forrás együtt a munkamenet teljesebb képét adja: mit mondott az agent, mit tett erre a felhasználó, és történt-e változás a Datadogban az interakció eredményeként.

82 százalékos pontosságot értek el

A Datadog a módszert a Bits Chat több száz munkamenetéből álló, kézzel címkézett adathalmazon tesztelte. Az adatokhoz korábban hüvelykujj fel vagy le értékeléseket rendeltek. A vállalat olyan kísérleti összehasonlítást készített, amely először csak az Agent Observability nyomkövetéseit, majd ezek mellett a RUM, végül az Audit Trail adatait használta.

A nyomkövetések önmagukban 78 százalékos pontosságot értek el. A RUM hozzáadásával ez 80 százalékra, az Audit Trail bevonásával pedig 82 százalékra nőtt. A Datadog szerint ez nem tökéletes eredmény, de alkalmas lehet azoknak a munkameneteknek a kiválasztására, amelyeket érdemes manuálisan megvizsgálni.

A vállalat számítása szerint így a teljes nyomkövetési állomány 18 százalékára szűkíthető a vizsgálandó kör. A Datadog nem várt 100 százalékos pontosságot, mert az a megítélésük szerint inkább az adathalmaz túlillesztésére utalna. A cég szerint további adatforrások, például az APM és a naplóadatok bevonásával még javítható lehet az eredmény.

A session classification skill elérhető a Datadog Labs agent skills tárházában. A Datadog közlése szerint az Agent Observability ügyfelei és az általános felhasználók is telepíthetik, illetve saját készségeik kiindulópontjaként is felhasználhatják a benne alkalmazott technikákat.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A jogi szakmában már minden második szakember használ generatív AI-t
Kutatás2026. október 3. 10:27

A jogi szakmában már minden második szakember használ generatív AI-t

A jogi szakemberek 49 százaléka már aktívan használ generatív AI-t a munkájában, derül ki az Everlaw, az ACEDS és az ILTA közös jelentéséből. A technológia egyre…

A CoreWeave bemutatta az ARIA kutatási és iterációs ügynököt
Termékek és eszközök2026. október 2. 19:23

A CoreWeave bemutatta az ARIA kutatási és iterációs ügynököt

Általánosan elérhetővé vált a CoreWeave ARIA, egy kutatási és iterációs AI-ügynök, amely a CoreWeave Forge részeként segít modellek és AI-ügynökök fejlesztésében. Az…

Az Arize Alyx ügynöke egyetlen fájlban tárolja a hosszú távú memóriát
Fejlesztőknek2026. október 1. 16:02

Az Arize Alyx ügynöke egyetlen fájlban tárolja a hosszú távú memóriát

Az Arize AI az Alyx AI-mérnöki ügynök hosszú távú memóriáját egyetlen, strukturált szövegfájlra építette fel felhasználónként és Arize space-enként. A vállalat szerint…