Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A New Relic az AI-válaszok minőségét is beköti a rendszerfigyelésbe

2026. október 6. 14:00Forrás: New Relic
A New Relic az AI-válaszok minőségét is beköti a rendszerfigyelésbe
Kép: New Relic

A New Relic bemutatta az AI Evaluation szolgáltatást, amely a generatív AI-rendszerek válaszait biztonság, pontosság és relevancia alapján értékeli. Az eredményeket közvetlenül a vállalati alkalmazások elosztott nyomkövetéseihez kapcsolja, így a fejlesztők a minőségi hibákat az azokat okozó rendszerkomponensekig követhetik.

A lényeg röviden
  • Az AI Evaluation 0 és 1 közötti pontszámot, pass vagy fail állapotot és indoklást ad.
  • Az eredmények közvetlenül az eredeti elosztott nyomkövetések attribútumaivá válnak.
  • A szolgáltatás hallucinációkat, adatszivárgást, promptinjekciót, toxicitást és elfogultságot is vizsgál.
  • A minőségi eredményeket a modell- és infrastruktúraköltségekkel is összekapcsolja.
  • A mintavételezés lehetővé teszi, hogy az értékelés csak a tranzakciók egy részén fusson.

A hagyományos monitorozás nem lát minden hibát

A New Relic szerint a vállalati mérnöki csapatok egyre gyorsabban vezetnek be autonóm ügynököket és RAG, vagyis visszakereséssel támogatott generálási architektúrákat. A kísérleti szakaszból éles környezetbe lépve azonban a hagyományos szoftveres megfigyelés jelentős hiányosságokat mutat.

A teljesítménymonitorozás jellemzően az áteresztőképességet és a késleltetést méri, a szemantikai hibákat viszont nem feltétlenül érzékeli. Így rejtve maradhatnak például a hallucinációk, a személyes adatok kiszivárgása vagy a modellek váratlan működésbeli eltolódásai. A New Relic AI Evaluation ezt a hiányt azzal kezeli, hogy automatizált minőségi ellenőrzéseket épít be a meglévő megfigyelési munkafolyamatba.

Pontszámok és indoklás az elosztott nyomkövetésekben

A szolgáltatás aszinkron, LLM-et bíróként használó értékelési rendszerrel vizsgálja a mintavételezett felhasználói kéréseket és modellválaszokat. Az interakciókat előre meghatározott biztonsági és minőségi paraméterek alapján pontozza. Minden értékelt interakció 0 és 1 közötti normalizált pontszámot, testre szabható küszöbök alapján pass vagy fail állapotot, valamint szöveges indoklást kap.

Az értékelési adatok közvetlenül a New Relic platformjára kerülnek vissza, és attribútumként csatlakoznak az eredeti elosztott nyomkövetéshez. A mérnökök egyetlen nézetben láthatják a promptot, az értékelés indoklását, a modellválaszt és az alkalmazás többi részének működését. Ha egy válasz nem éri el a minőségi küszöböt, a hiba a kapcsolódó promptszegmenshez, vektoradatbázis-lekérdezéshez vagy háttérszolgáltatáshoz vezethető vissza.

Biztonsági ellenőrzések és RAG-diagnosztika

A New Relic közlése szerint az AI Evaluation előre elkészített értékelőket kínál, amelyekhez nincs szükség külön beállításra vagy konfigurációra. A mintavételezett bemeneteket és válaszokat többek között promptinjekció, a biztonsági korlátozások megkerülésére irányuló kísérlet, személyes adatok, mérgező vagy sértő nyelvezet, illetve elfogultság szempontjából vizsgálja.

RAG-rendszerek és autonóm ügynökök esetében a szolgáltatás külön kezeli a visszakeresés és a válaszgenerálás problémáit. A faithfulness, vagyis a forráskörnyezettel való tényszerű összhang azt méri, hogy a generált válasz követi-e a visszakeresett információt. Az answer relevancy és a kontextus relevanciája azt vizsgálja, hogy a megtalált információ illeszkedik-e a kérdéshez, illetve a végső válasz közvetlenül reagál-e a felhasználói kérésre.

A költségek és a minőség együtt vizsgálhatók

Az AI Evaluation a minőségi pontszámokat az infrastruktúra-felhasználással és a modellköltségekkel is összekapcsolja. Ez lehetővé teszi annak vizsgálatát, hogy a nagyobb paraméterszámú, drágább modellek jobb pontosságot és relevanciát biztosítanak-e a gyorsabb, olcsóbb alternatíváknál. A New Relic szerint a szervezetek így lecserélhetik az alulteljesítő nagy nyelvi modelleket, és csökkenthetik a tokenfelhasználást anélkül, hogy feláldoznák a válaszok minőségét.

Az értékelési többletterhelés mérséklésére a platform rugalmas mintavételezést kínál. Az üzemeltetők például a tranzakciók 10 százalékán futtathatnak toxicitási vagy adatszivárgási ellenőrzéseket. Az aszinkron feldolgozás a New Relic szerint folyamatos biztonsági felügyeletet tesz lehetővé anélkül, hogy minden interakciót értékelni kellene.

A vállalati felhasználók számára a bejelentés lényege, hogy az AI-alkalmazások működését a rendszer teljes életciklusán keresztül követhetik. A fejlesztők ellenőrizhetik, hogy egy prompt vagy RAG-logika módosítása javítja-e a relevanciát, az üzemeltetők pedig a minőségi eredményeket a teljesítménnyel és a költségekkel együtt vizsgálhatják.

New RelicAI EvaluationNew Relic AI Observabilityvállalati AIAI-biztonságkódolás
Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A New Relic három pillérrel készül az AI üzemi kihívásaira
Termékek és eszközök2026. október 6. 14:00

A New Relic három pillérrel készül az AI üzemi kihívásaira

A New Relic három pillérre építi az AI-alapú fejlesztés és üzemeltetés támogatását: AI Observability, Autonomous Operations és Platform Engineering. A vállalat szerint a…

A New Relic Advanced APM-je az üzleti hatásokhoz köti a telemetriát
Termékek és eszközök2026. október 6. 14:00

A New Relic Advanced APM-je az üzleti hatásokhoz köti a telemetriát

A New Relic bemutatta az Advanced APM-et, amely a telemetriai adatokat üzleti mutatókkal kapcsolja össze. A csomag célja, hogy a mérnöki és SRE-csapatok gyorsabban…

Az Anaconda szabályozott csomagokat és modelleket hoz a folyamatokba
Termékek és eszközök2026. október 5. 23:08

Az Anaconda szabályozott csomagokat és modelleket hoz a folyamatokba

Az Anaconda Platform új funkciója automatikusan szabályozza, hogy egy AI-munkafolyamat egyes lépései milyen Python-csomagokat és modelleket használhatnak. A fejlesztők…