A New Relic az AI-válaszok minőségét is beköti a rendszerfigyelésbe

A New Relic bemutatta az AI Evaluation szolgáltatást, amely a generatív AI-rendszerek válaszait biztonság, pontosság és relevancia alapján értékeli. Az eredményeket közvetlenül a vállalati alkalmazások elosztott nyomkövetéseihez kapcsolja, így a fejlesztők a minőségi hibákat az azokat okozó rendszerkomponensekig követhetik.
- Az AI Evaluation 0 és 1 közötti pontszámot, pass vagy fail állapotot és indoklást ad.
- Az eredmények közvetlenül az eredeti elosztott nyomkövetések attribútumaivá válnak.
- A szolgáltatás hallucinációkat, adatszivárgást, promptinjekciót, toxicitást és elfogultságot is vizsgál.
- A minőségi eredményeket a modell- és infrastruktúraköltségekkel is összekapcsolja.
- A mintavételezés lehetővé teszi, hogy az értékelés csak a tranzakciók egy részén fusson.
A hagyományos monitorozás nem lát minden hibát
A New Relic szerint a vállalati mérnöki csapatok egyre gyorsabban vezetnek be autonóm ügynököket és RAG, vagyis visszakereséssel támogatott generálási architektúrákat. A kísérleti szakaszból éles környezetbe lépve azonban a hagyományos szoftveres megfigyelés jelentős hiányosságokat mutat.
A teljesítménymonitorozás jellemzően az áteresztőképességet és a késleltetést méri, a szemantikai hibákat viszont nem feltétlenül érzékeli. Így rejtve maradhatnak például a hallucinációk, a személyes adatok kiszivárgása vagy a modellek váratlan működésbeli eltolódásai. A New Relic AI Evaluation ezt a hiányt azzal kezeli, hogy automatizált minőségi ellenőrzéseket épít be a meglévő megfigyelési munkafolyamatba.
Pontszámok és indoklás az elosztott nyomkövetésekben
A szolgáltatás aszinkron, LLM-et bíróként használó értékelési rendszerrel vizsgálja a mintavételezett felhasználói kéréseket és modellválaszokat. Az interakciókat előre meghatározott biztonsági és minőségi paraméterek alapján pontozza. Minden értékelt interakció 0 és 1 közötti normalizált pontszámot, testre szabható küszöbök alapján pass vagy fail állapotot, valamint szöveges indoklást kap.
Az értékelési adatok közvetlenül a New Relic platformjára kerülnek vissza, és attribútumként csatlakoznak az eredeti elosztott nyomkövetéshez. A mérnökök egyetlen nézetben láthatják a promptot, az értékelés indoklását, a modellválaszt és az alkalmazás többi részének működését. Ha egy válasz nem éri el a minőségi küszöböt, a hiba a kapcsolódó promptszegmenshez, vektoradatbázis-lekérdezéshez vagy háttérszolgáltatáshoz vezethető vissza.
Biztonsági ellenőrzések és RAG-diagnosztika
A New Relic közlése szerint az AI Evaluation előre elkészített értékelőket kínál, amelyekhez nincs szükség külön beállításra vagy konfigurációra. A mintavételezett bemeneteket és válaszokat többek között promptinjekció, a biztonsági korlátozások megkerülésére irányuló kísérlet, személyes adatok, mérgező vagy sértő nyelvezet, illetve elfogultság szempontjából vizsgálja.
RAG-rendszerek és autonóm ügynökök esetében a szolgáltatás külön kezeli a visszakeresés és a válaszgenerálás problémáit. A faithfulness, vagyis a forráskörnyezettel való tényszerű összhang azt méri, hogy a generált válasz követi-e a visszakeresett információt. Az answer relevancy és a kontextus relevanciája azt vizsgálja, hogy a megtalált információ illeszkedik-e a kérdéshez, illetve a végső válasz közvetlenül reagál-e a felhasználói kérésre.
A költségek és a minőség együtt vizsgálhatók
Az AI Evaluation a minőségi pontszámokat az infrastruktúra-felhasználással és a modellköltségekkel is összekapcsolja. Ez lehetővé teszi annak vizsgálatát, hogy a nagyobb paraméterszámú, drágább modellek jobb pontosságot és relevanciát biztosítanak-e a gyorsabb, olcsóbb alternatíváknál. A New Relic szerint a szervezetek így lecserélhetik az alulteljesítő nagy nyelvi modelleket, és csökkenthetik a tokenfelhasználást anélkül, hogy feláldoznák a válaszok minőségét.
Az értékelési többletterhelés mérséklésére a platform rugalmas mintavételezést kínál. Az üzemeltetők például a tranzakciók 10 százalékán futtathatnak toxicitási vagy adatszivárgási ellenőrzéseket. Az aszinkron feldolgozás a New Relic szerint folyamatos biztonsági felügyeletet tesz lehetővé anélkül, hogy minden interakciót értékelni kellene.
A vállalati felhasználók számára a bejelentés lényege, hogy az AI-alkalmazások működését a rendszer teljes életciklusán keresztül követhetik. A fejlesztők ellenőrizhetik, hogy egy prompt vagy RAG-logika módosítása javítja-e a relevanciát, az üzemeltetők pedig a minőségi eredményeket a teljesítménnyel és a költségekkel együtt vizsgálhatják.


