Az Arize AI menedzselt ügynöke az LLM-költségek csökkentését célozza

Az Arize AI olyan menedzselt ügynököt épített az AX platformba, amely az LLM-alapú alkalmazások költséges működési pontjait keresi meg. A Cost Agent a megfigyelési adatok alapján módosításokat javasolhat, a kapcsolódó kódhoz pedig pull requestet készíthet.
- Az Arize AI Cost Agent az AX platformon elemzi az ügynökös alkalmazások költségeit.
- A rendszer nyomkövetési adatokat és kapcsolt kódtárat is vizsgálhat.
- Egy bemutatott esetben hat módosítás becsült megtakarítása 35-40 százalék volt.
- A Cost Agent pull requestet javasol, de a változtatásokat mérnökök hagyják jóvá.
- Az AX költségkövetése span- és nyomvonal-szinten árazza az LLM-hívásokat.
Az ügynökös alkalmazások költsége gyorsan növekedhet
Az Arize AI szerint egyetlen felhasználói kérés több modellhívást indíthat el. Ilyen lehet a tervezés, az eszköz kiválasztása, az információk lekérése és a végső válasz összeállítása. A költség ezekből a lépésekből a hónap végén gyakran egyetlen, nehezen bontható tételként jelenik meg.
A költségek ráadásul nem feltétlenül a forgalommal azonos ütemben nőnek. Ha egy eszköz nagy adatmennyiséget ad vissza, az adat a beszélgetés részévé válhat, és ugyanazon nyomvonal későbbi modellhívásaiban is újra elküldik. Az Arize példája szerint ezért a forgalom megduplázódása az inferenciaköltség ennél nagyobb növekedését is okozhatja.
A vállalat úgy látja, hogy a költségkezelésnek a megfigyelhetőség részeként kell működnie. Nem elég feltárni, mely műveletek drágák, azt is meg kell mutatni, hogyan lehet csökkenteni a kiadásokat.
A Cost Agent a nyomkövetési adatokat és a kódot vizsgálja
Az Arize AX-ban elérhető Cost Agent a New Agent választóban jelenik meg a Signal és a hibakereső ügynökök mellett. A beállítás során megadható az integráció, az olvasható nyomkövetési projekt, valamint az, hogy az ügynök egyszer fusson, vagy ütemezetten dolgozzon.
GitHub-kapcsolattal az ügynök a telemetria mellett a megvalósítást is olvashatja. Így a költséges műveletek azonosítása után pull requestet készíthet a javasolt módosításokkal. Az indítás előtt a feladatleírás szerkeszthető, ezért további megkötések és korábban kipróbált stratégiák is megadhatók.
A futás homokozott környezetben zajlik, élő átirattal, amelyet a felhasználó figyelhet és megszakíthat. Az Arize bemutatójában a folyamat 16 percig tartott, és 62 lépésből állt.
Egy példa szerint a probléma a túl nagy eszközválasz volt
A vizsgált rendszer 30 napos alapállapotában 500 LLM-span szerepelt, amelyek mindegyike gpt-4o-mini modellt használt. A költség 72 százalékát a pénzügyi adatokat és webes kutatást végző ügynökcsomópont adta, a felügyelő 15, az összegző pedig 12 százalékért felelt.
Az ügynök a read_webpage függvényhez vezette vissza a legnagyobb eltérést. A függvény hívásonként akár 50 000 karaktert, nagyjából 12 500 tokent is visszaadott. Ez a tartalom a LangGraph közös AgentState.messages állapotába került, majd ugyanazon nyomvonal későbbi lépéseiben ismét elküldték a modellnek. A mintában 71 ilyen hívás szerepelt, és egyetlen nagy oldalbetöltés három-négy további modellhívást is felduzzasztott.
A vizsgálat további problémákat is talált. A 631 654 prompttoken között nem volt gyorsítótár-találat, mert a felügyelő két rendszerpromptja átlagosan 688 tokenes volt, az OpenAI automatikus gyorsítótárazási küszöbe pedig 1024 token. Az összegző a teljes beszélgetési előzményt, a nyers API-válaszokat is újra feldolgozta, két pénzügyi eszköz pedig a szükséges legutóbbi időszak helyett többéves idősorokat adott vissza.
A javasolt módosításokat továbbra is mérnökök hagyják jóvá
A kapcsolt kódtár miatt a vizsgálat hat módosítást tartalmazó pull requesttel zárult. A javaslatok között szerepelt a read_webpage válaszának 50 000-ről 6000 karakterre rövidítése, az összegző szerep- és üzenetszűrésének javítása, az InMemoryCache bekötése a set_llm_cache() használatával, valamint a két pénzügyi eszköz korlátozása limit=2 értékre.
Az ügynök a felügyelő előzményeit az utolsó négy üzenetre szűrte volna, és külön példányba szervezte volna a felügyelő modelljét, hogy később lehetővé váljon a szerepkörönkénti modellirányítás. Az Arize becslése szerint a hat változtatás együtt a havi számla körülbelül 35-40 százalékát takaríthatja meg.
A Cost Agent nem telepít önállóan éles módosításokat. A pull request javaslat marad, amelyet a mérnökök átnéznek, és akár el is utasíthatnak. Az Arize szerint például a weboldal tartalmának 6000 karakterre vágása termékdöntés is, mivel attól függ, mennyi információra van szüksége a kutatóügynöknek.
Az AX költségkövetése a közlemény szerint általánosan elérhető. A rendszer span- és nyomvonal-szinten árazza az LLM-hívásokat, támogatja a gyakori modellek alapértelmezett beállításait, az egyéni díjakat, a gyorsítótárazott és gondolkodási tokeneket, valamint a többszintű árazást.
Arize AI: Agent cost management is about more than the model


