Az LLM-routerek csökkentik a költségeket, de a minőséget figyelni kell

Az LLM-routerek az adott feladathoz elegendő, legolcsóbb modellt választják ki, ezzel csökkenthetik a vállalati mesterségesintelligencia-költségeket. A Fiddler AI szerint azonban a megtakarítás csak akkor biztonságos, ha a rendszerek folyamatosan ellenőrzik a válaszok minőségét és azt is rögzítik, melyik modell dolgozott az egyes kéréseken.
- Az LLM-routerek minden kérést a minőségi küszöböt teljesítő legolcsóbb modellhez irányítanak.
- A Ramp szerint a Router körülbelül 30 százalékkal csökkentette az inferenciára fordított számlát.
- A költség- és tokenadatok önmagukban nem mutatják, romlott-e a válaszok minősége.
- Routing esetén az értékelésnek és a megfigyelésnek követnie kell a ténylegesen használt modellt.
- A Fiddler AI szerint a költségszabályozást, a minőségellenőrzést és az auditálást egy kontrollrétegben kell kezelni.
A routerek a költségcsökkentés új rétegét jelentik
A vállalatok mesterségesintelligencia-inferencia költségei gyorsan növekvő költségsort jelentenek. A Fiddler AI szerint ennek egy része pazarlás, mivel sok rendszer alapértelmezésként a legfejlettebb, egyben drágább modellt használja olyan feladatokra is, mint egy igazgatósági prezentáció összefoglalása vagy egy ügyfélszolgálati megkeresés besorolása.
Az LLM-routerek az alkalmazás és a modell szolgáltatója közé kerülnek. Minden kérést ahhoz a modellhez irányítanak, amelyik teljesíti az előre meghatározott minőségi küszöböt, miközben a lehető legalacsonyabb költséget kínálja. A döntés így kérésenként születik meg, ahelyett, hogy az alkalmazás minden alkalommal közvetlenül ugyanazt a modellt hívná.
A Fiddler AI a Ramp Router példáját említi. A Ramp belső fejlesztésű rendszere külső felhasználók számára korai hozzáférési várólistán keresztül terjed, és a vállalat állítása szerint körülbelül 30 százalékkal csökkentette az inferenciára fordított számlát ugyanazon munka elvégzése mellett. A router a cég szerint havonta több trillió tokent kezel.
A költségadatok önmagukban nem mutatják a minőséget
A vállalati költségkezelés több különálló eszközből állhat. A szolgáltatói számlázási felületek az API-kulcsonkénti költést mutatják, a FinOps és a tokenköltést kezelő rendszerek pedig csapat, termék vagy modell szerint osztják fel a használatot. A kapuként működő eszközök, köztük a LiteLLM, a Portkey és az OpenRouter, költségkeretekkel, sebességkorlátokkal és kredithatárokkal fékezhetik meg a túlzott használatot.
A routerek ettől eltérően már az egyes kérések szintjén próbálják mérsékelni a kiadásokat. A Fiddler AI szerint ezek a rendszerek jellemzően dollárokat és tokeneket mérnek, arról viszont nem adnak választ, hogy romlott-e a kimenetek minősége. Minden routing döntés azon a feltételezésen alapul, hogy az olcsóbb modell elég jó az adott feladathoz.
A minőségi küszöb feladatonként változik. Más elvárások vonatkoznak egy ügyfélszolgálati osztályozóra, mint egy szerződéseket elemző ügynökre. A nyilvános tesztkészleteken mért eredmények segíthetnek a kezdeti rangsorolásban, de nem feltétlenül tükrözik az adott vállalat felhasználóit, adatait és kéréseit.
A többmodellű működés új megfigyelési és auditálási igényt teremt
A Fiddler AI szerint a legtöbb értékelési és megfigyelési rendszer eredetileg abból indult ki, hogy egy alkalmazás egy modellel dolgozik. Routing esetén ugyanaz a kérés egyik nap másik modellt kaphat, ezért az alapértékeknek, a regressziós teszteknek és az eltérésészlelésnek is követnie kell, hogy ténylegesen melyik modell szolgálta ki a kérést.
Ez a szolgáltatók modellfrissítései miatt különösen fontos. A szolgáltató ugyanazon API-név mögött is módosíthatja a modellt, miközben az új modellről csak néhány hét mérési adata áll rendelkezésre az adott munkaterhelésen. Ha kizárólag a költést figyelik, a minőségromlás akár sikernek is tűnhet, mivel az olcsóbb modell továbbra is kiválasztódik, a számla pedig csökken.
Egy hibás válasz kivizsgálásakor tudni kell, melyik modell állította elő, miért választotta azt a router, és ugyanaz a kérés ma is ugyanarra a modellre kerülne-e. A Fiddler AI ezért modellalapú telemetriát, folyamatos értékelést, modellenkénti és feladatonkénti megfigyelést, valamint auditnyomot tart szükségesnek.
A kontrollréteg a költséget és a minőséget együtt kezeli
A Fiddler AI ezt AI Control Plane, vagyis mesterségesintelligencia-vezérlési réteg segítségével képzeli el. A vállalat szerint ennek egy rendszerben kell egyesítenie a megbízható értékelést, a folyamatos megfigyelést, a kikényszeríthető szabályokat és az auditálható irányítást.
A minőség ellenőrzésének költsége is számít. Ha minden választ egy külső nyelvi modellel kell értékeltetni, az úgynevezett Evaluation Trust Tax, vagyis értékelési bizalmi adó, visszaveheti a routingból származó megtakarítást. A Fiddler saját Centor Models modelljeit kifejezetten értékelési feladatokra szánta, és állítása szerint ezek alacsony késleltetéssel, külső nyelvimodell-API költsége nélkül futnak.
A hír a felhasználók és a vállalatok számára azt jelenti, hogy az olcsóbb modellválasztás önmagában nem elég. A routerek akkor tehetik tartósabbá a megtakarítást, ha a rendszerek bizonyítani tudják, hogy a minőségi küszöb fennmarad, és minden kéréshez visszakereshető, melyik modell milyen teljesítményt nyújtott.
Fiddler AI: Routing Cuts AI Costs But the Model Still Needs Watching


