Inkubációs szintre lépett a Monocle, az AI-ügynökök tesztelési projektje
Inkubációs szintre lépett a Monocle, az LF AI & Data nyílt forráskódú projektje, amely az AI-ügynökök működési nyomaiból ismételhető teszteket készít. A kezdeményezés célja, hogy a fejlesztők a végső válasz mellett az ügynökök belső működését is ellenőrizhessék.
- A Monocle Sandbox státuszból inkubációs szintre lépett az LF AI & Data szervezetnél.
- A projekt az AI-ügynökök működési nyomaiból ismételhető teszteket készít.
- Ellenőrizhetők az ügynökök, eszközhívások, paraméterek, költségek és tokenkorlátok.
- A Monocle OpenTelemetryre épül, és több AI-keretrendszert, modellplatformot és vektoros adattárat támogat.
- A roadmap további nyelveket, szolgáltatásokat, adatbázisokat és összetettebb értékeléseket ígér.
A Sandbox szintről lépett tovább a projekt
Az LF AI & Data Foundation szeptember 1-jén jelentette be, hogy a Monocle, amelyet időnként Monocle2AI néven is említenek, Sandbox státuszból Incubating, vagyis inkubációs szintre lépett. A szervezet szerint a besorolás a projekt technikai érettségének, közösségi fejlődésének és annak elismerése, hogy a Monocle segítséget nyújthat megbízhatóbb generatív és ügynökalapú AI-alkalmazások fejlesztésében.
A Monocle 2024-ben csatlakozott az LF AI & Data szervezethez Sandbox projektként. Az inkubációs státusz olyan kezdeményezéseknek szól, amelyek egyre érettebbé válnak, és kiépítik a szélesebb körű használathoz szükséges irányítást, közreműködői részvételt, dokumentációt, kiadási gyakorlatokat és technikai alapokat.
A működési nyomokból ismételhető tesztek készülnek
Az AI-ügynökök egy feladat teljesítése közben több modellt, eszközt, adatforrást, vektoros adattárat, API-t és alügynököt is használhatnak. Ha hiba történik, a végső válaszból gyakran nem derül ki, mi vezetett a problémához. A fejlesztőknek akkor is ellenőrizniük kell az alkalmazás tényleges viselkedését, ha az kívülről megfelelően működik.
A Monocle az összetett ügynöki működésből származó nyomokat tesztekké alakítja. A fejlesztők közvetlenül az ügynöki ciklus egyes lépéseire állíthatnak fel ellenőrzéseket. Vizsgálható például, hogy mely ügynökök indultak el, milyen eszközhívások és alügynöki átadások történtek, milyen paramétereket kaptak az eszközök, mekkora költséggel járt egy interakció, történt-e hiba, illetve az alkalmazás a meghatározott teljesítmény- vagy tokenkorlátokon belül maradt-e.
A rendszer értékeléseket is be tud építeni, amelyek a csendben bekövetkező hibák felismerését szolgálják. A fejlesztők így az ügynökök viselkedését már a fejlesztési és folyamatos integrációs, illetve folyamatos szállítási folyamatokban is ellenőrizhetik. Ugyanazok a strukturált nyomok, amelyek hibakereséshez használhatók, ismételhető bizonyítékká válhatnak arra, hogy az alkalmazás a későbbiekben is az elvárt módon működik.
OpenTelemetryre épülő, több eszközt támogató réteg
A Monocle az OpenTelemetryre épülő megfigyelhetőségi réteget kínál generatív AI-alkalmazásokhoz. Automatikusan képes nyomokat készíteni többek között az ügynökfuttatásokról, a modellhívásokról, az eszközhívásokról és a visszakeresési lekérdezésekről. A létrejövő strukturált adatok használhatók meglévő, OpenTelemetry-kompatibilis gyűjtőkkel és megfigyelhetőségi platformokkal.
A projekt metamodelje egységesen ábrázolja a generatív AI összetevőit, köztük az ügynököket, utasításokat, válaszokat, eszközöket és vektoros műveleteket, különböző keretrendszerek és technológiai szolgáltatók mellett. A Monocle több ügynöki keretrendszert, modellplatformot, vektoros adattárat és alkalmazási környezetet támogat. Az alacsony kódigényű műszerezési lehetőségek révén a fejlesztők és platformcsapatok nagyobb kódmódosítás nélkül vezethetik be a nyomkövetést.
A kapcsolódó monocle-test-tools keretrendszer pytest-stílusú tesztekben és CI/CD-folyamatokban teszi felhasználhatóvá ezeket a nyomokat. A fejlesztők egyedi interakciókat, több ügynökből álló munkafolyamatokat és többfordulós munkameneteket is ellenőrizhetnek az alkalmazás futása közben létrejött telemetria segítségével.
Bővülő közösség és további fejlesztési tervek
Az LF AI & Data vendorsemleges, nyílt irányítása mellett a Monocle közössége fejlesztőkkel, platformmérnökökkel, üzemeltetési megbízhatósági csapatokkal, kutatókkal és vállalatokkal dolgozhat együtt az ügynökalapú AI-rendszerek megbízhatóságán. A projekt útiterve további programozási nyelvek, ügynöki keretrendszerek, modellalapú szolgáltatások és vektoros adatbázisok támogatását tartalmazza.
A tervek között összetettebb tesztelési állítások és értékelési képességek is szerepelnek, amelyek komplex, illetve szabályozott működésű AI-alkalmazásokhoz lehetnek hasznosak. A projekt forráskódja a Monocle GitHub-tárházában érhető el, az LF AI & Data pedig fejlesztőket, szervezeteket és kutatókat hív a következő szakasz alakítására.
LF AI & Data Foundation: Monocle Advances to Incubating Status at LF AI & Data


