Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A ZenML új Kitaruja a produkciós hibákból készít ismételhető teszteket

2026. augusztus 18. 11:34Forrás: ZenML
A ZenML új Kitaruja a produkciós hibákból készít ismételhető teszteket
Kép: ZenML

A ZenML új Kitaru eszköze a produkcióban rögzített ügynökmeneteket ismételhető tesztesetekké alakítja. A cél, hogy a csapatok biztonságosan vizsgálhassák a modell-, prompt- és eszközváltoztatások hatását.

A lényeg röviden
  • A Kitaru produkciós nyomokból ismételhető teszteseteket készít.
  • A rendszer több nyomkövetési eszközből és OpenTelemetry-adatokból is importál.
  • A szakértői döntések verziózott cohortokká és Python-alapú értékelőkké alakíthatók.
  • A visszajátszás a rögzített eszközválaszokkal elkerüli az éles rendszerek újbóli módosítását.
  • A változtatások teljes esetcsoportokon hasonlíthatók össze az alapállapottal.

A produkciós hibákból indul a tesztelés

A ZenML 2026. augusztus 18-án mutatta be az új Kitarut. A vállalat szerint a legtöbb, produkcióban működtetett ügynök mellett már létezik valamilyen értékelési folyamat: egy problémás munkamenetet elmentenek, szakértővel átbeszélik, majd táblázatba vagy regressziós tesztbe rögzítik.

Ez a folyamat azonban gyakran esetleges marad. A nyomok külön eszközben vannak, a szakértői döntések máshol, a visszajátszásokhoz pedig egyedi szkriptek készülnek. A Kitaru ezt az utat próbálja egységesíteni: a már összegyűjtött produkciós nyomokból munkameneteket készít, ezeket valós hibamódok köré rendezi, szakértői értékelést kapcsol hozzájuk, majd ismét futtatható értékelőket hoz létre.

A ZenML megközelítése szerint a produkció már eleve a leghasznosabb teszteseteket termeli ki. Ilyen lehet egy szokatlan eszközhívási ciklus, egy tizenhat órán át futó munkamenet vagy egy olyan felhasználói kérés, amelyre a kézzel összeállított tesztkészlet nem tért ki.

Meglévő nyomkövetési rendszerekből is importál

A Kitaru a ZenML szerint képes adatokat beolvasni a Langfuse, a LangSmith, a Braintrust és a Logfire rendszereiből, továbbá egyszerű JSONL-fájlokból és OpenTelemetry-formátumú adatokból. Ehhez nem kell lecserélni a produkcióban használt megfigyelési rendszert, a Kitaru abból olvassa ki a szükséges adatokat.

Új futtatások közvetlen rögzítésére adapterek használhatók a Pydantic AI, a LangGraph, az OpenAI Agents SDK, a Mastra és a Vercel AI SDK mellett. A rendszerbe került munkamenetek ezután vizsgálhatók, értékelhetők és visszajátszhatók, függetlenül attól, hogy korábbi nyomkövetésből vagy közvetlen rögzítésből származnak.

A Kitaru determinisztikus és nagy nyelvi modellre épülő ellenőrzésekkel keres mintázatokat az importált munkamenetek között. Ezek jelezhetnek például ismétlődő eszközhívásokat, szokatlanul drága futásokat, hosszú munkameneteket vagy hasonló módon hibázó esetcsoportokat. A ZenML hangsúlyozza, hogy ezek kiindulópontok, nem végleges igazságok.

A szakértői döntésből verziózott értékelő lesz

A hasonló esetek felismerését a Kitaru nem tekinti üzleti döntésnek. A kapcsolódó munkameneteket és ellenpéldákat a szakértők vizsgálhatják, majd konkrét kérdésekre válaszolva jelölhetik elfogadhatónak, problémásnak vagy bizonytalannak az eredményt. A döntés a nyom megfelelő részéhez kapcsolódik, így az értékelés bizonyítékhoz kötve marad.

Az ilyen döntésekből rögzített, verziózott munkamenetcsoportok, úgynevezett cohortok készülhetnek. Ezek egy-egy fontos viselkedést vagy hibamódot képviselnek, például a refund_escalation, a tool_call_loops, az incorrect_routing vagy a long_running_sessions esetkört.

Ha már ismert, hogy egy adott helyzetben mi számít jó vagy rossz működésnek, a Kitaru Python-függvényként megvalósított értékelővé alakíthatja ezt a szabályt. Az értékelők verziózott kódként élnek az ügynök mellett. A rendszer lehetővé teszi annak ellenőrzését is, hogy az értékelő mennyire egyezik a szakértők korábbi döntéseivel. A ZenML szerint egy olyan értékelőnek, amely az esetek felében eltér a szakértői ítélettől, nem szabad telepítést blokkolnia.

Biztonságos visszajátszás és összehasonlítható kísérletek

A Kitaru visszajátszáskor a korábbi munkamenet felvételét használhatja a környezet helyettesítésére. Ha az eszközszabályzatban a history mód aktív, az ügynök a rögzített válaszokat kapja meg, ahelyett hogy újra valódi visszatérítést indítana vagy módosítaná a CRM-rendszert.

A ZenML azt javasolja, hogy először változtatás nélkül játsszák vissza az eredeti munkamenetet, hogy megbízható alapállapot jöjjön létre. Ezután egyetlen módosítás, például másik modell, új rendszerszintű utasítás, eltérő kontextus vagy új eszközszabályzat hatása vizsgálható.

Egyetlen visszajátszás hibakeresésre alkalmas, egy teljes cohort viszont döntést támogathat. A Kitaru kísérletei egy kiválasztott munkamenetcsoporton futtatják végig a változtatást, miközben az alapállapotot is értékelik. Így összehasonlíthatóvá válik, hogy az új modell vagy prompt mely eseteken javított, és hol rontott a működésen. A cohort verziója változatlan marad, ezért a ZenML szerint később is rekonstruálható, mely eseteket, mely ügynökverziót és mely értékelőt használták.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A LangChain modellirányítóval 64 százalékkal csökkentette a költséget
Fejlesztőknek2026. október 2. 15:31

A LangChain modellirányítóval 64 százalékkal csökkentette a költséget

A LangChain modellirányítót épített nyílt forráskódú Open SWE kódoló ügynökébe, amely a feladat összetettsége alapján választ a modellek között. A vállalat kísérleteiben…

A LangSmithben is elérhető a Jev, az ügynökök gyors értékelője
Fejlesztőknek2026. szeptember 30. 01:10

A LangSmithben is elérhető a Jev, az ügynökök gyors értékelője

A LangSmithben mostantól Jev-alapú értékelő is használható az AI-ügynökök működésének vizsgálatára. A TypeSafe System One modellje strukturált válaszokat ad, és a…

A LangSmithben is elérhető a Jev, az agentek új értékelője
Fejlesztőknek2026. szeptember 30. 01:10

A LangSmithben is elérhető a Jev, az agentek új értékelője

A LangSmithben mostantól Jev is használható az agentek teljesítményének értékelésére. A TypeSafe AI rendszerét a LangChain gyors, olcsó és strukturált visszajelzésekhez…