A Mastra már workflow-kat és értékelőket is tesztel kísérletekben

A Mastra kiterjesztette kísérleti rendszerét: az ügynökök mellett már workflow-k és scorerek, vagyis értékelők is külön tesztelhetők. Az eredmények összehasonlíthatók, ellenőrizhetők és további szolgáltatásoknak is továbbíthatók.
- A Mastra kísérletei már workflow-k és scorerek ellen is futtathatók.
- Az agent és workflow célpontok bemenetet és groundTruth értéket használnak.
- A scorer célpontoknál a bemenetet, a várt és a tényleges kimenetet is meg kell adni.
- A kísérletek a Studio, a TypeScript API, a CLI és a HTTP-végpontok felületéről érhetők el.
- A funkcióhoz @mastra/[email protected] vagy újabb verzió szükséges.
Egyenként vizsgálhatók a Mastra építőelemei
A Mastra 2026. szeptember 21-én jelentette be az Experiment Targets funkciót. A rendszerrel kísérletek futtathatók workflow-k és scorerek ellen, előre meghatározott adatkészletek használatával.
A Mastra februárban indította el az adatkészletekre épülő kísérleteket. Ezekkel a promptok módosítása, a modell cseréje vagy a kód változtatása után lehetett regressziókat keresni, a funkció azonban akkor még csak az ügynököket támogatta. Az új célpontokkal a workflow-k és maguk a scorerek is értékelhetők.
Az Experiment Targets lehetővé teszi, hogy a fejlesztők minden primitívet külön, meghatározott bemenetekkel és elvárt kimenetekkel, úgynevezett ground truth értékekkel teszteljenek. Az adatokat és a kísérletek eredményeit a rendszer tárolja, így azok később megvizsgálhatók, összevethetők vagy továbbküldhetők downstream szolgáltatásoknak.
Négy felületről indíthatók a kísérletek
A kísérletek négy Mastra-felületről futtathatók, amelyek eltérő használati módokat szolgálnak ki. A Studio emberi ellenőrzésre és összehasonlításra használható. A TypeScript API belső értékelőalkalmazásokhoz ad hozzáférést. A parancssori felület, vagyis a CLI olyan folyamatokba illeszthető, amelyek akár a telepítéseket is blokkolhatják. A HTTP-végpontok további monitorozási szolgáltatásokhoz kapcsolhatók.
Az agent és workflow célpontokhoz az adatkészlet elemeinek egy bemenetet és egy groundTruth értéket kell tartalmazniuk. A kimenetet jellemzően egy nagy nyelvi modell vagy egy eszközhívás állítja elő. A scorer célpontoknál a bemenetet, a groundTruth értéket és a kimenetet is meg kell adni, mivel maguk a scorerek nem állítanak elő kimenetet.
A funkció használatához az @mastra/[email protected] vagy újabb verzió szükséges. A támogatás a Mastra GitHub-tárházának #12747 számú pull requestjében került be.
Tároló és programozható hozzáférés is kell hozzá
A kísérletek futtatásához tárolási adapter szükséges, amely megőrzi az adatkészleteket és a kísérleti eredményeket. A Mastra útmutatója ehhez a @mastra/libsql csomag telepítését és egy LibSQLStore beállítását írja elő. A konfigurációban a TURSO_DATABASE_URL és a TURSO_AUTH_TOKEN környezeti változókat kell használni.
Ha a projektet a Mastra platformján telepítik, a szolgáltatás automatikusan létrehoz egy Turso-adatbázist. A Studio felületén ezután a Datasets fülön hozható létre adatkészlet, amelyhez bemenetek és elvárt kimenetek adhatók. A kísérlet egy agent, workflow vagy scorer célponttal indítható, az Experiments fülön pedig két futás eredménye hasonlítható össze egymás mellett.
Az adatkészletek és a kísérletek programból is kezelhetők. A TypeScript API és a HTTP API mellett az adatkészletek létrehozásához a CLI is használható. A Mastra dokumentációja szerint a CLI-ből kísérlet létrehozása nem támogatott, ehhez a HTTP API vagy a TypeScript API szükséges. A kísérletek futtatása viszont a CLI-ből is elérhető.
Mit jelent ez a Mastra használóinak?
Az új célpontokkal a fejlesztők ugyanabban a kísérleti rendszerben vizsgálhatják az ügynökök, a workflow-k és az értékelők működését. A tárolt adatkészletek és eredmények megkönnyítik a változtatások előtti és utáni összehasonlítást, míg a Studio, a TypeScript API, a CLI és a HTTP-végpontok különböző fejlesztési és üzemeltetési folyamatokba illeszthetők.
Mastra: Introducing Experiment Targets | Mastra Blog


