Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Docker új készlete ismételhetőbbé teszi az AI-értékeléseket

2026. szeptember 2. 15:00Forrás: Docker
A Docker új készlete ismételhetőbbé teszi az AI-értékeléseket
Kép: Docker

A Docker nyílt forráskódú SBX AI Evaluation Kitje az AI-értékelési munkafolyamatok ismételhető végrehajtását és ellenőrzését segíti. A készlet nem modelleket futtat és nem hoz létre automatikusan értékelési ítéleteket, hanem rögzíti, mi történt a beállított parancsok végrehajtásakor.

A lényeg röviden
  • A Docker bemutatta az SBX AI Evaluation Kitet, egy nyílt forráskódú Docker Sandboxes Mixin Kitet.
  • A készlet a futtatott parancsot, a kimeneteket, a kilépési kódot és a végrehajtási időt is rögzíti.
  • A helyi és az SBX végrehajtó között a konfiguráció módosításával lehet váltani.
  • Az értékelési sorozatok több definíciót és egy összesített futási összefoglalót kezelnek.
  • A megoldás nem modelleket értékel automatikusan, hanem a végrehajtás megismételhetőségét segíti.

A környezet is befolyásolja az eredményeket

A Docker szeptember 2-án közzétett blogbejegyzése szerint az AI-értékelések elindítása ma már egyszerűbb, az eredmények megbízható megismétlése azonban továbbra is nehéz. A fejlesztők egyre több referenciaértékeléshez, értékelési könyvtárhoz, modell-API-hoz és ügynökkeretrendszerhez férnek hozzá, de az azonos prompt, modell és pontozási módszer önmagában nem garantálja ugyanazt a futást.

A végrehajtási környezetben idővel változhatnak a Python-függőségek, eltérhetnek a helyi eszközök, és dokumentálatlanok maradhatnak a beállítási lépések. Emiatt egy munkafolyamat sikeresen lefuthat az egyik gépen, miközben egy másikon vagy hetekkel később másképp viselkedik. A Docker szerint az értékelésekről szóló viták jellemzően arra összpontosítanak, mit kell mérni, például a referenciaértékelésekre, a pontozásra vagy a bírói modellekre. Kevesebb figyelem jut arra, hogyan hajtják végre ezeket a teszteket, pedig ez határozhatja meg, hogy mások később meg tudják-e ismételni ugyanazt a munkafolyamatot.

A készlet rögzíti, mi futott le

Erre a problémára készült az SBX AI Evaluation Kit, amely Docker Sandboxes környezethez használható, nyílt forráskódú Mixin Kit. A megoldás célja az ismételhető végrehajtás, a strukturált értékelési rekordok és a futás közben keletkező bizonyítékok megőrzése.

A készlet minden értékelést egy YAML-fájlban ír le. Ebben szerepel az értékelés leírása és a futtatandó parancs. A tárház ellenőrzi ezt a definíciót, végrehajtja a parancsot, majd strukturált JSON-rekordot készít az eredményről. A rögzített adatok között megtalálható a kiválasztott végrehajtó, a futtatott parancs, a szabványos kimenet és hibakimenet, a kilépési kód, valamint a végrehajtás ideje.

A tárház emellett kivonatot készít az értékelés konfigurációjáról. Ez determinisztikus kapcsolatot hoz létre a konfiguráció és az általa létrehozott eredmény között. A Docker hangsúlyozza, hogy ez nem teljes értékű kísérletkövető rendszerek kiváltására szolgál.

A végrehajtás helyét külön executor absztrakció kezeli. A helyi végrehajtó a gazdagépen futtatja a beállított parancsot, az SBX végrehajtó pedig Docker Sandboxes környezetbe delegálja azt. A két mód között az executor konfigurációjának módosításával lehet váltani, a teljes értékelési munkafolyamat átírása nélkül.

Egyetlen futástól az értékelési sorozatokig

A gyakorlatban a munkafolyamat azzal kezdődik, hogy a konfiguráció meghatározza, hol fusson az értékelési parancs. Az executor: sbx beállítás a Docker Sandboxes rendszerére bízza a végrehajtást, amely a futás bizonyítékait a létrejövő eredményben tárolja. A tárház SBX Mixin Kitként is csomagolva van, ezért Claude sandbox indításakor is alkalmazható az sbx run claude --kit . paranccsal.

A Docker a több futás kezelésére értékelési sorozatokat is bemutat. Ezek több értékelési definíciót fognak össze egyetlen, ismételhető munkafolyamatban. Minden értékelés saját strukturált eredményt hoz létre, a sorozat pedig összesített összefoglalót készít. Ez olyan helyzetekhez illeszkedik, amikor csapatok promptokat hasonlítanak össze, viselkedést ellenőriznek, kiadások közötti regressziókat mérnek vagy több forgatókönyvet tesztelnek.

Az SBX AI Evaluation Kit nem váltja ki az értékelési keretrendszereket, a referenciaértékeléseket vagy a pontozási rendszereket. Szűkebb feladatot lát el: a beállított értékelési munkafolyamatokat könnyebben újrafuttatható és ellenőrizhető módon hajtja végre. A Docker szerint ugyanilyen minta használható regresszióteszteléshez, szabályzat-ellenőrzéshez, biztonsági elemzéshez és kódgenerálási kísérletekhez is. A forráskód és a példakonfigurációk az SBX AI Evaluation Kit GitHub-tárházában érhetők el.

Kapcsolódó hírek

A Docker mikrogépekkel és szabványos csomagokkal védené az AI-ügynököket
Biztonság és etika2026. szeptember 24. 19:15

A Docker mikrogépekkel és szabványos csomagokkal védené az AI-ügynököket

A Docker új eszközökkel adna biztonságosabb keretet az önállóan dolgozó AI-ügynököknek. A vállalat a Sandboxes, a Kits és a felhős Sandboxes rendszerével az…

A Docker felhőbe költözteti az AI-ügynökök homokozóit
Termékek és eszközök2026. szeptember 24. 18:00

A Docker felhőbe költözteti az AI-ügynökök homokozóit

A Docker bemutatta a Cloud Sandboxes szolgáltatást, amelyben a kódoló AI-ügynökök a laptop mellett a Docker által kezelt felhős számítási kapacitáson is futhatnak. A…

Docker Sandboxban futtathatnak kódoló AI-ügynököket a GitHub Actionsben
Fejlesztőknek2026. augusztus 21. 15:00

Docker Sandboxban futtathatnak kódoló AI-ügynököket a GitHub Actionsben

A GitHub Agentic Workflows már támogatja a Docker Sandboxes futtatási környezetét, így a kódoló AI-ügynökök széles jogosultságokkal dolgozhatnak egy elkülönített…