A Vercel Sandboxban is futtathatók a Harbor értékelései

A Vercel Sandbox támogatja a Harbor nyílt forráskódú értékelési keretrendszerét, így a Terminal-Bench és több más benchmark is futtatható a Vercel infrastruktúráján. Az egyes próbák elkülönített Firecracker mikrogépeken indulnak, párhuzamos futtatással.
- A Vercel Sandbox támogatja a Harbor értékeléseit.
- A Harbor mögött működik a Terminal-Bench, és a regiszterben a SWE-bench, a tau3-bench és az OSWorld is szerepel.
- Minden próba elkülönített Firecracker mikrogépen fut.
- A hálózati házirendeket a Sandbox tűzfala érvényesíti.
- A használathoz legalább Harbor 0.22.0 szükséges.
A Harbor értékelései a Vercel Sandboxban
A Vercel szeptember 17-én jelentette be, hogy a Harbor értékelései (evals) futtathatók a Vercel Sandboxban. A Harbor nyílt forráskódú keretrendszer a Terminal-Bench mögött, a hozzá tartozó regiszterben pedig több más benchmark is megtalálható, köztük a SWE-bench, a tau3-bench és az OSWorld.
A futtatáshoz a harbor run parancsnál a --env vercel kapcsolót kell megadni. Ilyenkor minden próba saját, elkülönített Firecracker mikrogépen fut. A Vercel szerint ez lehetővé teszi a párhuzamos futtatást olyan mértékben, amelyre egy helyi számítógép önmagában nem feltétlenül képes.
A hálózati hozzáférést a Sandbox tűzfala kezeli
A feladat hálózati házirendjét a Sandbox tűzfala érvényesíti, a virtuális gépen kívül. Ez azt jelenti, hogy a hálózati szabályok kezelése a mikrogépen kívüli tűzfalrétegben történik.
A rendszer opcionális hitelesítőadat-injektálást is támogat. Ennek segítségével a titkok a tűzfalon, a megfelelő kimenő kérésekhez kapcsolódnak, így a Vercel leírása szerint soha nem kerülnek be a Sandboxba.
A megoldás az AI Gateway-jel is összekapcsolható. Egyetlen AI_GATEWAY_API_KEY használatával több szolgáltató több száz modellje érhető el. Ha egy másik modellen kell lefuttatni ugyanazt a benchmarkot, a parancsban elegendő a --model értékét módosítani.
Példa a Terminal-Bench futtatására
A Vercel példája szerint először a Harbor Vercel-támogatását kell telepíteni az uv tool install 'harbor[vercel]' paranccsal. Ezután meg kell adni a VERCEL_TOKEN és az AI_GATEWAY_API_KEY környezeti változókat.
A Terminal-Bench 2.1 futtatására a bemutatott parancs a harbor run -d terminal-bench/terminal-bench-2-1 --agent fx --model vercel_ai_gateway/anthropic/claude-fable-5 --env vercel --n-concurrent 8. A --n-concurrent 8 beállítás nyolc egyidejű futtatást kér.
Ugyanez a benchmark a példában egy OpenAI-modellen is lefuttatható, ha a --model értéke vercel_ai_gateway/openai/gpt-5.6-luna lesz. A használathoz a Harbor legalább 0.22.0-s verziója szükséges. A Vercel külön lépésről lépésre követhető útmutatót kínál a beállításhoz, a konfigurációhoz és a hibakereséshez, további részleteket pedig a Sandbox dokumentációja tartalmaz.
Mit jelent ez a benchmarkok futtatóinak?
A bejelentés a Harborral dolgozó fejlesztőknek és kutatóknak ad lehetőséget arra, hogy a Terminal-Bench mellett a Harbor regiszterében szereplő további értékeléseket is Vercel Sandbox-környezetben futtassák. A próbák elkülönített Firecracker mikrogépeken indulhatnak, a hálózati házirendeket pedig a Sandbox tűzfala kezeli.
Az AI Gateway támogatásával ugyanazon benchmark modellje a parancs módosításával cserélhető. Így a forrásban bemutatott megközelítés egyetlen kulccsal több szolgáltató modelljeinek összehasonlító futtatását teszi lehetővé, miközben a párhuzamos futtatást a --n-concurrent beállítás szabályozza.


