Az Open Jarvis helyi modelleket alakít megbízható AI-ügynökké

A Lambda bemutatta az Open Jarvist, egy nyílt forrású keretrendszert, amely a helyi nagy nyelvi modellekhez igazítja az AI-ügynökök működését. A vállalat szerint a megfelelően hangolt rendszer jelentősen csökkentheti a felhős modellekhez képest fennálló teljesítménykülönbséget.
- Az Open Jarvis a helyi modellekhez igazítja az AI-ügynök keretrendszerét.
- A PinchBench eredménye Qwen3.5-9B esetében 62,3 százalékról 88,4 százalékra javult.
- A rendszer öt konfigurálható elemet kezel, köztük a modellt, az ügynöklogikát és az eszközöket.
- A Lambda szerint a helyi futtatás akár 800-szor alacsonyabb lekérdezési költséget adhat.
- A Kimi K2.6 becsült költsége 2,07 dollár volt feladatonként, szemben a Claude 3,14 dollárjával.
A modell önmagában nem elég
A Lambda szeptember 30-án ismertetett megoldása abból indul ki, hogy egy nyílt súlyú modell futtatása csak az első lépés. Az ügynöki rendszer működését az úgynevezett harness, vagyis a modellt irányító keretrendszer határozza meg. Ez mondja meg, milyen feladatot kell végrehajtani, milyen eszközöket használhat a modell, és hogyan tanulhat a hibáiból.
A cég szerint a felhős modellekhez beállított keretrendszer gyengébb eredményeket adhat, ha egy helyi, kisebb modellel használják. A PinchBench mérésében, amely azt vizsgálja, hogyan teljesít egy nyelvi modell az OpenClaw ügynökök agyaként, a Claude Opus 4.6 pontossága 96,0 százalék volt. Ugyanez Qwen3.5-9B modellel 62,3 százalékra esett vissza. Az Open Jarvis modellhez igazított specifikációjával az eredmény 88,4 százalékra javult, ami a Lambda szerint a különbség 77 százalékának ledolgozását jelenti.
Öt különálló elemre épül a rendszer
Az Open Jarvis minden modellhez és az azt futtató géphez külön specifikációt hoz létre. Ennek öt, egymástól függetlenül konfigurálható eleme van. Az Intelligence határozza meg a használt modellt, annak kvantálását és generálási beállításait. Az Engine a következtetési környezetet és a hardverbeállításokat kezeli, például az Ollama, a vLLM vagy a llama.cpp használatát.
Az Agent Logic tartalmazza a gondolkodási ciklust, a rendszerutasításokat, a példákat és az eszközhasználat stratégiáját. A Tools & Memory elem szabályozza többek között a webes keresést, a kódvégrehajtást, a naptár- és e-mail-hozzáférést, a fájlkezelést, valamint a munkamenetek közötti tartós memóriát. Az ötödik elem a Learning, amely LoRA-finomszabással, promptoptimalizálással vagy automatikus specifikációkereséssel javíthatja a rendszert.
Az Open Jarvis specifikációkeresése egy frontier felhős modellt használ a hibák elemzésére és a módosítások javaslatára. A rendszer csak azokat a változtatásokat fogadja el, amelyek javítják a teljesítményt, és közben nem okoznak visszaesést más területeken.
A Lambda szerint a helyi futtatás költségelőnyt adhat
A Lambda kísérlete szerint a helyi modellek a személyes AI-alkalmazások benchmarkjainak többségében megközelíthetik a felhős modellek pontosságát. A vállalat nagyjából 800-szor alacsonyabb lekérdezésenkénti költséget és négyszer kisebb késleltetést említ helyi, személyes eszközökön. A nyolc benchmark átlagában a Qwen3.5-122B 3,2 százalékponton belül maradt a Claude Opus 4.6-hoz képest.
A Lambda egy NVIDIA HGX B200 rendszeren is bemutatta a megközelítést. Állítása szerint a Kimi K2.6 egyszerre 32 felhasználót tud kiszolgálni, összesen körülbelül 1286 kimeneti token/másodperc, felhasználónként nagyjából 40 token/másodperc sebességgel. Egy 75 feladatos PinchBench összevetésben a Claude Fable 5.1 átlagos pontszáma 0,8216, a Kimi K2.6-é 0,7301 volt. A Lambda számítása szerint a Kimi költsége feladatonként 2,07 dollár, a Claude API-jáé 3,14 dollár, ami körülbelül 34 százalékos különbség.
A fejlesztők az OpenJarvis GitHub-projektjére építhetnek. A Lambda szerint egy egyszeri, felhős tanármodellel végzett specifikációkeresés nagyjából 15 dollárba kerülhet, így a felhő használata a keretrendszer javítására korlátozható, miközben a lekérdezések helyben futnak.
Lambda: Open Jarvis: making local LLMs work as agents


