Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Open Jarvis helyi modellekből épít megbízható AI-ügynököket

2026. szeptember 30. 16:49Forrás: Lambda
Az Open Jarvis helyi modellekből épít megbízható AI-ügynököket
Kép: Lambda

A Lambda bemutatta az Open Jarvist, amely a helyben futó nyelvi modellekhez igazítja az AI-ügynökök működési keretét. A vállalat szerint a megfelelően hangolt rendszerrel egy 9 milliárd paraméteres modell a PinchBenchen 62,3 százalékról 88,4 százalékra javult.

A lényeg röviden
  • Az Open Jarvis a helyi modellekhez igazítja az AI-ügynökök működési keretét.
  • A Qwen3.5-9B PinchBench-eredménye 62,3 százalékról 88,4 százalékra javult.
  • A rendszer öt külön kezelt elemmel dolgozik, köztük a modellel, a futtatókörnyezettel és az eszközökkel.
  • A Lambda szerint a Qwen3.5-122B átlagosan 3,2 százalékponton belül maradt a Claude Opus 4.6-hoz képest.
  • A vállalat Kimi K2.6-tal feladatonként 2,07 dolláros becsült költséget mért, szemben a Claude 3,14 dollárjával.

A helyi modell önmagában kevés

A Lambda szeptember 30-án közzétett bemutatója szerint egy nyílt súlyú modell futtatása csak az egyik része a helyi AI-rendszer kiépítésének. Legalább ilyen fontos az úgynevezett harness, vagyis az a működési keret, amely meghatározza, mit tegyen a modell, milyen eszközöket használhat, és hogyan tanulhat a hibáiból.

Ha egy felhőben futó modellhez kialakított ügynöki rendszert változtatás nélkül helyi modellre állítanak át, a teljesítmény visszaeshet. A Lambda példája szerint az OpenClaw ügynökök nyelvi modellkénti teljesítményét mérő PinchBenchen Claude Opus 4.6-tal 96,0 százalékos pontosságot mértek, míg a Qwen3.5-9B 62,3 százalékot ért el. Az Open Jarvis a helyi modellhez igazított működési kerettel ezt 88,4 százalékra emelte. A cég szerint ezzel a hangolás önmagában a különbség 77 százalékát zárta be.

Öt külön kezelt építőelem

Az Open Jarvis minden modellhez és az azt futtató géphez egyedi specifikációt használ. Ennek öt, egymástól külön konfigurálható eleme van. Az Intelligence határozza meg a modellt, a kvantálást és a generálási beállításokat. Az Engine a következtetési futtatókörnyezetet és a hardverbeállításokat kezeli, például az Ollama, a vLLM vagy a llama.cpp használatát.

Az Agent Logic tartalmazza a gondolkodási ciklust, a rendszerszintű utasításokat, a példákat és az eszközhasználat stratégiáját. A Tools & Memory rész szabályozza többek között a webes keresést, a kódvégrehajtást, a naptár- és e-mail-hozzáférést, a fájlkezelést, valamint a munkamenetek közötti tartós memóriát. Az ötödik elem a Learning, amely LoRA-finomhangolással, promptoptimalizálással vagy automatikus specifikációkereséssel javíthatja a rendszert.

A specifikációkeresés során egy élvonalbeli felhőmodell diagnosztizálja a telepített rendszer hibáit, majd módosításokat javasol az Intelligence, az Engine, az Agent, valamint a Tools & Memory területein. A rendszer csak olyan változtatást fogad el, amely javítja a teljesítményt anélkül, hogy máshol visszaesést okozna.

A Lambda szerint a hangolás zárhatja a felhő és a helyi AI közötti rést

A Lambda kísérlete alapján a specifikáció öt elemének szétválasztásával a helyi modellek a személyes AI legtöbb vizsgált tesztjén elérhetik a felhőmodellek pontosságát. A vállalat körülbelül 800-szor alacsonyabb lekérdezésenkénti költséget és négyszer kisebb késleltetést említ helyi, személyes eszközökön. A legjobb egyetlen helyi modellként bemutatott Qwen3.5-122B átlagosan 3,2 százalékponton belül maradt a Claude Opus 4.6-hoz képest nyolc benchmarkon.

A Lambda saját infrastruktúráján egy NVIDIA HGX B200 csomóponton a Kimi K2.6 egyszerre 32 felhasználót tud kiszolgálni, összesen körülbelül 1286 kimeneti tokennel másodpercenként, felhasználónként nagyjából 40 tokennel. Ez napi 121,7 millió tokent jelent egy rendszeren.

A 75 közös PinchBench-feladaton a Claude Fable 5.1 átlagos pontszáma 0,8216, a Kimi K2.6-é 0,7301 volt. A Lambda becslése szerint a Kimi futtatása 155,19 dollárba, feladatonként 2,07 dollárba került, szemben a Claude API 235,48 dolláros, illetve 3,14 dolláros költségével. Ez körülbelül 34 százalékos különbség. A cég szerint ahol a Kimi minősége megfelel az alkalmazás követelményeinek, az önálló üzemeltetés alacsonyabb becsült következtetési költséget és nagyobb kontrollt adhat a modell, valamint a kiszolgálási környezet felett.

A Lambda az OpenJarvis forráskódjára építést és a fejlesztői közreműködést is ösztönzi. A projekt GitHubról klónozható, majd az uv sync --extra server, a jarvis init és a jarvis doctor parancsokkal állítható be.

Kapcsolódó hírek

Az Open Jarvis helyi modelleket alakít megbízható AI-ügynökké
Fejlesztőknek2026. szeptember 30. 16:49

Az Open Jarvis helyi modelleket alakít megbízható AI-ügynökké

A Lambda bemutatta az Open Jarvist, egy nyílt forrású keretrendszert, amely a helyi nagy nyelvi modellekhez igazítja az AI-ügynökök működését. A vállalat szerint a…

Az agent harnesses nem tűnnek el, de gyorsabban kell fejlődniük
Kutatás2026. szeptember 29. 18:08

Az agent harnesses nem tűnnek el, de gyorsabban kell fejlődniük

Egy új kutatás szerint az agent harnesses, vagyis az ügynöki rendszereket eszközökkel, szabályokkal és memóriával támogató rétegek bizonyos részei betaníthatók magába a…

A modellek átvehetik az ügynöki keretek egy részét
Kutatás2026. szeptember 29. 18:08

A modellek átvehetik az ügynöki keretek egy részét

Egy új kutatás szerint az ügynöki keretek, vagyis a modelleket eszközökkel és szabályokkal segítő rendszerek egyes részei közvetlenül betaníthatók a modellbe. A keretek…