Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az NVIDIA új eszközzel méri, mennyit javítanak a készségek az AI-ügynökökön

2026. augusztus 19.Forrás: NVIDIA Developer
Az NVIDIA új eszközzel méri, mennyit javítanak a készségek az AI-ügynökökön
Kép: NVIDIA Developer

Az NVIDIA Developer 2026. augusztus 19-én ismertette a SkillEvaluator nevű nyílt forráskódú eszköz első benchmarkeredményeit. A rendszer azt méri, hogyan változtatják meg az ellenőrzött készségek az AI-ügynökök teljesítményét.

A lényeg röviden
  • Az NVIDIA SkillEvaluator nyílt forráskódú eszköz az AI-ügynökök készségeinek mérésére.
  • Több mint 300 ellenőrzött készséget értékeltek több mint 30 NVIDIA-terméken.
  • Correctness esetében +41, Effectiveness esetében +39 pontos átlagos Skill Liftet mértek.
  • A Security baseline már 97 pont volt, készséggel 98 pontra emelkedett.
  • A tokenhasználatot és a futási időt külön követik, ami optimalizálási lehetőségeket jelezhet.

Mit mér a SkillEvaluator?

Az NVIDIA szerint az AI-ügynökök teljesítménye nagyban függ attól, milyen kontextust kapnak. A vállalat ezért készített egy nyílt értékelési réteget, amely azt vizsgálja, hogy az úgynevezett készségek hogyan befolyásolják az ügynökök útvonalát és kimenetét.

A SkillEvaluator nyílt forráskódú eszköz, amely statikus ellenőrzésekkel és valós feladatfuttatásokkal méri a készségek hatását. A vizsgálatokat úgy végzi, hogy az adott feladatot az ügynök lefuttatja a készség telepítésével és anélkül is, majd a két eredmény közti különbséget Skill Lift néven, pontokban jelenti.

Az NVIDIA verified Skills csomagolt, aláírt képességleírók. Ezek azt adják meg az ügynöknek, hogy egy NVIDIA-termék mire való, mikor kell használni, és hogyan kell meghívni. Az NVIDIA közlése szerint az ellenőrzött státuszhoz mérés kapcsolódik, ez dönti el, hogy a készség publikálásra kész-e.

A most ismertetett első benchmark több mint 300 ellenőrzött készséget vizsgált több mint 30 NVIDIA-terméken. Minden készséget két független ügynökkereten értékeltek. Az NVIDIA pluginokat tesz közzé Claude Code, Codex és Cursor számára, ugyanazok a készségek pedig Skills.sh, ClawHub és Hermes Hub felületen is elérhetők.

Háromszintű ellenőrzés és izolált futtatás

A készségek publikálás előtt három értékelési szinten mennek át. Az első szint a biztonságot és a szerkezetet vizsgálja: ide tartozik a séma- és frontmatter-ellenőrzés, a minőségpontozás, a prompt injection és adatkiszivárgás keresése, a titkok és személyes adatok felismerése, a licencellenőrzés és a szkriptek lintelése.

A második szint az elkülöníthetőséget méri. Ehhez beágyazásalapú hasonlóságvizsgálatot használ, hogy megtalálja az ismétlődő útmutatást egy készségen belül, illetve az átfedő lefedettséget a katalógusban.

A harmadik szint az élő értékelés. Itt az ügynök generált feladatokon dolgozik, egyszer a készséggel, egyszer anélkül, izolált sandboxban. A harmadik szinthez a Harbor nevű nyílt forráskódú keretrendszert használják, amely ismételhető, elkülönített környezetben futtat ügynökértékeléseket.

A forrás szerint minden összehasonlítás kontrollált: ugyanaz a prompt, modell, feladatbemenet és értékelési kritérium szerepel, az egyetlen kísérleti változó a készség telepítése. A SkillEvaluator a Harbor beállítását kezeli, a feladatokat futtatja, összegyűjti az eredményeket, majd kiszámítja a készség hatását.

Nagy javulás a helyességben és a hatékonyságban

Az NVIDIA a 2026. augusztus 12-i benchmarks.json pillanatképre hivatkozik, a 738d79e commitnál. Az eredmények makroátlagok a publikált készség és ügynökkeret párokon, vagyis minden pár azonos súlyt kapott. A katalógust folyamatosan értékelik, az aktuális számok a nvidia/skills tároló benchmarks.json fájljában érhetők el.

Készség nélkül az átlagos baseline pontszámok 39 és 46 között mozogtak a Correctness, Discoverability, Effectiveness és Efficiency dimenziókban. A Security eltért ettől, ott az átlagos baseline 97 pont volt. Az NVIDIA magyarázata szerint a Security esetében az elsődleges cél annak ellenőrzése volt, hogy egy készség telepítése nem okoz-e visszaesést.

A készségekkel mért átlagos eredmények jelentősen magasabbak voltak több kategóriában. Correctness esetében a pontszám 46-ról 87-re nőtt, ami +41 pontos Skill Lift. Effectiveness esetében 39-ről 78-ra emelkedett az átlag, ez +39 pont. Discoverability 42-ről 82-re változott, +40 ponttal, Efficiency pedig 43-ról 78-ra, +35 ponttal. Security esetében 97-ről 98-ra nőtt a pontszám, +1 pontos emelkedéssel.

Az összes dimenzió átlagában a Skill Lift +31 pont volt. A Security kizárásával az átlagos Skill Lift +39 pont. Az NVIDIA hangsúlyozza, hogy a Skill Lift pontokban értendő, nem százalékos változásként.

A forrás korlátokat is jelez. A legtöbb készséget feladatonként egy próbálkozással értékelték. A publikált eredménnyel rendelkező készségek 85 százaléka egy próbálkozással, 15 százaléka két próbálkozással futott. Az élő ügynökfuttatások eredménye futásonként változhat, a cikk pedig nem közöl konfidenciaintervallumokat.

Mit jelent ez a fejlesztőknek és a piacnak?

A SkillEvaluator célja, hogy a készségek hasznát mérhetővé tegye, nem X, hanem Y alapon: nem pusztán azt vizsgálja, hogy egy leírás formailag megfelel-e, hanem azt is, hogyan teljesít vele az ügynök valós feladatfuttatásban. Ez fontos lehet azoknak, akik ügynököket építenek NVIDIA-termékek köré, mert a rendszer külön méri a helyességet, a felfedezhetőséget, a feladatcél elérését, a hatékonyságot és a biztonságot.

A forrás szerint a tokenhasználatot és a futási időt külön követik. Példaként az NVIDIA azt írja, hogy a jetson-optimize-memory készség 76,9 százalékkal csökkentette a tokeneket, míg a cuopt-install 120,3 százalékkal növelte azokat. Ez azt mutatja, hogy a készségek nemcsak javulást hozhatnak, hanem optimalizálási feladatokat is felszínre hozhatnak.

Az NVIDIA partnerpilótákat is említ: az OpenClaw a ClawHubon, a Nous Research pedig a Hermes Agentben integrálja a SkillEvaluator értékelést, illetve a telepítés előtti biztonsági vizsgálatot. A vállalat a SkillEvaluator dokumentációját ajánlja azoknak, akik el akarják kezdeni az ügynökkészségek értékelését, valamint az NVIDIA verified skills katalógust a meglévő készségek áttekintéséhez.

Kapcsolódó hírek

Az Arize AX MCP-szervert indított, de a CLI-t és a skilleket is megtartja
Fejlesztőknek2026. október 2.

Az Arize AX MCP-szervert indított, de a CLI-t és a skilleket is megtartja

Az Arize AI hosztolt MCP-szervert indított az Arize AX platformhoz, amely Claude Code, Cursor és Claude Desktop alatt teszi elérhetővé az AX műveleteit. A vállalat…

A VAST Data szerint új fejlesztői réteg formálja az AI alkalmazásokat
Fejlesztőknek2026. október 2.

A VAST Data szerint új fejlesztői réteg formálja az AI alkalmazásokat

A VAST Data szerint az AI alkalmazások fejlesztése új technikai felületeket hoz a mindennapi munkába. A vállalat CAMP néven foglalja össze a kódoló ügynököket, az…

A VAST Data szerint új fejlesztői verem formálódik az AI körül
Fejlesztőknek2026. október 2.

A VAST Data szerint új fejlesztői verem formálódik az AI körül

A VAST Data szerint az AI-alkalmazások fejlesztése új alapokra helyezi a fejlesztői verem működését. A vállalat CAMP néven foglalja össze a négy meghatározó területet: a…