Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az MLPerfben először mértek adatközponti AI-ügynököt

2026. szeptember 16.Forrás: Lambda
Az MLPerfben először mértek adatközponti AI-ügynököt
Kép: Lambda

Az MLPerf Inference v6.1 mérésében először szerepelt adatközponti hardveren futtatott ügynöki terhelés, a Lambda pedig egy ezermilliárdnál több paraméteres modellt indított el. A vállalat eredményei szerint azonos hardveren 8,85 százalékkal javult a Server, és 8,79 százalékkal az Offline átviteli teljesítmény a v6.0-hoz képest.

A lényeg röviden
  • Az MLPerf v6.1-ben először futott adatközponti hardveren ügynöki terhelés.
  • A Lambda Kimi K2.6 modellt használt, több mint ezermilliárd paraméterrel.
  • A Qwen3-VL mérésben az NVIDIA HGX B200 Offline eredménye 101,56 lekérdezés per másodperc lett.
  • A GPT-OSS 120B Offline eredmény 65 511 token per másodperc volt.
  • Azonos hardveren 8,85 százalékkal javult a Server eredmény a v6.0-hoz képest.

VLM-ekkel bővült az MLPerf mérése

A Lambda szeptember 16-i beszámolója szerint az MLPerf Inference v6.1 fordulójában először küldött be eredményt látás és nyelv feldolgozására képes modellre, vagyis VLM-re. A Qwen3-VL-235B-A22B-Instruct modellt NVIDIA HGX B200, valamint négy NVIDIA Blackwell Ultra GPU rendszerén tesztelték.

Az NVIDIA HGX B200 konfigurációban a Lambda volt az egyetlen ilyen beadó. A vállalat 101,56 lekérdezés per másodperces Offline eredményt közölt, amely 28,5 százalékkal haladta meg az előző forduló legjobb, 79,04 lekérdezés per másodperces értékét. A Server eredmény 69,41 lekérdezés per másodperc lett, ez 2,29 százalékkal múlta felül a korábbi 67,86-os legjobb eredményt.

A négy NVIDIA Blackwell Ultra GPU-val végzett mérésben a Server eredmény 64,624, az Offline eredmény 71,122 lekérdezés per másodperc volt. A Lambda Serverben a négy beadás közül a második helyet érte el, Offline módban pedig 2,9 százalékon belül maradt a vezető eredménytől. A vállalat ezt olyan terhelés példájaként mutatja be, amely alacsony késleltetésű, multimodális következtetéshez használható, például szintetikus adatok előállítására és fizikai AI alkalmazásokhoz.

Ezermilliárd paraméteres modell az ügynöki tesztben

Az MLPerf Inference v6.1 új Edge Agentic mérésében azt vizsgálják, hogy az ügynöki nyelvi modellek milyen pontossággal és sebességgel hívnak meg eszközöket. A teszt a Berkeley Function Calling Leaderboard v4, vagyis BFCL v4 pontossági mérését, valamint egy 20 pályát tartalmazó, rögzített ügynöki kódolási visszajátszást kapcsol össze.

A referencia-konfiguráció Qwen3.6-27B modellt futtat egyetlen peremgyorsítón. A Lambda ugyanezt a munkafolyamatot NVIDIA HGX B200 rendszeren futtatta, a modellt azonban a Moonshot AI Kimi K2.6 modelljére cserélte. A vállalat szerint ez egy több mint ezermilliárd paraméteres, mixture-of-experts modell, amelyet FP8 pontossággal és SGLang használatával, TP=8 beállításban szolgáltak ki.

A futás során 1007 fordulót indítottak és teljesítettek hibamentesen. A BFCL v4 pontosság 86,83 százalék, az átlagos fordulónkénti késleltetés 770,8 ezredmásodperc, a medián 361,0 ezredmásodperc lett. Az első tokenig eltelt idő átlagosan 179,7 ezredmásodperc volt, a P99 érték pedig 196,7 ezredmásodperc. A fordulók közül 1003 eszközhívással fejeződött be.

A Lambda hangsúlyozza, hogy ez nem közvetlenül összevethető a többi beadással, mivel azok peremhardveren futtatott, 27 milliárd paraméteres modellek voltak, míg a vállalat nyílt kategóriás tesztje adatközponti rendszeren, jóval nagyobb modellel zajlott.

Gyorsult a GPT-OSS 120B következtetése

A négy NVIDIA Blackwell Ultra GPU-s rendszer GPT-OSS 120B modellen 65 511 token per másodperces Offline, és 58 195 token per másodperces Server eredményt ért el. A Lambda szerint az Offline érték vezette az összes, négy Blackwell Ultra GPU-s beadást, és 2,38 százalékkal előzte meg a második helyezettet.

Azonos hardveren, az MLPerf előző fordulójához viszonyítva a Server áteresztőképesség 8,85, az Offline érték 8,79 százalékkal javult. A Lambda ezt az elmúlt hat hónap szoftveres optimalizációinak tulajdonítja. A vállalat által felsorolt fejlesztések között szerepel a műveletek Triton kernelekbe fűzése a torch.compile segítségével, valamint több CUDA Graph konfiguráció használata a különböző tokenalakokhoz és kötegméretekhez.

Az eredmények a felhasználóknak elsősorban azt mutatják meg, hogy a multimodális és ügynöki következtetés teljesítménye nem kizárólag a GPU-k számától függ. A Lambda beszámolója szerint a modellkiszolgáló szoftver, a pontossági beállítások és az adott munkafolyamathoz hangolt konfiguráció is mérhető különbséget eredményezhet.

Kapcsolódó hírek

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt
Chipek és infrastruktúra2026. szeptember 29.

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt

A Red Hat az MLPerf Inference v6.1 tesztjeiben magas teljesítményt ért el Kubernetes-alapú GPU-s rendszereken, miközben CPU-only konfigurációkon is erős eredményeket…

A Red Hat szerint a Kubernetes és a CPU-k is jól teljesítettek az MLPerfben
Chipek és infrastruktúra2026. szeptember 29.

A Red Hat szerint a Kubernetes és a CPU-k is jól teljesítettek az MLPerfben

A Red Hat közzétette az MLPerf Inference v6.1 benchmarkban elért eredményeit. A vállalat szerint az OpenShift és a vLLM Kubernetes-alapú környezetben is versenyképes…

AI-ügynök értékeli, mennyire jól szerkesztenek képeket az új modellek
Kutatás2026. szeptember 17.

AI-ügynök értékeli, mennyire jól szerkesztenek képeket az új modellek

A Lambda, a Texasi Egyetem austini kampuszával, a UCLA-val és a Microsofttal közösen, EdiVal-Agent néven olyan keretrendszert fejlesztett, amely AI-ügynökkel értékeli a…