benchmark

Vezetőnek nevezte az SAP Order Management Services szolgáltatását az IDC
Vezetőként értékelte az IDC az SAP Order Management Services szolgáltatását a kiskereskedelmi és B2C-szektor AI-alapú rendeléskoordinációs és teljesítési alkalmazásainak…
ModellekAz OpenAI szerint a GPT-5.6 olcsóbbá teszi az ügynökök építését
Az OpenAI 2026. augusztus 13-án közzétette a GPT-5.6 fejlesztői útmutatóját, amely az új modellcsalád ár és teljesítmény arányára, valamint az ügynökös alkalmazások…
Cégek és üzletTöbbszörösére nőtt több frontier AI-modell kockázati indexe
Többszörösére emelkedett a vizsgált frontier AI-modellek kockázati indexe egy év alatt, és több modell átlépte a Concordia AI által meghatározott képességküszöböt. A…

A Qdrant és a Minima 2,92-szer több sikeres RAG-feladatot ért el
A Qdrant és a Minima közös tesztjében 2,92-szeresére nőtt a sikeres, ügynökalapú RAG-feladatok száma GPU-óránként. A rendszer a keresést és a Qwen3.6-27B futtatását is…

A MindTopo azt méri, értik-e a multimodális modellek a térbeli kapcsolatokat
A Microsoft Research 2026. augusztus 12-én bemutatta a MindTopo nevű benchmarkot, amely a multimodális nagy nyelvi modellek topológiai térértését vizsgálja. A kutatás…

A Google szerint a csúcsmodellek sok tényt tárolnak, de nem mindig hívják elő
A Google Research 2026. augusztus 12-én bemutatott kutatása szerint a fejlett nagy nyelvi modellek ténybeli hibáinak jelentős része nem abból ered, hogy a modellek nem…

Az OpenRouter élő tesztjei megmutatják, melyik webes keresés éri meg
Az OpenRouter új, folyamatosan frissülő benchmarkoldalakon vizsgálja, hogyan teljesítenek a különböző modellek, keresőmotorok és keresési beállítások élő webes…

A 95 százalékos LIBERO-eredmény nem feltétlenül jelent működő robotot
A Vision-Language-Action modellek LIBERO-benchmarkon elért 95 százalékos sikerrátája a valós robotikai környezetben könnyen összeomolhat. A HumanSignal elemzése szerint…

Ingyen elérhető a Cline-ban az NVIDIA Nemotron 3.5 Lightning
Az NVIDIA Nemotron 3.5 Lightning modellje megjelent a Cline-ban, ahol ingyenesen használható. A 30 milliárd paraméteres, nyílt és testre szabható modell az ismétlődő…

Gyorsabb és olcsóbb kódolómodellt tett élesbe a Microsoft a Copilotban
A Microsoft 2026. augusztus 11-én jelentette be az MAI-Code-1.1-Flash modellt, amely már élesben fut a GitHub Copilotban. A cég szerint az új kódolómodell jobb minőségű…

Az NVIDIA új nyílt modellel és útválasztóval gyorsítaná az ügynökös AI-t
Az NVIDIA 2026. augusztus 11-én bejelentette a Nemotron 3.5 Lightning modellt és a NeMo Switchyard nyílt forrású könyvtárat. A vállalat szerint az újdonságok a hosszú…

NVIDIA NeMo Switchyard: modellválasztó réteg AI-ügynökökhöz
Az NVIDIA Developer 2026. augusztus 11-én ismertette a NeMo Switchyard működését, amely AI-ügynökök feladatait irányítja különböző specializált és frontier modellek…

A CodeRabbit olcsóbban és pontosabban tanította be az NVIDIA modelljét
A CodeRabbit az NVIDIA Nemotron 3.5 Lightning modellt tanította be a kódellenőrzések útválasztására. A modell az utótréning után pontosabban követte a vállalat…

A több számítás jelentősen javítja a Weaviate keresési pontosságát
A Weaviate új effort paramétere szabályozhatóvá teszi, mennyi számítási kapacitást fordítson a Query Agent egy keresésre. A vállalat tesztjeiben az ultrahigh szint a…

A Vercel szerint már elérhetők az önálló támadást kutató AI-modellek
A Vercel szerint az AI-modellek kiberbiztonsági képességei gyorsan fejlődnek, és már ma is elérhetők olyan nyílt súlyú modellek, amelyek támadási lehetőségeket kutatnak.…

A MAI-Image-2.6 a második helyre került az Arena ranglistáján
A MAI-Image-2.6 a második helyen végzett az Arena szövegből képet készítő ranglistáján, a Microsoft közlése szerint megelőzve a Meta, a Google és az xAI vezető…

A forking-sequences módszer stabilabb előrejelzéseket ígér
A forking-sequences architektúrára épülő előrejelzés-ensemble körülbelül 10 százalékkal csökkentette a volatilitást, miközben a pontosság romlása 0,1 százalék alatt…

Új előrejelzési módszer csökkentheti a tanítás költségét
A forking-sequences nevű tanítási módszer egyetlen előrehaladási lépésben dolgozza fel az idősor teljes előrejelzési szerkezetét. A Carnegie Mellon University kutatói…

A mesterséges intelligencia jobban olvas, mint hallgat, állítja egy USC-kutatás
A hangalapú mesterséges intelligencia jól átírja, amit mondunk, de gyakran félreérti, hogyan mondjuk. A USC kutatói szerint az audio nagy nyelvi modellek a szöveget…
Termékek és eszközökA Model ML több pénzügyi munkát bíz GPT-5.6 Solra
Az OpenAI 2026. augusztus 10-én közölte, hogy a Model ML pénzügyi munkafolyamataiban bővíti a GPT-5.6 Sol használatát. A cég saját mérései szerint a modell több esetben…

Olcsóbb modellek változtatják meg az AI-ügynökök felépítését
Az olcsóbb modellek fejlődése újra előtérbe hozta az orchestrator-executor, vagyis irányító és végrehajtó ügynökökre épülő architektúrát. Az Arize AI szerint egy erős…

A Qdrant szerint a vektorkeresés szűrését menet közben kell kezelni
A metaadatszűrés a vektorkeresésben jelentősen ronthatja a találatok minőségét, miközben a lekérdezés gyorsnak és hibátlannak tűnik. A Qdrant ezért nem egyszerűen elő-…

A Roboflow szerint a Qwen3.8-Max vezeti a vizuális teszteket
A Qwen3.8-Max a Roboflow tesztjeiben a legerősebb vizuális nyelvi modellnek bizonyult objektumfelismerésben. A 2,4 billió paraméteres modell már elérhető az Alibaba…

A DeepSeek olcsóbban hoz jobb eredményt a GPT-5.6 Lunánál, ha együtt használják
A GPT-5.6 Luna minden vizsgált minőségi mutatóban megelőzte a DeepSeek-V4 Flash 0731 modellt, az olcsóbb modellre épülő kétlépcsős rendszer mégis pontosabb és olcsóbb…