Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

AI hírek 08.21.: ügynökök, modellek és az AI jövője

2026. augusztus 21. 21:00
AI hírek 08.21.: ügynökök, modellek és az AI jövője
Kép: AI Hírek

A nap hírei az AI-rendszerek teljesítményének és megbízhatóságának javítására koncentráltak. Az Alibaba nagyszabású technológiai víziót vázolt, miközben az NVIDIA, a vLLM és több kutatócsoport az ügynökök, a modellek és a mérési módszerek fejlesztésén dolgozott.

A lényeg röviden
  • Az Alibaba modellekből, chipekből és felhőből építene AI-alapot.
  • Az NVIDIA AVO 100.00 RHAE pontszámot ért el az ARC-AGI-3 teszten.
  • A GLM-5.3 több próbálkozással olcsóbban teljesített a DeepSWE feladatain.
  • Új benchmarkok mérik a folyamatos tanulást és az üzleti AI-ügynököket.
  • Erősödik az AI kognitív, pénzügyi és ügynökbiztonsági szabályozása.

Nagyobb modellek, pontosabb végrehajtás

Az Alibaba szerint a gépi intelligencia az emberi gondolkodás ezerszeresét is adhatja. A vállalat ehhez AI-modellekből, chipekből és felhőinfrastruktúrából álló teljes technológiai alapot építene ki.

A vLLM bemutatta az IsoExecet, a SkyRL egységes végrehajtási absztrakcióját. A cél, hogy a megerősítéses tanulás tréning- és következtetési motorjai ugyanazt a numerikus végrehajtást használják, csökkentve az eltéréseket és kiszámíthatóbbá téve az on-policy folyamatokat.

Az NVIDIA közlése szerint az AVO kutatási projekt 100.00 RHAE pontszámot ért el az ARC-AGI-3 nyilvános tesztjén. A vállalat ezt a hosszú távú autonóm teljesítmény szempontjából fontos eredményként mutatta be.

Modellek és fejlesztői eszközök

A Vercel AI Gateway-en megjelent a DeepSeek V4 Flash Vision Experimental, amely képleírásra, képernyőképeken lévő szöveg kiolvasására és diagramok értelmezésére is használható. Közben féláron érhető el a GPT-5.6 Sol, a bemeneti tokenek díja 20 százalékkal, a kimenetieké egyharmaddal csökkent.

A DeepSWE tesztjeiben a GLM-5.3 és a GPT-5.6 Sol együtt adta a legjobb eredményt: a GLM-5.3 több próbálkozással és alacsonyabb költséggel előnybe került, a két modell kombinációja pedig 85,9 százalékot ért el. Egy másik mérés szerint a GLM-5.3 5,4-szer olcsóbb volt a Claude Fable 5-nél.

A Hugging Face a beszédfelismerési benchmarkok optimalizálásának mérését vizsgálta. Az OpenRouter pedig 39 képgeneráló modellt hasonlított össze ár és generálási idő szerint is.

Kutatás, benchmarkok és ügynökbiztonság

Az Anthropic kutatása szerint a nyelvi modellek nyers súlyainak nagysága önmagában félrevezető lehet, mert az interferencia súlyok zavarhatják az értelmezést. Az Ai2 és a Georgia Tech kutatói nyílt eszközökkel az Olmo 3 társas következtetésének eredetét követték vissza, míg a Continual Learning Bench az AI-rendszerek tapasztalatból való tanulását méri.

A Google DeepMind játékokra épülő prototípusokkal, köztük az EVE Online világával kutatja a játékos AI-ügynököket. Az NVIDIA szerint a biztonsági kontrollok határát a futtatókörnyezetnél kell meghúzni, a GitHub Actions pedig már Docker Sandboxban futtat kódoló ügynököket. Az Amazon SOP-Bench benchmarkja több mint 2000 üzleti feladaton teszteli ezeket a rendszereket.

Szabályozás, infrastruktúra és alkalmazások

Az EU-ban a gyermekek online védelmétől a kognitív integritás általános védelméig terjedő szabályozási javaslat körvonalazódik. Az amerikai államok chatbotokra és AI-kockázatokra szabnának új szabályokat, a CDT pedig szigorúbb pénzügyi AI-ellenőrzést sürget.

Az ITU-T jóváhagyta az AI-korszak energiatakarékos hálózati keretrendszerének nemzetközi szabványát. A Google mobilitási adatokkal javítaná a helyismeretet, a Midjourney újabb alpha-javításokat adott ki, a Google Research pedig viselhető szenzorokból keres biomarkereket. A nap további hírei között szerepelt a DeepSeek időfüggő API-árazása, az SAP-átállások agentikus támogatása, az NVIDIA pénzügyi klaszterezési megoldása, a Palo Alto Networks Anthropic-alapú védelme és a Berkeley izomkímélő fogyókúrás vegyülete.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

AI hírek 10.03.: nyílt modellek, humanoid robot és szigorodó jogi AI szabályok
Összefoglalók2026. október 3. 21:00

AI hírek 10.03.: nyílt modellek, humanoid robot és szigorodó jogi AI szabályok

A nap két kiemelt fejleménye a nyílt mesterséges intelligencia és a robotika területéről érkezett. Az Aleph Alpha bemutatta Kolibri modelljét, a RoboParty pedig nyílt…

AI hírek 10.02.: GPT-6, Blackwell és az AI-infrastruktúra gyorsulása
Összefoglalók2026. október 2. 21:00

AI hírek 10.02.: GPT-6, Blackwell és az AI-infrastruktúra gyorsulása

Az OpenAI GPT-6 Astra Ultrafast módja NVIDIA Blackwell GPU-kon vált elérhetővé, miközben a vállalat útmutatót is kiadott a GPT-6 modellek használatához. A nap hírei az…

AI hírek 10.01.: új szabályok, ügynökinfrastruktúra és modellek
Összefoglalók2026. október 1. 21:00

AI hírek 10.01.: új szabályok, ügynökinfrastruktúra és modellek

Kalifornia több új törvénnyel és végrehajtási rendelettel szabályozza a munkahelyi, egészségügyi és digitális megtévesztési célú AI-rendszereket. Közben az AI-ügynökök…