AI hírek 08.21.: ügynökök, modellek és az AI jövője

A nap hírei az AI-rendszerek teljesítményének és megbízhatóságának javítására koncentráltak. Az Alibaba nagyszabású technológiai víziót vázolt, miközben az NVIDIA, a vLLM és több kutatócsoport az ügynökök, a modellek és a mérési módszerek fejlesztésén dolgozott.
- Az Alibaba modellekből, chipekből és felhőből építene AI-alapot.
- Az NVIDIA AVO 100.00 RHAE pontszámot ért el az ARC-AGI-3 teszten.
- A GLM-5.3 több próbálkozással olcsóbban teljesített a DeepSWE feladatain.
- Új benchmarkok mérik a folyamatos tanulást és az üzleti AI-ügynököket.
- Erősödik az AI kognitív, pénzügyi és ügynökbiztonsági szabályozása.
Nagyobb modellek, pontosabb végrehajtás
Az Alibaba szerint a gépi intelligencia az emberi gondolkodás ezerszeresét is adhatja. A vállalat ehhez AI-modellekből, chipekből és felhőinfrastruktúrából álló teljes technológiai alapot építene ki.
A vLLM bemutatta az IsoExecet, a SkyRL egységes végrehajtási absztrakcióját. A cél, hogy a megerősítéses tanulás tréning- és következtetési motorjai ugyanazt a numerikus végrehajtást használják, csökkentve az eltéréseket és kiszámíthatóbbá téve az on-policy folyamatokat.
Az NVIDIA közlése szerint az AVO kutatási projekt 100.00 RHAE pontszámot ért el az ARC-AGI-3 nyilvános tesztjén. A vállalat ezt a hosszú távú autonóm teljesítmény szempontjából fontos eredményként mutatta be.
Modellek és fejlesztői eszközök
A Vercel AI Gateway-en megjelent a DeepSeek V4 Flash Vision Experimental, amely képleírásra, képernyőképeken lévő szöveg kiolvasására és diagramok értelmezésére is használható. Közben féláron érhető el a GPT-5.6 Sol, a bemeneti tokenek díja 20 százalékkal, a kimenetieké egyharmaddal csökkent.
A DeepSWE tesztjeiben a GLM-5.3 és a GPT-5.6 Sol együtt adta a legjobb eredményt: a GLM-5.3 több próbálkozással és alacsonyabb költséggel előnybe került, a két modell kombinációja pedig 85,9 százalékot ért el. Egy másik mérés szerint a GLM-5.3 5,4-szer olcsóbb volt a Claude Fable 5-nél.
A Hugging Face a beszédfelismerési benchmarkok optimalizálásának mérését vizsgálta. Az OpenRouter pedig 39 képgeneráló modellt hasonlított össze ár és generálási idő szerint is.
Kutatás, benchmarkok és ügynökbiztonság
Az Anthropic kutatása szerint a nyelvi modellek nyers súlyainak nagysága önmagában félrevezető lehet, mert az interferencia súlyok zavarhatják az értelmezést. Az Ai2 és a Georgia Tech kutatói nyílt eszközökkel az Olmo 3 társas következtetésének eredetét követték vissza, míg a Continual Learning Bench az AI-rendszerek tapasztalatból való tanulását méri.
A Google DeepMind játékokra épülő prototípusokkal, köztük az EVE Online világával kutatja a játékos AI-ügynököket. Az NVIDIA szerint a biztonsági kontrollok határát a futtatókörnyezetnél kell meghúzni, a GitHub Actions pedig már Docker Sandboxban futtat kódoló ügynököket. Az Amazon SOP-Bench benchmarkja több mint 2000 üzleti feladaton teszteli ezeket a rendszereket.
Szabályozás, infrastruktúra és alkalmazások
Az EU-ban a gyermekek online védelmétől a kognitív integritás általános védelméig terjedő szabályozási javaslat körvonalazódik. Az amerikai államok chatbotokra és AI-kockázatokra szabnának új szabályokat, a CDT pedig szigorúbb pénzügyi AI-ellenőrzést sürget.
Az ITU-T jóváhagyta az AI-korszak energiatakarékos hálózati keretrendszerének nemzetközi szabványát. A Google mobilitási adatokkal javítaná a helyismeretet, a Midjourney újabb alpha-javításokat adott ki, a Google Research pedig viselhető szenzorokból keres biomarkereket. A nap további hírei között szerepelt a DeepSeek időfüggő API-árazása, az SAP-átállások agentikus támogatása, az NVIDIA pénzügyi klaszterezési megoldása, a Palo Alto Networks Anthropic-alapú védelme és a Berkeley izomkímélő fogyókúrás vegyülete.


