Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

benchmark

A TrendAI 97 százalékkal vezeti a CyberGym biztonsági tesztjét
Biztonság és etika2026. augusztus 26. 16:00

A TrendAI 97 százalékkal vezeti a CyberGym biztonsági tesztjét

A TrendAI agentikus sérülékenység-javító motorja, az AESIR kódnevű rendszer 97 százalékos eredménnyel az első helyen végzett a CyberGym AI-biztonsági benchmarkján. A…

A Speechmatics szerint 20 másodperc alatt átír egyórányi hangot a Melia
Modellek2026. augusztus 26.

A Speechmatics szerint 20 másodperc alatt átír egyórányi hangot a Melia

A Speechmatics Melia beszédfelismerő modellje a cég szerint egyórányi hangfelvételt kevesebb mint 20 másodperc alatt ír át. Az Artificial Analysis független rangsorán…

Biztonság és etika
Biztonság és etika2026. augusztus 25. 20:32

Az AI Now Institute szerint célzottabb biztonsági tesztek kellenek

Az általános mesterségesintelligencia-benchmarkok helyett a mindennapi felhasználási esetekhez igazított értékeléseket sürget Sarah Myers West, az AI Now Institute…

4 bites modell előzné meg a teljes pontosságú eredetit a Hugging Face-poszt szerint
Kutatás2026. augusztus 25. 13:39

4 bites modell előzné meg a teljes pontosságú eredetit a Hugging Face-poszt szerint

Elton Williams 2026. augusztus 25-én a Hugging Face-en írt a Quantization-Aware Healing nevű megközelítésről. A bejegyzés szerint egy tömörített, 4 bites modell több…

Miért buknak el a frontier AI-ügynökök a valódi mérnöki munkán?
Kutatás2026. augusztus 24. 20:16

Miért buknak el a frontier AI-ügynökök a valódi mérnöki munkán?

A Terminal-Bench 3.0 legjobb modellje, Claude Opus 5 is csak 43,5 százalékos eredményt ér el az új teszten. A Snorkel AI két feladaton keresztül mutatja be, miért nehéz…

Az NVIDIA teljes gyártásba vitte a Groq 3 LPX rendszert
Chipek és infrastruktúra2026. augusztus 24. 17:00

Az NVIDIA teljes gyártásba vitte a Groq 3 LPX rendszert

Az NVIDIA 2026. augusztus 24-én jelentette be, hogy teljes gyártásban van a Vera Rubin rack-szintű rendszerhez kapcsolódó NVIDIA Groq 3 LPX. A vállalat a Hot Chips…

Az NVIDIA szerint a Vera Rubin NVL72 akár 30-szoros előnyt hoz agentikus AI-ban
Chipek és infrastruktúra2026. augusztus 24. 17:00

Az NVIDIA szerint a Vera Rubin NVL72 akár 30-szoros előnyt hoz agentikus AI-ban

Az NVIDIA 2026. augusztus 24-én közzétett fejlesztői blogbejegyzése szerint a Vera Rubin NVL72 előzetes mérésekben akár 30-szor nagyobb AI-gyári áteresztőképességet…

NVIDIA Groq 3 LPX: 3431 token/másodperc 100K kontextus mellett
Chipek és infrastruktúra2026. augusztus 24. 17:00

NVIDIA Groq 3 LPX: 3431 token/másodperc 100K kontextus mellett

Az NVIDIA 2026. augusztus 24-én ismertette a Groq 3 LPX inference gyorsítót, amelyet a Vera Rubin platform interaktív AI-kiszolgálásához szán. A cég szerint az…

Az Apple kutatói adaptív gondolkodási módszert mutattak be LLM-ekhez
Kutatás2026. augusztus 24.

Az Apple kutatói adaptív gondolkodási módszert mutattak be LLM-ekhez

Az Apple kutatói olyan módszert ismertettek, amely előre megbecsüli, mennyi köztes gondolkodásra van szüksége egy nagy nyelvi modellnek egy adott kérdésnél. A Sonata…

A Liquid AI Pipette-t adott ki az eszközön futó AI-modellek mérésére
Kutatás2026. augusztus 24.

A Liquid AI Pipette-t adott ki az eszközön futó AI-modellek mérésére

A Liquid AI és az Artificial Analysis nyílt forráskódú benchmarkrendszert indított az eszközökön futó AI-modellek vizsgálatára. A Pipette a sebességet, késleltetést…

A vLLM az AMD GPU-kon vizsgálta a spekulatív dekódolást
Fejlesztőknek2026. augusztus 23.

A vLLM az AMD GPU-kon vizsgálta a spekulatív dekódolást

A vLLM az AMD Instinct MI300X és MI355X GPU-kon vizsgálta a spekulatív dekódolást, amely egyetlen célmodell-futtatásban több előre jelzett tokent is ellenőrizhet. A…

Az Amazon új tesztje valódi üzleti eljárásokon vizsgálja az AI-ügynököket
Kutatás2026. augusztus 21. 17:57

Az Amazon új tesztje valódi üzleti eljárásokon vizsgálja az AI-ügynököket

Az Amazon Science bemutatta az SOP-Bench nevű nyílt benchmarkot, amely AI-ügynököket valódi, szakértők által összeállított üzleti eljárások végrehajtásán keresztül…

Az NVIDIA AVO 100 százalékot ért el az ARC-AGI-3 nyilvános tesztjén
Kutatás2026. augusztus 21. 15:00

Az NVIDIA AVO 100 százalékot ért el az ARC-AGI-3 nyilvános tesztjén

Az NVIDIA Developer 2026. augusztus 21-én közölte, hogy az Agentic Variation Operators, röviden AVO kutatási projekt 100.00 RHAE pontszámot ért el az ARC-AGI-3 nyilvános…

Új benchmark méri, valóban tanulnak-e az AI-rendszerek a tapasztalatból
Kutatás2026. augusztus 21. 02:19

Új benchmark méri, valóban tanulnak-e az AI-rendszerek a tapasztalatból

A Continual Learning Bench azt méri, hogy az LLM-alapú rendszerek valóban javulnak-e a egymást követő feladatok során szerzett tapasztalatoktól. A Berkeley kutatója…

Hugging Face-blogposzt a beszédfelismerési benchmarkok méréséről
Kutatás2026. augusztus 21.

Hugging Face-blogposzt a beszédfelismerési benchmarkok méréséről

A Hugging Face 2026. augusztus 21-én közölt blogposztot „Measuring benchmark optimization in speech recognition” címmel. A bejegyzés az automatikus beszédfelismeréshez…

A GLM-5.3 ötödannyiba kerül, mint a Claude Fable 5
Modellek2026. augusztus 21.

A GLM-5.3 ötödannyiba kerül, mint a Claude Fable 5

A GLM-5.3 és a Claude Fable 5 első próbálkozásra gyakorlatilag döntetlenre végzett a DeepSWE szoftvermérnöki tesztjén, a GLM-5.3 azonban 5,4-szer olcsóbbnak bizonyult.…

A GLM-5.3 olcsóbban hoz több megoldást, ha lehet újrapróbálkozni
Kutatás2026. augusztus 21.

A GLM-5.3 olcsóbban hoz több megoldást, ha lehet újrapróbálkozni

A GPT-5.6 Sol pontosabb első próbálkozásra a DeepSWE programozási feladatain, a GLM-5.3 viszont olcsóbb, több próbálkozással megelőzi, és a két modell együtt adja a…

Az OpenRouter vizuális tesztekkel hasonlítja össze a képgeneráló modelleket
Kutatás2026. augusztus 21.

Az OpenRouter vizuális tesztekkel hasonlítja össze a képgeneráló modelleket

Az OpenRouter vizuális kép-benchmarkot indított, amellyel a platformon elérhető képgeneráló modellek képességei hasonlíthatók össze. A tesztek 39 modellt vizsgáltak 2026…

Akár 3,2-szer gyorsabb inferenciát ígér az LFM2.5-DSpark
Modellek2026. augusztus 20. 18:52

Akár 3,2-szer gyorsabb inferenciát ígér az LFM2.5-DSpark

A Hugging Face-en 2026. augusztus 20-án jelent meg a LiquidAI bejegyzése az LFM2.5-DSpark modellről. A cím szerint a megoldás akár 3,2-szer gyorsabb inferenciát kínál.

Agentic Search: új keresési réteget mutatott be a Mistral AI vállalatoknak
Termékek és eszközök2026. augusztus 20. 14:00

Agentic Search: új keresési réteget mutatott be a Mistral AI vállalatoknak

A Mistral AI 2026. augusztus 20-án bemutatta az Agentic Search nevű keresési rétegét, amelyet vállalati AI-rendszerekhez szán. A cég szerint a megoldás összetett…

A Murf szerint a jó AI-szinkron alapja a kontextusos fordítás
Kutatás2026. augusztus 20.

A Murf szerint a jó AI-szinkron alapja a kontextusos fordítás

A Murf szerint az AI-szinkronizálás minőségét elsősorban a fordítás határozza meg, nem önmagában a hang természetessége. A vállalat saját benchmarkjében a Murf, a HeyGen…

A Firecrawl külön keresőt indított kódoló ügynököknek
Termékek és eszközök2026. augusztus 20.

A Firecrawl külön keresőt indított kódoló ügynököknek

A Firecrawl Developer Index a kódoló ügynökök számára fontos README-ket, dokumentációkat, hibajegyeket és pull requesteket kereshetővé tevő új index. A vállalat ezzel…

A letölthető modellek korában az adat és a visszacsatolás dönt
Kutatás2026. augusztus 19. 21:46

A letölthető modellek korában az adat és a visszacsatolás dönt

A Bridgewater AIA Labs kísérlete szerint egy nyílt súlyú modell szakértői adatokkal betanítva felülmúlta a vizsgált élvonalbeli modelleket. Az Anaconda szerint a…

USC-kutatók háromlépcsős védelmet fejlesztenek az AI-ügynökökhöz
Biztonság és etika2026. augusztus 19. 20:25

USC-kutatók háromlépcsős védelmet fejlesztenek az AI-ügynökökhöz

A USC mérnökei olyan eszközöket fejlesztenek, amelyek az AI-ügynökök indulás előtti ellenőrzését, futás közbeni felügyeletét és a hibák utólagos feltárását segítik. A…

1…678910111213