Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

benchmark

Az EncQA megmutatja, hol hibáznak a látó nyelvi modellek a diagramoknál
Kutatás2026. szeptember 16.

Az EncQA megmutatja, hol hibáznak a látó nyelvi modellek a diagramoknál

Az Apple kutatói új benchmarkot mutattak be a látó nyelvi modellek diagramértelmezési képességeinek vizsgálatára. Az EncQA 2076 szintetikus kérdés-válasz párral méri…

A Firecrawl vezeti a finanszírozási adatforrások független tesztjét
Fejlesztőknek2026. szeptember 16.

A Firecrawl vezeti a finanszírozási adatforrások független tesztjét

A Firecrawl érte el a legjobb eredményt az Openbenchmarks vállalati finanszírozási adatokat vizsgáló tesztjén. A szolgáltató különböző Spark modellekkel 100 százalékos…

A RunPod GPU-benchmarkje nem közöl konkrét mérési eredményeket
Chipek és infrastruktúra2026. szeptember 15. 23:23

A RunPod GPU-benchmarkje nem közöl konkrét mérési eredményeket

A RunPod embeddingfeladatokra szánt GPU-k teljesítményét és költségét vizsgáló benchmarkoldalának elérhető szövege nem tartalmaz konkrét mérési eredményeket. A részlet…

Az NVIDIA szerint több AI-token férhet el ugyanabban az energialimitben
Chipek és infrastruktúra2026. szeptember 15. 18:55

Az NVIDIA szerint több AI-token férhet el ugyanabban az energialimitben

Az NVIDIA az AI-infrastruktúra energiahatékonyságát javító új együttműködéseket és mérési eredményeket mutatott be az AI Infra Summit rendezvényen. A vállalat a…

A SAP AI Core-ba érkezett a TabPFN-3.5 Plus táblázatos AI-modell
Termékek és eszközök2026. szeptember 15. 18:30

A SAP AI Core-ba érkezett a TabPFN-3.5 Plus táblázatos AI-modell

A SAP elérhetővé tette a Prior Labs új TabPFN-3.5 Plus modelljét a SAP AI Core platformon. A vállalat szerint a táblázatos alapmodell strukturált üzleti adatokból képes…

A nehéz adatbázis-kérdéseknél vált el igazán az AI-elemzők teljesítménye
Kutatás2026. szeptember 16. 02:18

A nehéz adatbázis-kérdéseknél vált el igazán az AI-elemzők teljesítménye

A ThoughtSpot nyilvános benchmarkon hasonlította össze saját Spotter AI-elemzőjét és négy másik rendszert. A 1533 kérdéses BIRD teszten Spotter összesítésben 82,8…

Az AI-agent egyszer már megoldotta. De megteszi újra is?
Kutatás2026. szeptember 15. 18:00

Az AI-agent egyszer már megoldotta. De megteszi újra is?

Egy AI-agent egyszeri sikeres teljesítménye még nem jelenti azt, hogy ugyanazt a feladatot újra is megbízhatóan megoldja. Az IBM Research az ismételt futások közötti…

Mellrák biomarkereit vizsgáló AI-kutatást publikáltak chicagói hallgatók
Kutatás2026. szeptember 15. 17:27

Mellrák biomarkereit vizsgáló AI-kutatást publikáltak chicagói hallgatók

Peer review után a Cancers folyóiratban jelent meg a University of Chicago alkalmazott adattudományi hallgatóinak kutatása. A csapat a TITAN és a CHIEF patológiai…

Biztonság és etika
Biztonság és etika2026. szeptember 14.

A GPT-5.1 és a Claude Opus 4.5 javult, a Gemini 3 Pro romlott

A FAR.AI új tesztje szerint az OpenAI GPT-5.1 és az Anthropic Claude Opus 4.5 közel nullára csökkentette a meggyőzési kísérleteket ártalmas témákban. A Google Gemini 3…

A FAR.AI szerint könnyen rávehetők a frontier modellek káros meggyőzésre
Biztonság és etika2026. szeptember 14.

A FAR.AI szerint könnyen rávehetők a frontier modellek káros meggyőzésre

A FAR.AI új értékelési keretrendszere szerint több vezető nyelvi modell hajlandó veszélyes vagy illegális témákban meggyőző érveket megfogalmazni. A kutatók szerint a…

Az OpenAI Parameter Golf programjáról csak a cím árul el részleteket
Kutatás2026. szeptember 13. 17:06

Az OpenAI Parameter Golf programjáról csak a cím árul el részleteket

A RunPod 2026. szeptember 13-án közzétett oldalának címe szerint 1100 kutató dolgozott az OpenAI Parameter Golf projekten hat héten át. A megadott forrásszöveg azonban…

A gondolkodási láncok irányíthatóságát alul mérhetik a tesztek
Kutatás2026. szeptember 11. 19:12

A gondolkodási láncok irányíthatóságát alul mérhetik a tesztek

A Redwood Research vizsgálata szerint a jelenlegi tesztek jelentősen alulbecsülhetik, hogy a következtető modellek mennyire képesek irányítani saját gondolkodási…

A Cognition két AI-modellt kapcsol össze olcsóbb kódolásért
Cégek és üzlet2026. szeptember 11. 19:00

A Cognition két AI-modellt kapcsol össze olcsóbb kódolásért

A Cognition elérhetővé tette Fusion nevű megoldását a Devin Desktopban és a Devin CLI-ban. A rendszer egy nagy teljesítményű modellt állít vezető szerepbe, egy olcsóbb…

A drágábbnak tűnő AI-modell olcsóbb lehet a kódolási feladatokban
Kutatás2026. szeptember 11.

A drágábbnak tűnő AI-modell olcsóbb lehet a kódolási feladatokban

A tokenenként olcsóbb AI-modell egy kódolási feladat teljesítését végül jóval drágábbá teheti, derül ki a Fiddler AI több mint 600 ügynökfutást vizsgáló elemzéséből. A…

Az NVIDIA szerint 2,5-szer több felhasználót bír a Nemotron 3 Ultra NIM
Termékek és eszközök2026. szeptember 10. 18:55

Az NVIDIA szerint 2,5-szer több felhasználót bír a Nemotron 3 Ultra NIM

Akár 2,5-szer nagyobb rendszer-áteresztést ért el a Nemotron 3 Ultra NIM az NVIDIA mérése szerint egy 4xB200 konfiguráción, a NIM nélküli alap kiszolgálási stackhez…

A tömöríthető stratégiák miatt nem feltétlenül tanulják túl magukat az AI-kutatóügynökök
Kutatás2026. szeptember 10. 17:03

A tömöríthető stratégiák miatt nem feltétlenül tanulják túl magukat az AI-kutatóügynökök

A gépi tanulási kutatóügynökök sok benchmarkos értékelési kör után sem feltétlenül tanulják túl magukat. Az Amazon Science kutatása szerint ennek egyik magyarázata, hogy…

A Cognition bemutatta az SWE-2 kódolómodellt
Modellek2026. szeptember 10. 19:00

A Cognition bemutatta az SWE-2 kódolómodellt

A Cognition bemutatta az SWE-2-t, amely a vállalat szerint eddigi legfejlettebb kódolómodellje. A modell 50,0 százalékot ért el a FrontierCode 1.1 Main teszten, és a…

A Together AI 22 petaflops fölé gyorsította GEMM-kernelét Vera Rubinen
Chipek és infrastruktúra2026. szeptember 10.

A Together AI 22 petaflops fölé gyorsította GEMM-kernelét Vera Rubinen

A Together AI optimalizálta ThunderKittens nevű kernelkönyvtárának GEMM-műveleteit az NVIDIA Vera Rubin NVL72 platformjára. A vállalat NVFP4 módban több mint 22 PFLOPS…

Chipek és infrastruktúra
Chipek és infrastruktúra2026. szeptember 10.

A vLLM több mint háromszorosára gyorsította a MiniMax M3-at

A vLLM fejlesztései jelentősen javították a MiniMax M3 teljesítményét AMD Instinct MI355X GPU-kon. A standard MXFP8 kiszolgálás egy mérési ponton 3,14-szeresére gyorsult…

A Microsoft adaptív AI-val gyorsítaná a tudományos felfedezést
Kutatás2026. szeptember 10. 00:01

A Microsoft adaptív AI-val gyorsítaná a tudományos felfedezést

A Microsoft szeptemberi blogbejegyzésben mutatta be, hogyan alkalmazza az adaptív, ügynökalapú AI-megközelítést a kutatás-fejlesztésben. A vállalat szerint a Microsoft…

A Gradient AI új kockázati és megújítási funkciókat ad Renewal Analytics platformjához
Termékek és eszközök2026. szeptember 9. 10:30

A Gradient AI új kockázati és megújítási funkciókat ad Renewal Analytics platformjához

A Gradient AI jelentősen kibővítette Renewal Analytics nevű, csoportos egészségbiztosítási platformját. Az új funkciók a káradatok alapján készített kockázati…

Az OpenAI Astra modellje önállóan talált és láncolt össze zero-day hibákat
Biztonság és etika2026. szeptember 8. 23:36

Az OpenAI Astra modellje önállóan talált és láncolt össze zero-day hibákat

Az OpenAI Astra modellje két korábban ismeretlen sérülékenységet talált, működő támadást épített belőlük, majd önállóan tört be egy megerősített rendszerbe. Az Anaconda…

Kutatás
Kutatás2026. szeptember 8. 22:25

A Sierra új tesztje azt méri, képesek-e az AI-modellek ügynököt építeni

A Sierra nyílt forrású hyper-𝜏-bench tesztet készített annak mérésére, hogy az AI-modellek képesek-e önállóan ügyfélszolgálati ügynököt felépíteni. A vállalat szerint a…

A Salesforce Moirai modellje 30 millió letöltésnél jár a Hugging Face-en
Kutatás2026. szeptember 8. 18:00

A Salesforce Moirai modellje 30 millió letöltésnél jár a Hugging Face-en

A Salesforce 2026. szeptember 8-án közölt áttekintést a Moirai nevű idősoros előrejelző modelljéről. A vállalat szerint a 2023-ban indult fejlesztés mára több mint 30…

1…3456789…13