Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

benchmark

Az Ai2 új módszere megmutatná, mit mérnek valójában az LLM-tesztek
Kutatás2026. szeptember 1. 10:00

Az Ai2 új módszere megmutatná, mit mérnek valójában az LLM-tesztek

Az Ai2 2026. szeptember 1-jén bemutatta a BenchMIRT nevű módszert, amellyel az LLM-benchmarkokat az egyes kérdések és feladatok szintjén lehet auditálni. A cél annak…

A Qdrant 10 milliárd vektoros benchmarkot és nyílt eszközöket ad ki
Kutatás2026. szeptember 1.

A Qdrant 10 milliárd vektoros benchmarkot és nyílt eszközöket ad ki

A Qdrant bemutatta a Qdrant-FineWeb-10B nevű, 10 milliárd vektort tartalmazó nyílt benchmarkot, valamint a hozzá készített Supernova keretrendszert. A vállalat szerint…

A CodeRabbit szerint a Fable 5.1 pontosabban, de lassabban review-zik
Kutatás2026. szeptember 1.

A CodeRabbit szerint a Fable 5.1 pontosabban, de lassabban review-zik

A Fable 5.1 a CodeRabbit tesztjeiben kevesebb és pontosabb kódreview-megjegyzést készített, mint a Fable 5, viszont egy feladat ellenőrzése átlagosan több időt vett…

A Speechmatics Melia 1 modellje javította a többnyelvű átírást
Modellek2026. szeptember 1.

A Speechmatics Melia 1 modellje javította a többnyelvű átírást

A Speechmatics szerint Melia 1 beszédfelismerő modellje vezeti a tesztelt rendszerek mezőnyét az arab, mandarin és tamil nyelv közötti váltások felismerésében. Arab és…

A Google bemutatta a TimesFM-3 idősoros előrejelző modellt
Kutatás2026. augusztus 31. 19:19

A Google bemutatta a TimesFM-3 idősoros előrejelző modellt

A Google Research 2026. augusztus 31-én bemutatta a TimesFM-3 modellt, a TimesFM idősoros alapmodell-család új generációját. A cég szerint a modell többváltozós…

Megjelent a Langfuse v4, gyorsabb értékeléssel és multimodális támogatással
Fejlesztőknek2026. augusztus 31.

Megjelent a Langfuse v4, gyorsabb értékeléssel és multimodális támogatással

A Langfuse kiadta a Langfuse v4-et, új értékelőbeállítási folyamatot vezetett be, és kép-, hang-, videó- és PDF-tartalmak elemzésére is alkalmassá tette az értékelőket.…

Öt Context7-alternatíva, ha a kódolási ügynök többre képes
Fejlesztőknek2026. augusztus 31.

Öt Context7-alternatíva, ha a kódolási ügynök többre képes

A Context7 friss könyvtárdokumentációt ad a kódolási ügynököknek, de a GitHub-repók, issue-k és pull requestek keresésében korlátozott. A Firecrawl DevDex benchmarkje…

Négy AI-videóeszközt teszteltek, eltérően követik a promptokat
Kutatás2026. augusztus 30. 21:42

Négy AI-videóeszközt teszteltek, eltérően követik a promptokat

A Higgsfield összehasonlítása szerint nincs egyetlen AI-videóeszköz, amely minden promptkövetési kategóriában a legjobb lenne. A Cinema Studio 4.0 a legtöbb megadott…

A Terminal-Bench 4.0 folyamatos ellenőrzéssel tartaná értékét
Kutatás2026. augusztus 29. 04:28

A Terminal-Bench 4.0 folyamatos ellenőrzéssel tartaná értékét

Megjelent a Terminal-Bench 4.0, amely a feladatok szigorúbb ellenőrzésére, a reprodukálhatóságra és a benchmark folyamatos karbantartására épít. A Snorkel AI szerint a…

Global South nyelv került az Open ASR Leaderboardra
Kutatás2026. augusztus 28.

Global South nyelv került az Open ASR Leaderboardra

A Hugging Face 2026. augusztus 28-án közölte, hogy az Open ASR Leaderboard felvette első Global South nyelvét. A bejelentés az automatikus beszédfelismerési rendszerek…

A GLM-5.3 Flash olcsóbban hozza a teljes modell teljesítményének nagy részét
Modellek2026. augusztus 28.

A GLM-5.3 Flash olcsóbban hozza a teljes modell teljesítményének nagy részét

A GLM-5.3 Flash a DeepSWE szoftverfejlesztési benchmarkon első próbálkozásra gyengébb volt a teljes GLM-5.3-nál, ismételt futtatásokkal azonban jelentősen csökkent a…

A Roboflow Playgroundban 134 számítógépes látásmodellt lehet összevetni
Termékek és eszközök2026. augusztus 27. 18:17

A Roboflow Playgroundban 134 számítógépes látásmodellt lehet összevetni

A Roboflow Playground ugyanazt a képet és promptot akár öt, összesen 134 támogatott számítógépes látásmodellnek adja át párhuzamosan. Az ingyenes környezetben többek…

Titkosítással védené az AI-tesztek és modellek integritását az MLCommons
Biztonság és etika2026. augusztus 27. 15:13

Titkosítással védené az AI-tesztek és modellek integritását az MLCommons

Első alkalommal teszteltek kettős vak módszerrel zárt súlyú AI-modellt úgy, hogy a folyamatban részt vevő felek ne férjenek hozzá egymás érzékeny adataihoz. Az MLCommons…

Biztonság és etika
Biztonság és etika2026. augusztus 27. 14:59

Kettős vak AI-értékelést indít a Google DeepMind külső partnerekkel

A Google DeepMind 2026. augusztus 27-én bejelentette, hogy elindítja a világ első kettős vak értékelését egy saját, frontier kategóriájú AI-modellen. A pilotban a…

A külön szerepekre bontott AI-rendszer sokkal több kódot fedett le
Kutatás2026. augusztus 27. 09:00

A külön szerepekre bontott AI-rendszer sokkal több kódot fedett le

A Factory Research vizsgálata szerint a nagy szoftveres feladatoknál jelentősen javíthatja az eredményt, ha a kódoló ügynök mellett külön szerep felel a teljesítés…

A DeepSeek V4 Flash 12 centből ért el IMO-aranyszintet
Kutatás2026. augusztus 26. 22:44

A DeepSeek V4 Flash 12 centből ért el IMO-aranyszintet

A DeepSeek V4 Flash 30 pontot szerzett az IMO 2026 hat feladatán, ezzel átlépte a 29 pontos aranyéremhatárt. A Cline mérése szerint a legjobb futtatás költsége 0,1215…

Így vizsgálnák, hogy biztonságosak-e a chatbotok orvosi tanácsai
Kutatás2026. augusztus 26. 20:55

Így vizsgálnák, hogy biztonságosak-e a chatbotok orvosi tanácsai

Egy igaz állítás is veszélyes lehet, ha egy chatbot nem közli a szükséges figyelmeztetéseket. Az USC ALICE projektje olyan módszereket fejleszt, amelyekkel az orvosi…

Az LLM-ek egyetértése félrevezető lehet, ha ugyanazt a hibát követik el
Kutatás2026. augusztus 26. 19:10

Az LLM-ek egyetértése félrevezető lehet, ha ugyanazt a hibát követik el

Az Amazon kutatói szerint tíz LLM-bíró egybehangzó döntése sem feltétlenül jelent tíz független bizonyítékot. Ising-modellekre épülő módszerük a bírók közötti…

A LangSmith emberi visszajelzésekkel javítja az LLM-bírálókat
Fejlesztőknek2026. augusztus 26. 18:53

A LangSmith emberi visszajelzésekkel javítja az LLM-bírálókat

A LangSmith új, önfejlesztő értékelési rendszere az emberi javításokat későbbi példaként építi be az LLM-as-a-Judge bírálók működésébe. A LangChain szerint így kevesebb…

A LangChain szerint 2024-ben az AI-ügynökök és a több lépéses munkafolyamatok erősödtek
Kutatás2026. augusztus 26. 18:53

A LangChain szerint 2024-ben az AI-ügynökök és a több lépéses munkafolyamatok erősödtek

A LangChain 2024-es jelentése szerint a fejlesztők egyre összetettebb, több lépésből álló LLM-alkalmazásokat építenek, miközben nőtt a nyílt forrású modellek és az…

A LangChain WikiBenchkel méri, mennyire segítik a wikik a kódoló ügynököket
Fejlesztőknek2026. augusztus 26. 18:15

A LangChain WikiBenchkel méri, mennyire segítik a wikik a kódoló ügynököket

A LangChain elkészítette a WikiBench benchmarkot az OpenWiki által generált kódbázis-dokumentációk értékelésére. A rendszer azt is vizsgálja, hogy a wiki ténylegesen…

A LangChain és az NVIDIA vállalati AI-ügynökplatformot épít
Termékek és eszközök2026. augusztus 26. 18:15

A LangChain és az NVIDIA vállalati AI-ügynökplatformot épít

A LangChain és az NVIDIA teljes fejlesztési és üzemeltetési platformot jelentett be vállalati AI-ügynökökhöz. A rendszer a LangSmith, a LangGraph és a Deep Agents…

A LangChain ügynököt épített, amely más ügynökök hibáit keresi
Termékek és eszközök2026. augusztus 26. 17:02

A LangChain ügynököt épített, amely más ügynökök hibáit keresi

A LangSmith Engine a LangChain új ügynöke, amely más ügynökök működési nyomaiból keresi a visszatérő hibákat. A rendszer a problémákat feladatokká alakítja, majd…

A LangChain nyílt forrású eszközzel teszteli az LLM-es kérdésválaszolást
Termékek és eszközök2026. augusztus 26. 17:02

A LangChain nyílt forrású eszközzel teszteli az LLM-es kérdésválaszolást

A LangChain nyílt forrású, ingyenesen használható alkalmazást és API-t tett elérhetővé LLM-alapú kérdésválaszoló rendszerek tesztelésére. Az eszköz dokumentumok alapján…

1…567891011…13