Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

benchmark

A Replit Agent maga dönti el, mikor és melyik modellt használja
Fejlesztőknek2026. szeptember 29. 18:00

A Replit Agent maga dönti el, mikor és melyik modellt használja

A Replit Agent új vezérlési rendszere a fő modellre bízza, mennyire gondolja végig a feladatot, mikor delegál részfeladatot, és melyik almodellt választja hozzá. A…

Az Anthropic csökkentette Claude jellegzetes fordulatait, de nem tűntek el
Kutatás2026. szeptember 29. 17:00

Az Anthropic csökkentette Claude jellegzetes fordulatait, de nem tűntek el

Az Opus 5.5 valóban szinte teljesen elhagyta a hosszú gondolatjeleket, és a Claude-ra jellemző stiláris fordulatok száma is csökkent. Az Arize AI vizsgálata szerint…

Az Anthropic tényleg javított Claude stílusán, de nem tüntette el teljesen
Kutatás2026. szeptember 29. 17:00

Az Anthropic tényleg javított Claude stílusán, de nem tüntette el teljesen

Az Opus 5.5 valóban sokkal kevesebb em dash jelet és Claude-ra jellemző fordulatot használ, mint az Opus 5, de az Arize AI vizsgálata szerint a probléma nem tűnt el…

Az Apple szerint a nyelvi modellek kommunikációja veszteséges
Kutatás2026. szeptember 29.

Az Apple szerint a nyelvi modellek kommunikációja veszteséges

Az Apple kutatása szerint a nyelvi modellek természetes nyelven folytatott kommunikációja jelentős információveszteséggel jár, amikor fa struktúrájú adatokat kell…

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt
Chipek és infrastruktúra2026. szeptember 29.

A Red Hat szerint a Kubernetes és a CPU-k is erősek AI-inferencia alatt

A Red Hat az MLPerf Inference v6.1 tesztjeiben magas teljesítményt ért el Kubernetes-alapú GPU-s rendszereken, miközben CPU-only konfigurációkon is erős eredményeket…

Az Apple szerint a nyelvi modellek kommunikációja veszteséges
Kutatás2026. szeptember 29.

Az Apple szerint a nyelvi modellek kommunikációja veszteséges

Az Apple kutatói azt vizsgálták, mennyire marad meg a fastruktúrájú információ, amikor a nyelvi modellek természetes nyelven adják tovább egymásnak. Eredményeik szerint…

A Red Hat szerint a Kubernetes és a CPU-k is jól teljesítettek az MLPerfben
Chipek és infrastruktúra2026. szeptember 29.

A Red Hat szerint a Kubernetes és a CPU-k is jól teljesítettek az MLPerfben

A Red Hat közzétette az MLPerf Inference v6.1 benchmarkban elért eredményeit. A vállalat szerint az OpenShift és a vLLM Kubernetes-alapú környezetben is versenyképes…

Jev-as-a-Judge értékelés érkezett az Arize AX platformra
Termékek és eszközök2026. szeptember 28. 23:00

Jev-as-a-Judge értékelés érkezett az Arize AX platformra

Az Arize AX közvetlenül integrálta a TypeSafe AI Jev döntési modelljét, így a csapatok natív módon értékelhetik a gyártási nyomokat. A Jev-as-a-Judge strukturált…

Az Arize AX közvetlenül támogatja a Jev-as-a-Judge értékeléseket
Termékek és eszközök2026. szeptember 28. 23:00

Az Arize AX közvetlenül támogatja a Jev-as-a-Judge értékeléseket

Az Arize AX natív integrációt kapott a TypeSafe AI Jev rendszerével, így a csapatok közvetlenül a platformon értékelhetik a gyártásból származó nyomkövetéseket. A Jev…

A Jev valószínűségei olyan hibákat is jeleznek, amelyeket az LLM-ek elrejtenek
Kutatás2026. szeptember 28. 19:28

A Jev valószínűségei olyan hibákat is jeleznek, amelyeket az LLM-ek elrejtenek

A Jev címkénkénti valószínűségei megbízhatóan jelezték, mikor tévedett az értékelésben, miközben az ismételten futtatott nyelvi modellek sok hibás döntésnél…

265 valódi beszélgetéssel teszteli a háttérhangok felismerését a Krisp
Kutatás2026. szeptember 28. 16:16

265 valódi beszélgetéssel teszteli a háttérhangok felismerését a Krisp

A Krisp 265 valódi beszélgetésből álló tesztadatbázist készített a háttérben megszólaló hangok vizsgálatára. A felvételek irodákban, call centerekben és mozgó autókban…

A LangChain Jevvel építene gyorsabb és olcsóbb AI-ügynököket
Modellek2026. szeptember 28. 13:45

A LangChain Jevvel építene gyorsabb és olcsóbb AI-ügynököket

A LangChain bemutatta, hogyan használható együtt a TypeSafe Jev döntési modellje és a LangGraph az AI-ügynökök megbízhatóbb működtetésére. A vállalat szerint Jev a szűk…

A LangChain Jevvel építene gyorsabb és olcsóbb AI-ügynököket
Modellek2026. szeptember 28. 13:45

A LangChain Jevvel építene gyorsabb és olcsóbb AI-ügynököket

A LangChain bemutatta, hogyan használható együtt a TypeSafe döntési modellje, a Jev és a LangGraph éles környezetbe szánt AI-ügynökökben. A megközelítésben a kód…

A Claude Sonnet 5.5 több hibát talált, feleannyi idő alatt
Modellek2026. szeptember 28.

A Claude Sonnet 5.5 több hibát talált, feleannyi idő alatt

A CodeRabbit tesztjeiben a Claude Sonnet 5.5 több ismert hibát talált meg a Sonnet 5-nél, miközben körülbelül feleannyi idő alatt futott le. A javulás ára az, hogy a…

A Scale AI szerint Washingtonnak saját AI-tesztelési kapacitás kell
Cégek és üzlet2026. szeptember 25.

A Scale AI szerint Washingtonnak saját AI-tesztelési kapacitás kell

A Scale AI szerint az amerikai szövetségi kormány nem tudja megfelelően mérni a legfejlettebb mesterségesintelligencia-modellek kockázatait, ezért független tesztelési…

Rustban írták újra a cross-encoder inferenciát, de nem mindenhol lett gyorsabb
Fejlesztőknek2026. szeptember 25.

Rustban írták újra a cross-encoder inferenciát, de nem mindenhol lett gyorsabb

A Qdrant Rustban írta újra a cross-encoder modellek futtatását, majd Python-alapú könyvtárakkal hasonlította össze. A cross-encode-rs kis modellen csak mérsékelten…

Kutatás
Kutatás2026. szeptember 25.

Az MLflow tesztjén a Jev gyors volt, de hibákat is átengedett

A Jev strukturált döntési modell az MLflow új tesztjén 72 válaszból 64 esetben egyezett az emberi címkézéssel. A modell gyorsabb és olcsóbb volt a GPT-OSS-120B-nél, de…

A dbt Semantic Layer megbízhatóbb válaszokat adott az AI-ügynököknek
Kutatás2026. szeptember 24. 19:38

A dbt Semantic Layer megbízhatóbb válaszokat adott az AI-ügynököknek

A dbt Semantic Layer bizonyult a legmegbízhatóbb és legolcsóbb interfésznek egy Fivetran által végzett tesztben, amelyben két AI-modell ugyanazokra az üzleti kérdésekre…

Az MLPerf új benchmarkkal méri a nagy nyelvi modellek utótréningjét
Kutatás2026. szeptember 24. 16:50

Az MLPerf új benchmarkkal méri a nagy nyelvi modellek utótréningjét

Az MLPerf Training első alkalommal külön benchmarkkal méri a nagy nyelvi modellek utótréningjét. A teszt a Qwen 3.5 397B modellt szoftverfejlesztési feladatokon…

A GPT-5.6 Sol vezeti a régi rendszerekre szabott tesztet
Kutatás2026. szeptember 24.

A GPT-5.6 Sol vezeti a régi rendszerekre szabott tesztet

A GPT-5.6 Sol érte el a legjobb eredményt a Factory Legacy-Bench nevű tesztjén, amely a COBOL, a Java 7, a BASIC, a C89, a Fortran és az Assembly kezelését vizsgálja. A…

A Quail több mint egymilliárd tokent dolgoz fel percenként H100-on
Fejlesztőknek2026. szeptember 24.

A Quail több mint egymilliárd tokent dolgoz fel percenként H100-on

A Modal bemutatta a Quail nevű következtetési motort, amelyet kifejezetten AI-SQL munkafolyamatokra terveztek. A vállalat szerint egy H100 GPU-n több mint egymilliárd…

Az Arize szerint a Jev 300-szor olcsóbban érte el Claude Opus 5 pontosságát
Kutatás2026. szeptember 24. 00:55

Az Arize szerint a Jev 300-szor olcsóbban érte el Claude Opus 5 pontosságát

A Jev a Claude Opus 5-tel azonos, 87 százalékos pontosságot ért el az Arize hallucination detection tesztjén, miközben a vállalat szerint körülbelül 300-szor olcsóbb és…

A LanceDB 10 milliárd vektoros keresést mutatott be
Fejlesztőknek2026. szeptember 23. 23:38

A LanceDB 10 milliárd vektoros keresést mutatott be

A LanceDB olyan vektorkeresési architektúrát mutatott be, amely 10 millió vektortól 10 milliárd vektorig támogatja a keresést. A vállalat szerint a rendszer elosztott…

LanceDB új világmodell-platformot és multimodális SQL-eszközt mutatott be
Fejlesztőknek2026. szeptember 23. 23:38

LanceDB új világmodell-platformot és multimodális SQL-eszközt mutatott be

A LanceDB három új fejlesztést emelt ki legutóbbi hírlevelében: egy Lance-alapú, reprodukálható világmodell-kutatási platformot, a DuckDB multimodális SQL-integrációját…

123456…13