nyelvi modellek
Az OpenAI bemutatta a ChatGPT Work ügynököt összetett feladatokra
Az OpenAI bemutatta a ChatGPT Worköt, a ChatGPT új ügynökét, amely többórás, összetett munkafolyamatokat is képes kisebb lépésekre bontani és önállóan végrehajtani. Az…
ModellekMegérkezett a GPT-5.6, három modellel és új ultra móddal
Az OpenAI általánosan elérhetővé tette a GPT-5.6 modellcsaládot, amelynek tagjai eltérő teljesítményre és költséghatékonyságra készültek. A csomag része a…

Az AI saját gondolatmenete nem mindig tükrözi, amit valójában számol
A nagy nyelvi modellek gondolatmenete, vagyis a Chain of Thought, nem mindig mutatja meg hűen, hogyan jutottak el a válaszhoz. Az Amii szerint ezért ez a szöveg nem…

A Salesforce kisebb, célzott modellekkel csökkenti az Agentforce költségeit
A Salesforce több, egy-egy feladatra optimalizált modellt épített be az Agentforce mögötti rendszerbe, hogy mérsékelje a következtetési költségeket és gyorsítsa az…

A Cognition bemutatta az SWE-1.7 kódoló modellt
A Cognition elindította az SWE-1.7-et, amelyet a vállalat eddigi legképességesebb modelljeként mutat be. A modell hosszabb, aszinkron szoftverfejlesztési feladatokra…

A Hugging Face a vLLM Transformers-backendjének natív sebességét mutatja be
A Hugging Face Native-speed vLLM transformers modeling backend címmel tett közzé bejegyzést, amely a vLLM Transformers-modellezési backendjét állítja a középpontba. A…
ModellekGPT-Live érkezik, természetesebb beszélgetést ígér a ChatGPT Voice-ban
Az OpenAI bemutatta a GPT-Live hangmodelleket, amelyek egyszerre tudnak figyelni és beszélni, így természetesebb, gyorsabb párbeszédet tesznek lehetővé. A GPT-Live-1 és…

Nyílt forrású arab beszédfelismerő modellt adott ki a Cohere
A Cohere nyílt forrásúvá tette a Cohere Transcribe Arabic beszédfelismerő modellt, amelyet arab dialektusokra, kétnyelvű beszédre és vállalati használatra…

Az Antidoom módszerrel csökkentené a modellek végtelen ismétléseit a Liquid AI
A Liquid AI olyan célzott tanítási módszert mutatott be, amely a gondolkodó modellek ismétlődő szöveghurokjait, az úgynevezett doom loopokat mérsékli. Az Antidoom…

Az NVIDIA új módszerrel tartaná egyenletesen az LLM-ek tanítási teljesítményét
Az NVIDIA olyan kísérleti módszert mutatott be, amely átmeneti GPU-kiesések esetén dinamikusan módosítja a tenzorpárhuzamosítás mértékét. A Nonuniform Tensor Parallelism…

Az Apple LaCy módszere megtanítja a kis nyelvi modelleket segítséget kérni
Az Apple kutatói bemutatták a LaCy nevű előtanítási módszert, amely segít a kis nyelvi modelleknek eldönteni, mely tokeneket tanulják meg, és mikor kérjenek segítséget…

Az annotációk mérsékelhetik a nyelvi modellek sokféleségének összeomlását
Az annotációkra épülő tanítás mérsékelheti azt a sokféleségvesztést, amely a nyelvi modellek felügyelt finomhangolása után jelentkezik. Az Apple kutatói szerint…

Az Apple térképekkel segítené az LLM-ek viselkedési szabályainak tervezését
Az Apple kutatói Policy Maps néven olyan módszert mutattak be, amely térképszerű ábrázolással segíti a nagy nyelvi modellek viselkedésére vonatkozó szabályok…

Az Apple megosztott útválasztót javasol a beszédfelismerő MoE-modellekhez
Az Apple kutatói olyan Omni-router Transformer modellt mutattak be, amely a beszédfelismerésben több rétegen keresztül megosztja az útválasztási döntéseket. A kutatás…