nyelvi modellek

A Cohere dinamikus spekulatív dekódolással gyorsítaná az LLM-eket
A Cohere olyan dinamikus spekulatív dekódolási módszert mutatott be, amely a hardver terheléséhez igazítja, hány tokent készítsen elő egy kisebb modell. A vállalat…

Az NVIDIA 502 ezer egyedi pénzügyi hírcímet generált
Az NVIDIA 502 536 egyedi pénzügyi hírcímet állított elő szintetikusadat-generáló folyamatával. A NeMo Data Designer, a NeMo Curator és a Nemotron 3 Nano együtt olyan…
ModellekA GPT-5.6 lett a Microsoft 365 Copilot alapértelmezett modellje
A GPT-5.6 lesz a Microsoft 365 Copilot új preferált modellje, így az OpenAI legújabb zászlóshajó-modellcsaládja a Word, az Excel, a PowerPoint, a Chat és a Cowork…
Termékek és eszközökFontos hírAz OpenAI bemutatta a ChatGPT Work ügynököt összetett feladatokra
Az OpenAI bemutatta a ChatGPT Worköt, a ChatGPT új ügynökét, amely többórás, összetett munkafolyamatokat is képes kisebb lépésekre bontani és önállóan végrehajtani. Az…
ModellekFontos hírMegérkezett a GPT-5.6, három modellel és új ultra móddal
Az OpenAI általánosan elérhetővé tette a GPT-5.6 modellcsaládot, amelynek tagjai eltérő teljesítményre és költséghatékonyságra készültek. A csomag része a…

Az AI saját gondolatmenete nem mindig tükrözi, amit valójában számol
A nagy nyelvi modellek gondolatmenete, vagyis a Chain of Thought, nem mindig mutatja meg hűen, hogyan jutottak el a válaszhoz. Az Amii szerint ezért ez a szöveg nem…

A Salesforce kisebb, célzott modellekkel csökkenti az Agentforce költségeit
A Salesforce több, egy-egy feladatra optimalizált modellt épített be az Agentforce mögötti rendszerbe, hogy mérsékelje a következtetési költségeket és gyorsítsa az…

A Cognition bemutatta az SWE-1.7 kódoló modellt
A Cognition elindította az SWE-1.7-et, amelyet a vállalat eddigi legképességesebb modelljeként mutat be. A modell hosszabb, aszinkron szoftverfejlesztési feladatokra…
ModellekFontos hírGPT-Live érkezik, természetesebb beszélgetést ígér a ChatGPT Voice-ban
Az OpenAI bemutatta a GPT-Live hangmodelleket, amelyek egyszerre tudnak figyelni és beszélni, így természetesebb, gyorsabb párbeszédet tesznek lehetővé. A GPT-Live-1 és…

Nyílt forrású arab beszédfelismerő modellt adott ki a Cohere
A Cohere nyílt forrásúvá tette a Cohere Transcribe Arabic beszédfelismerő modellt, amelyet arab dialektusokra, kétnyelvű beszédre és vállalati használatra…

Az Antidoom módszerrel csökkentené a modellek végtelen ismétléseit a Liquid AI
A Liquid AI olyan célzott tanítási módszert mutatott be, amely a gondolkodó modellek ismétlődő szöveghurokjait, az úgynevezett doom loopokat mérsékli. Az Antidoom…

Az NVIDIA új módszerrel tartaná egyenletesen az LLM-ek tanítási teljesítményét
Az NVIDIA olyan kísérleti módszert mutatott be, amely átmeneti GPU-kiesések esetén dinamikusan módosítja a tenzorpárhuzamosítás mértékét. A Nonuniform Tensor Parallelism…

Az Apple LaCy módszere megtanítja a kis nyelvi modelleket segítséget kérni
Az Apple kutatói bemutatták a LaCy nevű előtanítási módszert, amely segít a kis nyelvi modelleknek eldönteni, mely tokeneket tanulják meg, és mikor kérjenek segítséget…

Az annotációk mérsékelhetik a nyelvi modellek sokféleségének összeomlását
Az annotációkra épülő tanítás mérsékelheti azt a sokféleségvesztést, amely a nyelvi modellek felügyelt finomhangolása után jelentkezik. Az Apple kutatói szerint…

Az Apple térképekkel segítené az LLM-ek viselkedési szabályainak tervezését
Az Apple kutatói Policy Maps néven olyan módszert mutattak be, amely térképszerű ábrázolással segíti a nagy nyelvi modellek viselkedésére vonatkozó szabályok…

Az Apple megosztott útválasztót javasol a beszédfelismerő MoE-modellekhez
Az Apple kutatói olyan Omni-router Transformer modellt mutattak be, amely a beszédfelismerésben több rétegen keresztül megosztja az útválasztási döntéseket. A kutatás…