Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Ai2 új, nyílt modellekkel és tudományos ügynökökkel jelentkezett

2026. október 9. 10:00Forrás: Ai2
Az Ai2 új, nyílt modellekkel és tudományos ügynökökkel jelentkezett
Kép: Ai2

Az Ai2 a COLM 2026 konferencián több nyílt kutatási eredményt mutatott be, köztük az Olmo Hybrid modellt, az AstaBrief tudományos eszközt és a Bolmo byte-alapú nyelvi modelljét. A nonprofit kutatólabor szerint a megosztott modellek, adatok, kódok és módszerek más kutatók számára is lehetővé teszik az eredmények vizsgálatát és továbbfejlesztését.

A lényeg röviden
  • Az Olmo Hybrid az MMLU teszten az Olmo 3 7B eredményét 49 százalékkal kevesebb tanítási tokennel érte el.
  • A következő Olmo modell hibrid, szakértőkeverékes architektúrával készül.
  • Az AstaBrief kutatási kérdésekből és szakirodalomból hivatkozott jelentéseket generál.
  • A Bolmo a szöveget alkotó bájtokkal dolgozik a részszavas tokenek helyett.
  • Az Ai2 az Olmo-core 3 kódját, modell-ellenőrzőpontokat és technikai anyagokat is megoszt.

Az Olmo Hybrid kevesebb tanítási adattal érte el ugyanazt az eredményt

Az Ai2 október 9-i beszámolója szerint a COLM 2026 konferencián mutatták be az Olmo Hybrid: From Theory to Practice and Back című tanulmányt. A kutatás azt vizsgálja, mi történik akkor, ha egy nyelvi modell a transzformer alapú figyelmi mechanizmust (attention) lineáris rekurens rétegekkel kombinálja.

A figyelmi mechanizmus a korábbi szöveg konkrét részleteinek visszakeresésében segít, míg a rekurens rétegek tömör állapotot tartanak fenn, amely a szöveges tokenek feldolgozásakor folyamatosan frissül. A tanulmány elméleti elemzéseket és ellenőrzött tanítási kísérleteket kapcsol össze.

Az Ai2 szerint az Olmo Hybrid bizonyítékot szolgáltat arra, hogy a figyelem és a rekurencia kombinációja hatékonyabb tanítást tehet lehetővé. A vizsgálatban a modell az MMLU, több tudományterület ismereteit mérő teszten, az Olmo 3 7B-vel azonos pontosságot ért el 49 százalékkal kevesebb tanítási token felhasználásával.

Készül a következő Olmo modell

Az Ai2 közlése szerint az Olmo Hybrid kutatási eredményei segítik a következő Olmo modell fejlesztését. Ez a modell jelenleg előtanítás alatt áll, és hibrid, szakértőkeverékes architektúrát használ.

A szakértőkeverékes, vagyis mixture-of-experts megközelítés a modell egyes komponensei közül csak egy részhalmazon vezeti át az adott tokent. Az Ai2 ezt az elrendezést a hatékonyság javításának egyik lehetséges eszközeként írja le.

A labor a fejlesztéshez kapcsolódó infrastruktúrát is megnyitotta. A COLM előtt kiadott Olmo-core 3 egy áttervezett rendszert ad nagy szakértőkeverékes modellek tanításához. A kutatók ezt saját modellek fejlesztésére és a tanítási döntések vizsgálatára használhatják. A kód mellett az Olmo ökoszisztémájában ellenőrzőpontok és technikai jelentések is elérhetők.

Az Ai2 beszámolója szerint a Google nemrég MaxTextben, Google Cloud TPU-kon is újra létrehozta az Olmo 3 7B tanítási futását. A labor ezt a teljesen nyílt megközelítés által lehetővé tett reprodukálhatóság példájaként emeli ki.

Tudományos munkára fejlesztik az Asta platformot

Az Ai2 a COLM-on az ügynöki képességekkel rendelkező tudományos eszközökről is beszámolt. A labor szerint az ilyen rendszereket a tudósokkal együttműködésben kell kialakítani, miközben a képességeiket és a korlátaikat egyaránt vizsgálni kell. Ezen az irányon dolgozik az Asta, az Ai2 tudományos munkára szánt ügynöki platformja.

A közelmúltban kiadott AstaBrief nyílt súlyokkal rendelkező modell. Kutatási kérdésekből és a megkeresett szakirodalomból hivatkozásokkal ellátott jelentéseket készít. A tudósok az Asta Fast módjában használhatják, vagy letölthetik a modellt, hogy saját infrastruktúrájukon futtassák.

Az Ai2 közvetlenül tudományos közösségekkel is együttműködik annak feltérképezésére, hogy az általános célú modellek hol teljesítenek gyengén, és milyen képességeket kellene támogatniuk a jövő nyílt modelljeinek.

A Bolmo a karaktereket alkotó bájtokkal dolgozik

A konferencia idején a Bolmo alapjául szolgáló kutatás a Nature folyóiratban is megjelent. A tanulmány címe Retrofitting language models to operate over bytes. A legtöbb nyelvi modell előre meghatározott szókészletből származó egységekre bontja a szöveget. A Bolmo ehelyett a karaktereket reprezentáló alapvető bájtokkal dolgozik.

Az Ai2 szerint ez lehetővé teszi olyan részletek kezelését, amelyeket a részszavas tokenizálás elrejthet. A tanulmány bemutatja, hogyan alakítható át egy meglévő nyelvi modell erre a működésre viszonylag rövid további tanítási futással. A labor a Nature-publikáció mellett további ellenőrzőpontokat is kiadott, hogy a kutatók maguk kísérletezhessenek az architektúrával.

A COLM 2026-on bemutatott modellek és eszközök közös jellemzője, hogy az Ai2 a kapcsolódó anyagokat is megosztja. A nonprofit labor célja saját megfogalmazása szerint olyan kutatási eredmények létrehozása, amelyeket mások tanulmányozhatnak, ellenőrizhetnek és továbbfejleszthetnek.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A Nature-ben jelent meg az Ai2 byte-alapú nyelvi modelljeinek kutatása
Kutatás2026. október 7. 10:00

A Nature-ben jelent meg az Ai2 byte-alapú nyelvi modelljeinek kutatása

Az Ai2 kutatása a nyelvi modellek byte-alapúvá alakítását vizsgálja, a módszert pedig most a Nature folyóiratban is bemutatták. A szervezet új ellenőrzőpontokat tett…

Az Ai2 megnyitotta az AstaBrief tudományos jelentéskészítő modellt
Modellek2026. október 2. 10:00

Az Ai2 megnyitotta az AstaBrief tudományos jelentéskészítő modellt

Az Ai2 nyílt súlyokkal és a tanításához használt adatokkal együtt tette közzé az AstaBrief 8B modellt, amely tudományos kérdésekből és visszakeresett szakirodalmi…

Az Ai2 megnyitotta az Olmo-core 3 MoE-képzési rendszerét
Fejlesztőknek2026. október 1. 10:00

Az Ai2 megnyitotta az Olmo-core 3 MoE-képzési rendszerét

Az Ai2 kiadta az Olmo-core 3-at, a nagy kevert szakértői modellek, vagyis MoE-k képzésére fejlesztett nyílt infrastruktúrát. A rendszerrel 1,2 billió paraméteres modellt…