Az Ai2 új, nyílt modellekkel és tudományos ügynökökkel jelentkezett

Az Ai2 a COLM 2026 konferencián több nyílt kutatási eredményt mutatott be, köztük az Olmo Hybrid modellt, az AstaBrief tudományos eszközt és a Bolmo byte-alapú nyelvi modelljét. A nonprofit kutatólabor szerint a megosztott modellek, adatok, kódok és módszerek más kutatók számára is lehetővé teszik az eredmények vizsgálatát és továbbfejlesztését.
- Az Olmo Hybrid az MMLU teszten az Olmo 3 7B eredményét 49 százalékkal kevesebb tanítási tokennel érte el.
- A következő Olmo modell hibrid, szakértőkeverékes architektúrával készül.
- Az AstaBrief kutatási kérdésekből és szakirodalomból hivatkozott jelentéseket generál.
- A Bolmo a szöveget alkotó bájtokkal dolgozik a részszavas tokenek helyett.
- Az Ai2 az Olmo-core 3 kódját, modell-ellenőrzőpontokat és technikai anyagokat is megoszt.
Az Olmo Hybrid kevesebb tanítási adattal érte el ugyanazt az eredményt
Az Ai2 október 9-i beszámolója szerint a COLM 2026 konferencián mutatták be az Olmo Hybrid: From Theory to Practice and Back című tanulmányt. A kutatás azt vizsgálja, mi történik akkor, ha egy nyelvi modell a transzformer alapú figyelmi mechanizmust (attention) lineáris rekurens rétegekkel kombinálja.
A figyelmi mechanizmus a korábbi szöveg konkrét részleteinek visszakeresésében segít, míg a rekurens rétegek tömör állapotot tartanak fenn, amely a szöveges tokenek feldolgozásakor folyamatosan frissül. A tanulmány elméleti elemzéseket és ellenőrzött tanítási kísérleteket kapcsol össze.
Az Ai2 szerint az Olmo Hybrid bizonyítékot szolgáltat arra, hogy a figyelem és a rekurencia kombinációja hatékonyabb tanítást tehet lehetővé. A vizsgálatban a modell az MMLU, több tudományterület ismereteit mérő teszten, az Olmo 3 7B-vel azonos pontosságot ért el 49 százalékkal kevesebb tanítási token felhasználásával.
Készül a következő Olmo modell
Az Ai2 közlése szerint az Olmo Hybrid kutatási eredményei segítik a következő Olmo modell fejlesztését. Ez a modell jelenleg előtanítás alatt áll, és hibrid, szakértőkeverékes architektúrát használ.
A szakértőkeverékes, vagyis mixture-of-experts megközelítés a modell egyes komponensei közül csak egy részhalmazon vezeti át az adott tokent. Az Ai2 ezt az elrendezést a hatékonyság javításának egyik lehetséges eszközeként írja le.
A labor a fejlesztéshez kapcsolódó infrastruktúrát is megnyitotta. A COLM előtt kiadott Olmo-core 3 egy áttervezett rendszert ad nagy szakértőkeverékes modellek tanításához. A kutatók ezt saját modellek fejlesztésére és a tanítási döntések vizsgálatára használhatják. A kód mellett az Olmo ökoszisztémájában ellenőrzőpontok és technikai jelentések is elérhetők.
Az Ai2 beszámolója szerint a Google nemrég MaxTextben, Google Cloud TPU-kon is újra létrehozta az Olmo 3 7B tanítási futását. A labor ezt a teljesen nyílt megközelítés által lehetővé tett reprodukálhatóság példájaként emeli ki.
Tudományos munkára fejlesztik az Asta platformot
Az Ai2 a COLM-on az ügynöki képességekkel rendelkező tudományos eszközökről is beszámolt. A labor szerint az ilyen rendszereket a tudósokkal együttműködésben kell kialakítani, miközben a képességeiket és a korlátaikat egyaránt vizsgálni kell. Ezen az irányon dolgozik az Asta, az Ai2 tudományos munkára szánt ügynöki platformja.
A közelmúltban kiadott AstaBrief nyílt súlyokkal rendelkező modell. Kutatási kérdésekből és a megkeresett szakirodalomból hivatkozásokkal ellátott jelentéseket készít. A tudósok az Asta Fast módjában használhatják, vagy letölthetik a modellt, hogy saját infrastruktúrájukon futtassák.
Az Ai2 közvetlenül tudományos közösségekkel is együttműködik annak feltérképezésére, hogy az általános célú modellek hol teljesítenek gyengén, és milyen képességeket kellene támogatniuk a jövő nyílt modelljeinek.
A Bolmo a karaktereket alkotó bájtokkal dolgozik
A konferencia idején a Bolmo alapjául szolgáló kutatás a Nature folyóiratban is megjelent. A tanulmány címe Retrofitting language models to operate over bytes. A legtöbb nyelvi modell előre meghatározott szókészletből származó egységekre bontja a szöveget. A Bolmo ehelyett a karaktereket reprezentáló alapvető bájtokkal dolgozik.
Az Ai2 szerint ez lehetővé teszi olyan részletek kezelését, amelyeket a részszavas tokenizálás elrejthet. A tanulmány bemutatja, hogyan alakítható át egy meglévő nyelvi modell erre a működésre viszonylag rövid további tanítási futással. A labor a Nature-publikáció mellett további ellenőrzőpontokat is kiadott, hogy a kutatók maguk kísérletezhessenek az architektúrával.
A COLM 2026-on bemutatott modellek és eszközök közös jellemzője, hogy az Ai2 a kapcsolódó anyagokat is megosztja. A nonprofit labor célja saját megfogalmazása szerint olyan kutatási eredmények létrehozása, amelyeket mások tanulmányozhatnak, ellenőrizhetnek és továbbfejleszthetnek.


