Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Nature-ben jelent meg az Ai2 byte-alapú nyelvi modelljeinek kutatása

2026. október 7. 10:00Forrás: Ai2
A Nature-ben jelent meg az Ai2 byte-alapú nyelvi modelljeinek kutatása
Kép: Ai2

Az Ai2 kutatása a nyelvi modellek byte-alapúvá alakítását vizsgálja, a módszert pedig most a Nature folyóiratban is bemutatták. A szervezet új ellenőrzőpontokat tett közzé a Hugging Face-en, köztük Qwen 3 és Llama 3 alapú változatokat.

A lényeg röviden
  • Az Ai2 byte-alapú nyelvi modelljeiről szóló kutatás megjelent a Nature-ben.
  • A byteifying meglévő, részszavakon alapuló modelleket alakít byte-alapúvá.
  • A Bwen 8B és a Blama 8B Qwen 3 8B, illetve Llama 3 8B alapú modellek.
  • Az új ellenőrzőpontok a Hugging Face-en érhetők el.
  • A byte-alapú megközelítés később képek és hangok feldolgozására is alkalmazható lehet.

A szövegek feldolgozásának másik útja

A legtöbb nyelvi modell a szöveget először részszavakra bontja. Ezek a szódarabok egy előre rögzített szókészletből származnak, és ez a megközelítés sok feladaton jól működik. Ugyanakkor nehezebbé teheti a helyesírási eltérések, a szokatlan karakterláncok, a ritka szavak, illetve az előre meghatározott darabokra nehezen felbontható szövegek kezelését.

A byte-alapú modellek ehelyett a karakterek számítógépes reprezentációjául szolgáló byte-okkal dolgoznak. A betűk, írásjelek, szimbólumok és más karakterek byte-sorozatok formájában kerülnek a modell elé. Az Ai2 szerint ez segíthet a szöveg finomabb szerkezetének megértésében, például a szóközök és a különböző írásrendszerek kezelésében, miközben a modell nem kötődik egy rögzített szókészlethez.

A byte-osítás meglévő modellekből indul

A byte-alapú modellek korábban jellemzően teljesen új, az alapoktól induló tanítást igényeltek. Ez költséges folyamat, és megnehezíti, hogy a byte-alapú megközelítések lépést tartsanak a gyorsan fejlődő, részszavakat használó modellekkel.

Az Ai2 erre egy byteifying nevű eljárást dolgozott ki. Ennek során egy már működőképes, részszavakon alapuló modellt alakítanak át byte-alapúvá egy viszonylag rövid kiegészítő tanítási futtatással. Az Ai2 korábban a saját, nyílt Olmo modelljeiből hozta létre a Bolmo 1B és Bolmo 7B modelleket. A szervezet közlése szerint ezek voltak az első teljesen nyílt byte-alapú nyelvi modellek, amelyek széles feladatkörben versenyképesek voltak erős, részszavakat használó modellekkel.

Új modellek Qwen 3 és Llama 3 alapokon

A Nature-ben megjelent tanulmány azt mutatja be, hogy a módszer az Olmón túl más modellcsaládokra is kiterjeszthető. Az Ai2 a Qwen 3 8B és a Llama 3 8B modelleken is alkalmazta az eljárást. Így jött létre a Bwen 8B és a Blama 8B.

A közlemény szerint mindkét új modell megközelíti azt a teljesítményt, amelyet az alapjául szolgáló modellek nyújtanak. Az Ai2 értékelése alapján a Bwen 8B lett a szervezet eddigi legerősebb byte-osított modellje, és az összesített értékelési csomagban felülmúlta a Bolmo 7B-t.

Az Ai2 2026. október 7-én új ellenőrzőpontokat tett közzé a Hugging Face-en. Ezek között Stage 1 ellenőrzőpontok is vannak. Ezeknél az eredeti globális modell változatlan marad, miközben a Bolmo új byte-alapú komponenseit tanítják, ami a szervezet szerint gyorsabb kiindulópontot adhat a kutatóknak az architektúra vizsgálatához és továbbfejlesztéséhez.

Kutatási alap nyelvi és más adatokhoz

A Bolmo iránt már most is vannak alkalmazási kísérletek. Az Ai2 példaként egy orosz és angol nyelvű költészeti és dalszövegfordításhoz finomhangolt Bolmo 7B változatot említ. Más kutatók byte-alapú modellek közötti képességátvitelt vizsgálnak, illetve a Bolmo hierarchikus byte-architektúrájának hatékonyságát hasonlítják össze a részletes karakteralapú megértéssel.

Az Ai2 szerint a byte-ok azért is lehetnek fontosak, mert a digitális adatok alapvető reprezentációját jelentik. Emiatt a byte-alapú modellezés idővel képekhez és hangokhoz hasonló más adattípusokra is kiterjedhet. A szervezet teljesen nyílt modelljeivel és képzési receptjével azt szeretné elérni, hogy a kutatók ellenőrizhessék, reprodukálhassák és továbbépíthessék az eredményeket, anélkül hogy minden új architektúrához meg kellene ismételniük a teljes tanítás költségét.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az Ai2 megnyitotta az AstaBrief tudományos jelentéskészítő modellt
Modellek2026. október 2. 10:00

Az Ai2 megnyitotta az AstaBrief tudományos jelentéskészítő modellt

Az Ai2 nyílt súlyokkal és a tanításához használt adatokkal együtt tette közzé az AstaBrief 8B modellt, amely tudományos kérdésekből és visszakeresett szakirodalmi…

Az Ai2 megnyitotta az Olmo-core 3 MoE-képzési rendszerét
Fejlesztőknek2026. október 1. 10:00

Az Ai2 megnyitotta az Olmo-core 3 MoE-képzési rendszerét

Az Ai2 kiadta az Olmo-core 3-at, a nagy kevert szakértői modellek, vagyis MoE-k képzésére fejlesztett nyílt infrastruktúrát. A rendszerrel 1,2 billió paraméteres modellt…

Thai nyelvre szabták az Ai2 Dolma eszközét a jobb LLM-adatokért
Kutatás2026. augusztus 26. 10:00

Thai nyelvre szabták az Ai2 Dolma eszközét a jobb LLM-adatokért

Az Ai2 2026. augusztus 26-án számolt be arról, hogy thai kutatók a Dolma nyílt adatgondozási eszköztárra építve hozták létre a Mangosteen nevű, 47 milliárd tokenes thai…