Thai nyelvre szabták az Ai2 Dolma eszközét a jobb LLM-adatokért

Az Ai2 2026. augusztus 26-án számolt be arról, hogy thai kutatók a Dolma nyílt adatgondozási eszköztárra építve hozták létre a Mangosteen nevű, 47 milliárd tokenes thai előtanítási korpuszt. A munka célja az volt, hogy a thai nyelv sajátosságaihoz jobban illeszkedő adatfolyamat készüljön nyelvi modellek tanításához.
- A thai kutatók a Dolmára építve készítették el a 47 milliárd tokenes Mangosteen korpuszt.
- A Dolma nyílt eszköztárként nemcsak adatokat, hanem módosítható adatgondozási folyamatot ad.
- A thai nyelv mondathatárai miatt több szűrési lépést át kellett alakítani.
- A folyamat a Common Crawl adatok több mint 80 százalékát és a FineWeb2 közel felét eltávolította.
- A Mangosteenen tanított modellek erősebb thai kulturális tudást mutattak a forrás szerint.
Nyílt eszköztárból thai korpusz
Az Ai2 a Dolmát azért tette nyílttá, hogy a kutatók ne csak kész adathalmazokat kapjanak, hanem magát az adatgondozási folyamatot is vizsgálhassák, módosíthassák és saját igényeikhez igazíthassák. A Dolmát az Ai2 a nagy léptékű szöveges tanítóadatok összeállítására készítette, többek között saját nyílt Olmo modelljeihez.
A Mangosteen projektben egy thai kutatócsoport ezt az eszközt használta alapként egy 47 milliárd tokenes thai előtanítási korpuszhoz. A forrás szerint a nyilvánosan elérhető thai előtanítási adathalmazokat korábban nem ellenőrizték széles körben thai anyanyelvűek, és sokszor főként webes begyűjtésekre épültek.
A kutatók úgy találták, hogy egyes meglévő adathalmazok tartalmaztak általuk tanításra alkalmatlannak tartott szövegeket, miközben fontos thai források hiányoztak belőlük. Ilyen forrásként az Ai2 blogja könyveket, kutatási cikkeket, hivatalos weboldalakat és YouTube-feliratokat említ.
Miért kellett módosítani a folyamatot
Wannaphong Phatthiyaphaibun, a projekt egyik vezetője és a Vidyasirimedhi Institute of Science and Technology, VISTEC PhD-hallgatója az Ai2-nek azt mondta: „Nincs elég fejlesztőnk ahhoz, hogy a nulláról építsünk adatgondozási folyamatot.” A Dolma ezért kész kiindulópontot adott a nyers szövegek tanítóadattá alakításához.
A thai nyelvre igazítás során a kutatók azt látták, hogy a folyamat több részét át kell tervezni. A mondat és bekezdés szintű duplikációszűrés például szinte az összes adatukat eltávolította, mert a thai nem ugyanúgy jelöli a mondathatárokat, mint az angol.
A csapat megtartotta azokat az elemeket, amelyek működtek, például a dokumentum és URL szintű duplikációszűrést, más lépéseket viszont átalakított. Módosítottak bizonyos minőségi szűrőket, lecseréltek nyelvspecifikus eszközöket, és szabályokat adtak hozzá a thai webes adatokban gyakori mintákhoz. Ilyen probléma volt, hogy egyes thai híroldalak csak csonkolt részleteket tartalmaztak, amelyeket „Read More” felszólítás követett, ezért külön szűrés kellett a hiányos cikkek eltávolítására.
Kevesebb adatból is jobb vagy azonos teljesítmény
Az átalakítás eredménye lett a Mangosteen, amelyet kifejezetten a thai nyelvi modellezés igényeihez terveztek. A thai LLM-ekkel végzett kísérletekben a kutatók azt találták, hogy a gondozási folyamat a kiinduló Common Crawl adatok több mint 80 százalékát, a FineWeb2 adatoknak pedig közel a felét el tudta távolítani.
Az Ai2 beszámolója szerint mindez úgy történt, hogy a Mangosteenen tanított modellek a nagyobb adathalmazokon tanított modellekhez képest megőrizték vagy javították a teljesítményt. A FineWeb2-t a forrás nagy, már tisztított és modellképzésre gondozott webes adatgyűjteményként írja le.
A javulás nagyobb modelleknél is megjelent. A Mangosteenen tanított modellek erősebb eredményeket mutattak thai kulturális tudást mérő értékeléseken. A kutatócsoport ezt annak jeleként értelmezi, hogy a helyileg releváns adatok segíthetnek a modelleknek jobban képviselni azokat a közösségeket, amelyeket szolgálnak.
Mit jelenthet ez a felhasználóknak és a kutatóknak
A projekt fő tanulsága az Ai2 szerint az, hogy a kutatóknak nemcsak modellekre és adathalmazokra, hanem az azokat formáló eszközökre is szükségük van. A nyílt adatgondozási folyamat lehetővé tette, hogy a thai csapat saját nyelvi és helyi tudását építse be a tanítóadatok előállításába.
Phatthiyaphaibun az Ai2-nek úgy fogalmazott: „A Dolma nyílt forrású jellege lehetővé teszi, hogy ellenőrizzük, módosítsuk, teszteljük és reprodukáljuk az eredményeket a saját nyelvünkre.” Hozzátette, hogy a nyíltság lehetővé tette számukra olyan tanítóadat létrehozását, „amely a helyi közösségünket szolgálja, miközben hozzájárul a globális LLM-fejlesztéshez.”
A Mangosteen példája alapján a nyílt eszközök különösen fontosak lehetnek azoknál a nyelveknél, ahol a kész, általános webes adathalmazok nem fedik le jól a helyi nyelvi és kulturális tartalmakat.


