Az Apple 14 nyelvre készített matematikai adathalmazt az RLVR-kutatáshoz

Az Apple kutatói bemutatták a mAceReason-Math adathalmazt, amely nehéz matematikai feladatok kiváló minőségű fordításait gyűjti össze 14 nyelven. A nyelvenként több mint 10 000 mintát tartalmazó készletet többnyelvű, ellenőrizhető jutalmazású megerősítéses tanuláshoz, vagyis RLVR-hez szánják.
- A mAceReason-Math 14 nyelven tartalmaz matematikai feladatokat.
- Nyelvenként több mint 10 000 minta érhető el.
- A feladatok az AceReason-Math RLVR-korpuszából származnak.
- A fordításokat megtisztították és tovább javították.
- Az adathalmazt többnyelvű RLVR-kutatáshoz és értékeléshez szánják.
A jelenlegi adathalmazok főként angol nyelvűek
Az Apple kutatási oldala szerint az ellenőrizhető jutalmazású megerősítéses tanulás, angolul Reinforcement Learning with Verifiable Rewards, sikeresen növelte az előre betanított nagy nyelvi modellek képességeit, különösen a matematika és a logikai feladatok területén. A módszerben a modell olyan visszajelzést kap, amelynek helyessége ellenőrizhető.
A kutatók szerint ugyanakkor a jelenlegi kutatások és a hozzájuk elérhető tanítási adathalmazok továbbra is erősen angolközpontúak. Korábban is készültek többnyelvű tanítási adatok és értékelési készletek, ezeket azonban nem az RLVR-hez és a jelenlegi modellek képességszintjéhez tervezték. A feladatok nehézsége sok esetben túl alacsony ahhoz, hogy megfelelő tanítási jelet adjon a mai modelleknek.
Nehéz matematikai feladatok 14 nyelven
Az Apple kutatói ennek a hiánynak a betöltésére hozták létre a mAceReason-Math adathalmazt. A készlet az AceReason-Math nevű, kifejezetten RLVR-hez összeállított korpuszból származó, kihívást jelentő matematikai feladatok kiváló minőségű fordításait tartalmazza.
A fordításokat a kutatók külön megtisztították és tovább javították. Az eredmény 14 nyelvre terjed ki, nyelvenként több mint 10 000 mintával. A forrás szerint a projekt célja, hogy a kutatási közösség számára elérhetővé tegye az adathalmazt a többnyelvű RLVR-kutatás és a modellek összehasonlító értékelésének támogatására.
A tanulmány szerzői Konstantin Dobler, Simon Lehnerer, Federico Scozzafava, Jonathan Janke és Mohamed Ali. Dobler a Hasso Plattner Institute és az ELLIS Unit Potsdam munkatársa, a forrás pedig jelzi, hogy a szerzők közül többen egyenlő mértékben járultak hozzá a munkához. A kutatási oldal a publikációt 2026 márciusára datálja, és forráskódot is kínál a projekthez.
Az RLVR többnyelvű kiterjesztése a következő kutatási irány
Az Apple kapcsolódó kutatásai azt mutatják, hogy a vállalat a többnyelvű következtetés fejlesztését az RLVR-en belül is vizsgálja. A módszert gyakran a Group Relative Policy Optimization, röviden GRPO nevű optimalizálással használják. Az Apple szerint a GRPO az előre betanított nyelvi modellek következtetési képességeinek javításának egyik központi eljárásává vált, miközben a vizsgálatok továbbra is nagyrészt az angolra összpontosítanak.
A vállalat egy nagyszabású empirikus tanulmányban különböző alapmodelleken, tanítási nyelveken és következtetési nyelvi jutalmazási módszereken vizsgálja a többnyelvű és nem angol nyelvű GRPO-t. Egy másik kapcsolódó projekt, a Multilingual Reasoning Gym, 14 nyelven generál ellenőrizhető következtetési feladatokat. A kutatók 94 feladathoz fordítottak sablonokat, 10 nyelven pedig anyanyelvi beszélők ellenőrzését is alkalmazták.
A mAceReason-Math így olyan kutatási infrastruktúrát adhat a közösségnek, amely a nehéz matematikai feladatokon keresztül teszi vizsgálhatóvá az RLVR többnyelvű használatát. A készlet nyilvánossá tétele elsősorban a kutatók számára jelent új eszközt a többnyelvű modellek tanításához és összehasonlításához.


