Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple 14 nyelvre készített matematikai adathalmazt az RLVR-kutatáshoz

2026. augusztus 18.Forrás: Apple
Az Apple 14 nyelvre készített matematikai adathalmazt az RLVR-kutatáshoz
Kép: Apple

Az Apple kutatói bemutatták a mAceReason-Math adathalmazt, amely nehéz matematikai feladatok kiváló minőségű fordításait gyűjti össze 14 nyelven. A nyelvenként több mint 10 000 mintát tartalmazó készletet többnyelvű, ellenőrizhető jutalmazású megerősítéses tanuláshoz, vagyis RLVR-hez szánják.

A lényeg röviden
  • A mAceReason-Math 14 nyelven tartalmaz matematikai feladatokat.
  • Nyelvenként több mint 10 000 minta érhető el.
  • A feladatok az AceReason-Math RLVR-korpuszából származnak.
  • A fordításokat megtisztították és tovább javították.
  • Az adathalmazt többnyelvű RLVR-kutatáshoz és értékeléshez szánják.

A jelenlegi adathalmazok főként angol nyelvűek

Az Apple kutatási oldala szerint az ellenőrizhető jutalmazású megerősítéses tanulás, angolul Reinforcement Learning with Verifiable Rewards, sikeresen növelte az előre betanított nagy nyelvi modellek képességeit, különösen a matematika és a logikai feladatok területén. A módszerben a modell olyan visszajelzést kap, amelynek helyessége ellenőrizhető.

A kutatók szerint ugyanakkor a jelenlegi kutatások és a hozzájuk elérhető tanítási adathalmazok továbbra is erősen angolközpontúak. Korábban is készültek többnyelvű tanítási adatok és értékelési készletek, ezeket azonban nem az RLVR-hez és a jelenlegi modellek képességszintjéhez tervezték. A feladatok nehézsége sok esetben túl alacsony ahhoz, hogy megfelelő tanítási jelet adjon a mai modelleknek.

Nehéz matematikai feladatok 14 nyelven

Az Apple kutatói ennek a hiánynak a betöltésére hozták létre a mAceReason-Math adathalmazt. A készlet az AceReason-Math nevű, kifejezetten RLVR-hez összeállított korpuszból származó, kihívást jelentő matematikai feladatok kiváló minőségű fordításait tartalmazza.

A fordításokat a kutatók külön megtisztították és tovább javították. Az eredmény 14 nyelvre terjed ki, nyelvenként több mint 10 000 mintával. A forrás szerint a projekt célja, hogy a kutatási közösség számára elérhetővé tegye az adathalmazt a többnyelvű RLVR-kutatás és a modellek összehasonlító értékelésének támogatására.

A tanulmány szerzői Konstantin Dobler, Simon Lehnerer, Federico Scozzafava, Jonathan Janke és Mohamed Ali. Dobler a Hasso Plattner Institute és az ELLIS Unit Potsdam munkatársa, a forrás pedig jelzi, hogy a szerzők közül többen egyenlő mértékben járultak hozzá a munkához. A kutatási oldal a publikációt 2026 márciusára datálja, és forráskódot is kínál a projekthez.

Az RLVR többnyelvű kiterjesztése a következő kutatási irány

Az Apple kapcsolódó kutatásai azt mutatják, hogy a vállalat a többnyelvű következtetés fejlesztését az RLVR-en belül is vizsgálja. A módszert gyakran a Group Relative Policy Optimization, röviden GRPO nevű optimalizálással használják. Az Apple szerint a GRPO az előre betanított nyelvi modellek következtetési képességeinek javításának egyik központi eljárásává vált, miközben a vizsgálatok továbbra is nagyrészt az angolra összpontosítanak.

A vállalat egy nagyszabású empirikus tanulmányban különböző alapmodelleken, tanítási nyelveken és következtetési nyelvi jutalmazási módszereken vizsgálja a többnyelvű és nem angol nyelvű GRPO-t. Egy másik kapcsolódó projekt, a Multilingual Reasoning Gym, 14 nyelven generál ellenőrizhető következtetési feladatokat. A kutatók 94 feladathoz fordítottak sablonokat, 10 nyelven pedig anyanyelvi beszélők ellenőrzését is alkalmazták.

A mAceReason-Math így olyan kutatási infrastruktúrát adhat a közösségnek, amely a nehéz matematikai feladatokon keresztül teszi vizsgálhatóvá az RLVR többnyelvű használatát. A készlet nyilvánossá tétele elsősorban a kutatók számára jelent új eszközt a többnyelvű modellek tanításához és összehasonlításához.

ApplemAceReason-MathAceReason-MathRLVRnyelvi modellekkutatási eredménybenchmark

Kapcsolódó hírek

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói egy tanítás nélküli, ABX-alapú módszercsaládot mutattak be a többnyelvű nyelvi modellek vizsgálatára. A megközelítés azt méri, hogy a modellek mennyire…

Az Apple szerint a nyelvi modellek kommunikációja veszteséges
Kutatás2026. szeptember 29.

Az Apple szerint a nyelvi modellek kommunikációja veszteséges

Az Apple kutatása szerint a nyelvi modellek természetes nyelven folytatott kommunikációja jelentős információveszteséggel jár, amikor fa struktúrájú adatokat kell…

Az Apple szerint a nyelvi modellek kommunikációja veszteséges
Kutatás2026. szeptember 29.

Az Apple szerint a nyelvi modellek kommunikációja veszteséges

Az Apple kutatói azt vizsgálták, mennyire marad meg a fastruktúrájú információ, amikor a nyelvi modellek természetes nyelven adják tovább egymásnak. Eredményeik szerint…