Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

RISED, új módszer több környezetben tanuló AI-ügynökök képzésére

2026. október 6.Forrás: Apple
RISED, új módszer több környezetben tanuló AI-ügynökök képzésére
Kép: Apple

Az Apple bemutatta a RISED nevű módszert, amely szöveges viselkedési rubrikákat használ a több interaktív környezetben tanuló nagy nyelvi modell alapú ügynökök képzéséhez. A rendszer az adatkiválasztást és az önlepárlással végzett felügyeletet is ezekre a rubrikákra építi.

A lényeg röviden
  • Az Apple RISED néven új, rubrikaalapú tanítási módszert mutatott be.
  • A rendszer egy LLM-értékelővel címkézi a próbálkozásokat közös viselkedési rubrikák alapján.
  • A pozitív rubrikák tokenenkénti felügyeletet adnak az önlepárláshoz.
  • A negatív rubrikák a visszatérő hibaminták elkerülését irányítják.
  • Az Apple szerint a RISED több modellalappal a legmagasabb átlagos sikerességi arányt érte el.

A több környezetben végzett tanítás problémája

Egyetlen nagy nyelvi modell alapú ügynök közös tanítása több, egymástól eltérő interaktív környezetben fontos irány a sokoldalú ügynökök fejlesztésében. Az Apple kutatása szerint a korábbi tanterv- és adatválasztási stratégiák gyakran környezeti szinten osztják el a tanítási adatokat, vagy a helyi jutalmakra támaszkodnak.

Ez a megközelítés kevés információt ad arról, hogyan viszonyulnak egymáshoz a különböző környezetekben létrejött aktuális próbálkozások. További gond, hogy a környezetek eltérő ütemben tanulnak. Emiatt egyetlen adagelegen belül egyszerre lehetnek olyan próbálkozáscsoportok, amelyek minden esetben sikertelenek, és olyanok is, amelyek minden esetben sikeresek. Ha egy csoporton belül minden jutalom azonos, hiányzik a csoporton belüli összehasonlításból származó jelzés.

Az Apple szerint a skaláris jutalmak önmagukban ezért korlátozottan használhatók több környezetben végzett megerősítéses tanulásnál. Nem mutatják meg megfelelően a környezetek közötti kapcsolatokat, és azonos jutalmak esetén nem biztosítanak kontrasztot egy csoporton belül.

Rubrikák az adatválasztásban és a felügyeletben

A RISED, vagyis a Rubrics for Agentic Multi-Environment Selection and Self-Distillation szöveges visszajelzésekkel egészíti ki a jutalmazást. A módszerben egy nagy nyelvi modell alapú értékelő minden próbálkozást előre meghatározott, a különböző környezetekben közösen használt rubrikaszókészlet alapján címkéz.

Az így létrejövő profilok megmutatják az összekevert környezeteket tartalmazó tanítási adag viselkedési összetételét. Ezek alapján a rendszer olyan adatokat választ ki, amelyek illeszkednek az adott összetételhez, miközben korlátozza a már kiválasztott adatokkal való átfedést. A rubrikák tehát nem pusztán jutalomként jelennek meg, hanem az online adatválasztást is irányítják.

A módszer a pozitív és negatív rubrikákat eltérő módon használja. A kívánatos viselkedést leíró pozitív rubrikák további, privilegizált kontextust biztosítanak az önirányított, on-policy önlepárlással működő tanár számára. Ez tokenenkénti felügyeletet ad a tanításhoz. A nem kívánatos viselkedést leíró negatív rubrikák a következő próbálkozások létrehozását úgy irányítják, hogy az ügynök eltávolodjon a visszatérő hibamintáktól.

Az Apple eredményei

Az Apple közlése szerint a RISED több modellalappal végzett vizsgálatokban a környezetekre számított átlagos sikerességi arány tekintetében érte el a legjobb eredményt. A módszer minden egyes környezetben az első vagy a második helyen végzett.

A kutatók szerint a rubrikákra épülő elemzés azt is lehetővé teszi, hogy jellemezzék, milyen viselkedésbeli változások kísérik ezeket a javulásokat. Ez különbséget jelent ahhoz képest, amikor a teljesítményt kizárólag egyetlen skaláris jutalom alapján értékelik.

A tanulmány szerzői Jingtan Wang, Sirajul Salekin, Young mok Jung, Javier Movellan, Bryan Kian Hsiang Low és Manjot Bilkhu. Jingtan Wang és Bryan Kian Hsiang Low a National University of Singapore-hoz kötődik, a közlemény szerint a munka egy része Apple-nél készült.

Mit jelenthet a módszer a fejlesztőknek?

A RISED az Apple kutatása alapján olyan képzési folyamatot kínál, amelyben a különböző környezetekből érkező próbálkozások összehasonlítása és a viselkedés szöveges leírása is szerepet kap. A pozitív és negatív rubrikák egyaránt bekapcsolódnak a tanításba: az előbbiek részletesebb felügyeletet adnak, az utóbbiak pedig a visszatérő hibák elkerülését segítik.

A módszer eredményei azt mutatják, hogy a rubrikák az Apple szerint javíthatják a teljesítményt több környezetben tanuló ügynökök esetén. A kutatás középpontjában ezért nem egyetlen feladat, hanem a különböző interaktív környezetek közös kezelése, az adatok kiválasztása és az ügynök viselkedésének finomabb elemzése áll.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói egy tanítás nélküli, ABX-alapú módszercsaládot mutattak be a többnyelvű nyelvi modellek vizsgálatára. A megközelítés azt méri, hogy a modellek mennyire…

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket
Kutatás2026. október 1.

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket

Saját, rövid tanulságok megfogalmazásával javítaná az AI-ügynökök tanulását az Apple új kutatása. Az RLTL;DR nevű módszer olyan feladatokra céloz, ahol a modell…

Az Apple kutatása szerint kevésbé számít az ügynökök körítése
Kutatás2026. október 1.

Az Apple kutatása szerint kevésbé számít az ügynökök körítése

Az Apple kutatói szerint a gépi tanulási feladatokra fejlesztett ügynököknél az alapul szolgáló nagy nyelvi modell teljesítménye fontosabb lehet az ügynök köré épített…