Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket

Saját, rövid tanulságok megfogalmazásával javítaná az AI-ügynökök tanulását az Apple új kutatása. Az RLTL;DR nevű módszer olyan feladatokra céloz, ahol a modell kezdetben alig vagy egyáltalán nem talál sikeres megoldást.
- Az Apple RLTL;DR módszere sikertelen próbálkozások után saját TL;DR tanulságokat írat a modellel.
- A kutatás nehéz eszközhívási és kódolási adathalmazokon vizsgálta a megközelítést.
- A standard GRPO tanítás 0% és 1% közötti Pass@1 szinten maradt a közölt teszteken.
- Az RLTL;DR tanítás közben 14 és 31% közötti, kiértékeléskor tanulságok nélkül 12 és 13% közötti Pass@1 értéket ért el.
- Az SFTL;DR változat 4k feladat és tanulság párral majdnem elérte a teljes módszer teljesítményét.
Mit vizsgál az RLTL;DR?
Az Apple 2026. október 1-jén közzétett kutatási oldala szerint az RLTL;DR című munka a megerősítéses tanulás egy nehéz problémáját kezeli. A tanulmány teljes címe: RLTL;DR: Self-Improvement by Internalizing Self-Generated Feedback. A publikáció a NeurIPS konferenciához kapcsolódik, szerzői Michael Kirchhof, Eleonora Gualdoni, Andrew Szot, Khashayar Gatmiry, Aryo Lotfi, Abbas Kazerouni, Omar Attia, Sanjoy Chowdhury és Alexander Toshev.
A kiindulópont az úgynevezett megerősítéses tanulás ellenőrizhető jutalmakkal, vagyis RLVR. Ennek szokásos megközelítése, hogy az ügynök többször próbálkozik egy feladattal, majd a tanítás a sikeres próbálkozások felé optimalizál. Az Apple kutatói szerint ez gondot okoz az önfejlesztésnél, ha a feladat annyira nehéz, hogy az ügynöknek kicsi vagy akár nulla esélye van a sikerre, és nincs tanármodell vagy mintamegoldás, amelyből tanulhatna.
Rövid tanulság minden sikertelen próbálkozás után
Az RLTL;DR lényege, hogy minden sikertelen kísérlet után a rendszer megmutatja a házirendnek, vagyis a policynek az ellenőrző, a verifier kimeneteit, majd hagyja, hogy saját visszajelzést írjon. Ez a visszajelzés egyetlen TL;DR jellegű tanulság. A következő próbálkozás az összes korábbi tanulság figyelembevételével indul, és a rendszer sorban mintavételez új próbálkozásokat, amíg megoldást nem talál.
A kutatás másik fontos eleme, hogy a módszer visszaterjesztést, angolul backpropagationt is enged az ilyen, kontextusban szereplő tanulságokon. Ezzel a modell a feladatból közvetlenül a releváns tanulságra vezető leképezést belsővé teheti. Az Apple kutatói ezt nevezik a feladat és a tanulság közötti internalizációnak, és a cikk szerint ez bizonyult kulcsfontosságúnak.
Milyen eredményeket közöltek?
Az Apple a módszert nehéz eszközhívási és kódolási adathalmazokon vizsgálta, amelyeket úgy szűrtek, hogy Pass@128 = 0 legyen. A beszámoló szerint a Qwen 3.5 9B Thinking policy standard GRPO tanítása ilyen környezetben 0% és 1% közötti Pass@1 szinten maradt.
Az RLTL;DR ezzel szemben a közölt eredmények alapján tanítás közben, kontextusban lévő tanulságokkal 14 és 31% közötti Pass@1 értéket ért el. A kutatók azt is kiemelik, hogy kiértékeléskor, amikor már nem volt tanulság a kontextusban, a módszer 12 és 13% közötti Pass@1 eredményt mutatott.
A jelenség további vizsgálatához a kutatók egy egyszerűsített változatot is készítettek SFTL;DR néven. Ennél csak feladat és tanulság párokon tanítottak, anélkül, hogy bármilyen próbálkozást megmutattak volna, vagy azokon visszaterjesztést végeztek volna. A közlés szerint már 4k ilyen pár használata majdnem visszahozta az RLTL;DR, valamint a teljes próbálkozásokon végzett klasszikus SFT teljesítményét.
Mit jelenthet ez a felhasználóknak és a piacnak?
A kutatás közvetlenül nem termékbejelentés, és az Apple nem közöl elérhetőséget vagy bevezetési dátumot. A jelentősége abból következik, hogy a módszer olyan helyzetekre keres megoldást, ahol a modell a hagyományos, sikeres próbálkozásokra építő tanítással nem kap elég hasznos jelet.
Ha a kutatás iránya további munkákban is igazolódik, a fejlesztők számára kompaktabb tanítási mintát adhat: az Apple megfogalmazása szerint olyan jellegű tudást, hogy egy adott típusú feladatnál milyen dolgot kell szem előtt tartani. Ez különösen azoknál az ügynököknél lehet fontos, amelyek összetett eszközhasználati vagy kódolási feladatokon dolgoznak, és a hibákból származó rövid, belső tanulságokat is fel tudják használni a későbbi teljesítmény javítására.


