Az Apple módszere a hibás eszközhasználati példákból is tanul

Az Apple PROOF-Gen nevű módszere a tanármodellek sikertelen eszközhasználati próbálkozásaiból is képes javított tanítási példákat előállítani. A vállalat szerint a megközelítés több teszten és egy telepített folyamatban is javította a modellek teljesítményét.
- A PROOF-Gen a tanármodellek sikertelen eszközhasználati folyamatait javítja.
- A τ²-bench teszten a tanármodell próbálkozásainak 57 százaléka megbukott.
- A módszer a sikertelen forgatókönyvek 93 százalékát visszanyerte.
- A Qwen3-4B-Instruct-2507 Pass¹ értéke 0,132-ről 0,529-re nőtt.
- Egy telepített folyamatban 1,5 százalékponttal javult az eszközön futó modell cél teljesítése.
A sikertelen próbálkozások eddig elvesztek
Az eszközöket használó modellek képességeit gyakran desztillációval ültetik át kisebb, telepíthető modellekbe. Ennek első lépése a tanármodell által létrehozott folyamatok felhasználásával végzett felügyelt finomhangolás. A tanármodell megoldja a feladatot, a rendszer pedig megtartja az átmenő próbálkozásokat, a hibásakat eldobja.
Az Apple szerint ezt a lépést a kiadott eszközhasználati ügynököket fejlesztő utótréning-folyamatok naponta vagy hetente újra lefuttatják. Minden ciklusban felmerül a fejlett tanármodell használatának költsége, miközben a sikertelen példák nem adnak tanítási jelet. Emiatt ugyanazok a nehéz helyzetek a következő ciklusokban is problémát okozhatnak.
A τ2-bench teszten a tanármodell próbálkozásainak 57 százaléka sikertelen volt. Ezek kétharmada közeli hibának számított: a legtöbb eszközhívás helyes volt, de egy döntő hiba miatt a teljes folyamat megbukott.
A PROOF-Gen kijavítja a hibás folyamatokat
Az Apple kutatói erre a problémára fejlesztették ki a PROOF-Gen, vagyis a Per-scenario Reflective Optimization to Overcome Failed Generation módszert. A megközelítés minden sikertelen feladathoz külön optimalizálja a felszólítást.
A folyamatban egy reflektor elemzi a végrehajtási nyomot és az értékelés visszajelzését. Ezután olyan javítási útmutatót készít, amely a tanármodellt egy sikeres folyamat létrehozása felé tereli. A módszer a tanítás előtt eltávolítja ezt az útmutatót, így a tanulómodell tiszta bemutatókból tanul, feladatspecifikus segédlet nélkül.
Az Apple közlése szerint a per-szcenárió-optimalizálás a τ2-bench-en a sikertelen forgatókönyvek 93 százalékát vissza tudta nyerni. A kombinált adathalmazon végzett finomhangolás után a Qwen3-4B-Instruct-2507 Pass1 értéke 0,132-ről 0,529-re javult. A Gemma 4 E4B-it a BFCL v4 többfordulós tesztjén 7,2 százalékpontos növekedést ért el.
Telepített folyamatban is javult a célok teljesítése
A kutatók egy telepített folyamatban is vizsgálták a módszert. Az Apple szerint a PROOF-Gen 6,3 százalékponttal növelte a folyamatok minőségét a cél teljesítését mérő mutatóban. A javulás egy telepített, eszközön futó modellre is átkerült, amelynél a cél teljesítése 1,5 százalékponttal emelkedett.
Az eszközön futó modell válaszminőségi mutatói 1,7 és 5,0 százalékpont közötti mértékben javultak. A pozitív hatás minden vizsgált nyelvi környezetben megjelent, a nem angol nyelvek átlaga 1,48 százalékpontos növekedést mutatott.
A 2026 augusztusában publikált kutatás az EMNLP konferenciához kapcsolódó tanulmányként szerepel az Apple kutatási oldalán. Az eredmények alapján a módszer a felhasználók számára jobb célvégrehajtást és válaszminőséget jelenthet a telepített, eszközöket használó modellekben. A forrás szerint a rendszer a tanármodell sikertelen próbálkozásait is felhasználja, így ezek nem vesznek el teljesen a fejlesztési folyamatból.


