Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple módszere a hibás eszközhasználati példákból is tanul

2026. augusztus 28.Forrás: Apple
Az Apple módszere a hibás eszközhasználati példákból is tanul
Kép: Apple

Az Apple PROOF-Gen nevű módszere a tanármodellek sikertelen eszközhasználati próbálkozásaiból is képes javított tanítási példákat előállítani. A vállalat szerint a megközelítés több teszten és egy telepített folyamatban is javította a modellek teljesítményét.

A lényeg röviden
  • A PROOF-Gen a tanármodellek sikertelen eszközhasználati folyamatait javítja.
  • A τ²-bench teszten a tanármodell próbálkozásainak 57 százaléka megbukott.
  • A módszer a sikertelen forgatókönyvek 93 százalékát visszanyerte.
  • A Qwen3-4B-Instruct-2507 Pass¹ értéke 0,132-ről 0,529-re nőtt.
  • Egy telepített folyamatban 1,5 százalékponttal javult az eszközön futó modell cél teljesítése.

A sikertelen próbálkozások eddig elvesztek

Az eszközöket használó modellek képességeit gyakran desztillációval ültetik át kisebb, telepíthető modellekbe. Ennek első lépése a tanármodell által létrehozott folyamatok felhasználásával végzett felügyelt finomhangolás. A tanármodell megoldja a feladatot, a rendszer pedig megtartja az átmenő próbálkozásokat, a hibásakat eldobja.

Az Apple szerint ezt a lépést a kiadott eszközhasználati ügynököket fejlesztő utótréning-folyamatok naponta vagy hetente újra lefuttatják. Minden ciklusban felmerül a fejlett tanármodell használatának költsége, miközben a sikertelen példák nem adnak tanítási jelet. Emiatt ugyanazok a nehéz helyzetek a következő ciklusokban is problémát okozhatnak.

A τ2-bench teszten a tanármodell próbálkozásainak 57 százaléka sikertelen volt. Ezek kétharmada közeli hibának számított: a legtöbb eszközhívás helyes volt, de egy döntő hiba miatt a teljes folyamat megbukott.

A PROOF-Gen kijavítja a hibás folyamatokat

Az Apple kutatói erre a problémára fejlesztették ki a PROOF-Gen, vagyis a Per-scenario Reflective Optimization to Overcome Failed Generation módszert. A megközelítés minden sikertelen feladathoz külön optimalizálja a felszólítást.

A folyamatban egy reflektor elemzi a végrehajtási nyomot és az értékelés visszajelzését. Ezután olyan javítási útmutatót készít, amely a tanármodellt egy sikeres folyamat létrehozása felé tereli. A módszer a tanítás előtt eltávolítja ezt az útmutatót, így a tanulómodell tiszta bemutatókból tanul, feladatspecifikus segédlet nélkül.

Az Apple közlése szerint a per-szcenárió-optimalizálás a τ2-bench-en a sikertelen forgatókönyvek 93 százalékát vissza tudta nyerni. A kombinált adathalmazon végzett finomhangolás után a Qwen3-4B-Instruct-2507 Pass1 értéke 0,132-ről 0,529-re javult. A Gemma 4 E4B-it a BFCL v4 többfordulós tesztjén 7,2 százalékpontos növekedést ért el.

Telepített folyamatban is javult a célok teljesítése

A kutatók egy telepített folyamatban is vizsgálták a módszert. Az Apple szerint a PROOF-Gen 6,3 százalékponttal növelte a folyamatok minőségét a cél teljesítését mérő mutatóban. A javulás egy telepített, eszközön futó modellre is átkerült, amelynél a cél teljesítése 1,5 százalékponttal emelkedett.

Az eszközön futó modell válaszminőségi mutatói 1,7 és 5,0 százalékpont közötti mértékben javultak. A pozitív hatás minden vizsgált nyelvi környezetben megjelent, a nem angol nyelvek átlaga 1,48 százalékpontos növekedést mutatott.

A 2026 augusztusában publikált kutatás az EMNLP konferenciához kapcsolódó tanulmányként szerepel az Apple kutatási oldalán. Az eredmények alapján a módszer a felhasználók számára jobb célvégrehajtást és válaszminőséget jelenthet a telepített, eszközöket használó modellekben. A forrás szerint a rendszer a tanármodell sikertelen próbálkozásait is felhasználja, így ezek nem vesznek el teljesen a fejlesztési folyamatból.

ApplePROOF-GenQwen3-4B-Instruct-2507Gemma 4 E4B-itτ 2-benchAI-ágensekvállalati AIkutatási eredmény

Kapcsolódó hírek

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél
Kutatás2026. október 1.

Az Apple kutatása szerint a kevesebb gépezet többet érhet az AI-ügynököknél

Az összetett, több ügynököt és külön keresőmodulokat használó gépi tanulási mérnöki rendszerek nem bizonyultak jobbnak egy egyszerű kódoló ügynöknél azonos időkeret és…

Az Apple kutatása szerint kevésbé számít az ügynökök körítése
Kutatás2026. október 1.

Az Apple kutatása szerint kevésbé számít az ügynökök körítése

Az Apple kutatói szerint a gépi tanulási feladatokra fejlesztett ügynököknél az alapul szolgáló nagy nyelvi modell teljesítménye fontosabb lehet az ügynök köré épített…

Apple-kutatás: közös, szelektív memória segítheti az LLM-ügynököket
Kutatás2026. szeptember 30.

Apple-kutatás: közös, szelektív memória segítheti az LLM-ügynököket

Közös, szelektív tartós memóriát mutat be az Apple kutatási anyaga az ügynökalapú LLM-rendszerekhez, amelyek több lépésben, eszközhasználattal állítanak elő kódot. A…