Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple PORTool módszere javítaná az eszközhasználó AI-ügynökök tanítását

2026. augusztus 28.Forrás: Apple
Az Apple PORTool módszere javítaná az eszközhasználó AI-ügynökök tanítását
Kép: Apple

A PORTool nevű új módszer az eszközöket használó nagy nyelvi modellek tanításának egyik nehéz problémáját célozza: hogyan derüljön ki, melyik köztes döntés segítette vagy rontotta a végeredményt. Az Apple kutatási oldalán szereplő, 2026 májusában publikált tanulmány szerint az eljárás pontosabb végső válaszokat és kevesebb eszközhívási lépést eredményezett a vizsgált összehasonlításokban.

A lényeg röviden
  • A PORTool az eszközhasználó AI-ügynökök tanításában a végső jutalmat lépésszintű visszajelzéssé alakítja.
  • A módszer jutalmazott lefutási fát használ, amely azonos kontextusban hasonlít össze alternatív eszközhasználati döntéseket.
  • A lépések fontosságát a helyes végső válasz lehetősége és az eszközhívások sikeres végrehajtása alapján becsli.
  • Az Apple kutatási oldala szerint a kísérletekben nőtt a végső válasz pontossága, miközben csökkent az eszközhívási lépések száma.
  • A forrás kutatási eredményről szól, termékbevezetést vagy elérhetőségi információt nem közöl.

Lépésszintű visszajelzés a végeredményből

Az Apple gépi tanulási kutatási oldalán megjelent tanulmány címe: PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning. A szerzők Feijie Wu, Weiwu Zhu, Yuxiang Zhang, Soumya Chatterjee, Jiarong Zhu, Fan Mo, Rong Luo és Jing Gao. A forrás szerint Feijie Wu a munkát az Apple-nél végezte, a † jelölés pedig a Purdue Universityhez kapcsolódik.

A kutatás a több eszközt integráló érveléssel foglalkozik. Ez olyan AI-ügynököket jelent, amelyek természetes nyelvű gondolkodási lépéseket váltogatnak külső eszközök meghívásával, hogy összetettebb feladatokat oldjanak meg. A szerzők szerint az ilyen rendszerek tanításánál gondot okoz, ha a modell csak a végső kimenetre kap jutalmat. Ilyenkor nehezen állapítható meg, hogy a sikerhez vagy kudarchoz melyik köztes lépés, illetve melyik eszközhasználati döntés vezetett.

A PORTool erre kínál megoldást: az eredményszintű felügyeletből indul ki, de a jutalmat lépésszinten próbálja hozzárendelni. A módszer célja, hogy az ügynök ne csak a jó végső választ tanulja meg előnyben részesíteni, hanem azokat az eszközhívási lépéseket is, amelyek hatékonyabban vezetnek oda.

Jutalmazott fa hasonlítja össze az alternatív döntéseket

A tanulmány szerint a PORTool egy jutalmazott lefutási fát hoz létre. Ebben a különböző trajektóriák eleinte közös előtagokon haladnak, majd elágaznak. Ez lehetővé teszi, hogy az algoritmus ugyanabban a kontextusban hasonlítsa össze az alternatív eszközhasználati döntéseket.

A lépések fontosságát két jel alapján becsli. Az első, meghatározó jel az, hogy az adott lépés leszármazottai végül képesek-e helyes végső választ adni. A második, kiegészítő elem azt mutatja, hogy az adott lépés eszközhívásai sikeresen végrehajthatók-e. Ezekből a lépésszintű fontossági becslésekből frissíti a módszer a házirendet, vagyis azt a döntési szabályt, amely meghatározza, milyen eszközhívási lépéseket generáljon az ügynök.

A forrás alapján a frissítést kétféle információ vezérli: az egyes elágazási döntéseken belüli helyi összehasonlítás, valamint a teljes trajektóriák általános minősége. Ez a felépítés azért lényeges, mert a több eszközzel dolgozó ügynököknél egy hibás köztes döntés akkor is elrejtheti a probléma okát, ha a végső eredmény alapján a rendszer csak sikert vagy kudarcot lát.

Mit jelenthet ez az eszközhasználó AI-ügynököknél

Az Apple oldalán közölt összefoglaló szerint a kísérletekben a PORTool javította a végső válasz pontosságát, miközben csökkentette az eszközhívási lépések számát a korszerű kiinduló módszerekhez képest. A szerzők azt is írják, hogy az ablációs vizsgálatok megerősítették a javasolt lépésszintű fontossági becslések robusztusságát.

Felhasználói és piaci szempontból a hír jelentősége az, hogy az eszközöket használó AI-ügynökök értéke nagyban függ a megbízható döntéssorozatoktól. Ha egy modell külső eszközökkel dolgozik, nem elég a jó végső válasz, számít az is, hogy hány lépésből, milyen eszközhívásokon keresztül jut el oda. A forrás állítása alapján a PORTool mindkét irányban javulást mutatott: pontosabb válaszokat és kevesebb eszközhívási lépést.

A tanulmány a beszéd és természetesnyelv-feldolgozás, valamint az eszközök, platformok és keretrendszerek kutatási területéhez kapcsolódik. A közölt anyag alapján a PORTool kutatási eredmény, a forrás nem tartalmaz termékbevezetést, árazást vagy felhasználói elérhetőséget.

Kapcsolódó hírek

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói egy tanítás nélküli, ABX-alapú módszercsaládot mutattak be a többnyelvű nyelvi modellek vizsgálatára. A megközelítés azt méri, hogy a modellek mennyire…

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói képzés nélküli, ABX-alapú feladatokat mutattak be a többnyelvű nyelvi modellek vizsgálatára. Az XLM-R elemzése szerint a nyelvazonosításhoz kapcsolódó…

Apple-kutatás: közös, szelektív memória segítheti az LLM-ügynököket
Kutatás2026. szeptember 30.

Apple-kutatás: közös, szelektív memória segítheti az LLM-ügynököket

Közös, szelektív tartós memóriát mutat be az Apple kutatási anyaga az ügynökalapú LLM-rendszerekhez, amelyek több lépésben, eszközhasználattal állítanak elő kódot. A…