Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple új módszert javasol a nyelvi modellek személyre szabására

2026. szeptember 16.Forrás: Apple
Az Apple új módszert javasol a nyelvi modellek személyre szabására
Kép: Apple

Az Apple kutatói a Personalized Group Relative Policy Optimization, röviden P-GRPO nevű módszert mutatták be, amely a nyelvi modellek különböző emberi preferenciákhoz való igazítását célozza. A vállalat szerint az eljárás több feladaton gyorsabb konvergenciát és magasabb jutalmakat ért el a hagyományos GRPO-hoz képest.

A lényeg röviden
  • Az Apple kutatói bemutatták a Personalized GRPO, röviden P-GRPO módszert.
  • A megközelítés a preferenciacsoportok korábbi jutalomtörténeteit használja a normalizáláshoz.
  • A kutatók szerint a standard GRPO domináns preferenciák felé torzíthat.
  • A P-GRPO több feladaton gyorsabb konvergenciát és magasabb jutalmakat ért el.
  • A tanulmányt az Apple kutatási oldala szerint 2026 áprilisában publikálták.

Egyetlen cél helyett eltérő preferenciák

Az Apple kutatási oldala szerint a nagy nyelvi modellek, vagyis az LLM-ek, fejlett általános képességeik ellenére gyakran nehezen igazodnak az egyes emberek eltérő preferenciáihoz. A vállalat ezt részben a modell utólagos tanítására használt módszerek működésével magyarázza.

A Reinforcement Learning from Human Feedback, röviden RLHF, az emberi visszajelzésekből származó jutalmak alapján tanítja a modelleket. Az Apple leírása szerint a hagyományos utólagos tanítási módszerek egyetlen, globális cél optimalizálására törekednek. Ez megnehezíti, hogy a rendszer egymástól eltérő egyéni preferenciákat is megfelelően kezeljen.

Mi a probléma a GRPO-val?

A tanulmány a Group Relative Policy Optimization, vagyis GRPO nevű, széles körben használt, irányelvalapú megerősítéses tanulási keretrendszert vizsgálja. A módszer csoportokon belüli normalizálást alkalmaz, ami az Apple szerint hallgatólagosan azt feltételezi, hogy a csoport minden mintája felcserélhető.

Ez a feltételezés személyre szabott beállításokban összekeverheti az egymástól eltérő felhasználói jutalomeloszlásokat. A kutatók szerint ennek következménye, hogy a tanulás rendszeresen a domináns preferenciák felé tolódhat, miközben a kisebbségi jelzések háttérbe szorulnak. Így a modell kevésbé tudja megőrizni azokat a különbségeket, amelyek az eltérő preferenciák megtanulásához szükségesek.

A P-GRPO külön kezeli a preferenciacsoportokat

Az Apple kutatói erre a problémára dolgozták ki a Personalized GRPO, azaz P-GRPO nevű keretrendszert. A módszer az előnybecslést leválasztja az éppen feldolgozott köteg pillanatnyi statisztikáiról.

A P-GRPO az előnyöket nem a párhuzamosan előállított minták aktuális csoportjához viszonyítva normalizálja. Ehelyett az egyes preferenciacsoportokhoz tartozó jutalomtörténeteket használja. A kutatók szerint ez megőrzi a kontrasztív jelet, amelyre a különböző preferenciák megtanulásához szükség van.

Az Apple kutatási oldala alapján a módszert többféle feladaton értékelték. A beszámoló szerint a P-GRPO következetesen gyorsabb konvergenciát és magasabb jutalmakat ért el a standard GRPO-nál. A kutatók arra jutottak, hogy a jutalmak eltéréseinek figyelembevétele az optimalizálás szintjén fontos a sokféle emberi preferenciához való pontosabb igazodáshoz, miközben az általános képességek megőrzése is cél marad.

Mit jelenthet ez a személyre szabott modelleknek?

A tanulmány alapján a P-GRPO olyan tanítási megközelítést kínál, amely különbséget tesz az eltérő preferenciákból származó visszajelzések között. Ez azért lehet fontos, mert a modell nem egyetlen, mindenki számára azonos jutalomcélhoz igazodik, hanem a preferenciacsoportok saját jutalomtörténeteit is figyelembe veszi.

Az Apple közlése kutatási eredményként mutatja be a P-GRPO-t. A forrás nem közöl konkrét termékbevezetést, felhasználói elérhetőséget vagy megjelenési időpontot. A módszer jelentőségét a vállalat a nyelvi modellek sokféle emberi preferenciához való igazításának problémáján keresztül mutatja be.

AppleGroup Relative Policy OptimizationPersonalized GRPOnyelvi modellekérvelő modellekkutatási eredmény
Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói egy tanítás nélküli, ABX-alapú módszercsaládot mutattak be a többnyelvű nyelvi modellek vizsgálatára. A megközelítés azt méri, hogy a modellek mennyire…

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói képzés nélküli, ABX-alapú feladatokat mutattak be a többnyelvű nyelvi modellek vizsgálatára. Az XLM-R elemzése szerint a nyelvazonosításhoz kapcsolódó…

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket
Kutatás2026. október 1.

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket

Saját, rövid tanulságok megfogalmazásával javítaná az AI-ügynökök tanulását az Apple új kutatása. Az RLTL;DR nevű módszer olyan feladatokra céloz, ahol a modell…