Az Apple új módszert javasol a nyelvi modellek személyre szabására

Az Apple kutatói a Personalized Group Relative Policy Optimization, röviden P-GRPO nevű módszert mutatták be, amely a nyelvi modellek különböző emberi preferenciákhoz való igazítását célozza. A vállalat szerint az eljárás több feladaton gyorsabb konvergenciát és magasabb jutalmakat ért el a hagyományos GRPO-hoz képest.
- Az Apple kutatói bemutatták a Personalized GRPO, röviden P-GRPO módszert.
- A megközelítés a preferenciacsoportok korábbi jutalomtörténeteit használja a normalizáláshoz.
- A kutatók szerint a standard GRPO domináns preferenciák felé torzíthat.
- A P-GRPO több feladaton gyorsabb konvergenciát és magasabb jutalmakat ért el.
- A tanulmányt az Apple kutatási oldala szerint 2026 áprilisában publikálták.
Egyetlen cél helyett eltérő preferenciák
Az Apple kutatási oldala szerint a nagy nyelvi modellek, vagyis az LLM-ek, fejlett általános képességeik ellenére gyakran nehezen igazodnak az egyes emberek eltérő preferenciáihoz. A vállalat ezt részben a modell utólagos tanítására használt módszerek működésével magyarázza.
A Reinforcement Learning from Human Feedback, röviden RLHF, az emberi visszajelzésekből származó jutalmak alapján tanítja a modelleket. Az Apple leírása szerint a hagyományos utólagos tanítási módszerek egyetlen, globális cél optimalizálására törekednek. Ez megnehezíti, hogy a rendszer egymástól eltérő egyéni preferenciákat is megfelelően kezeljen.
Mi a probléma a GRPO-val?
A tanulmány a Group Relative Policy Optimization, vagyis GRPO nevű, széles körben használt, irányelvalapú megerősítéses tanulási keretrendszert vizsgálja. A módszer csoportokon belüli normalizálást alkalmaz, ami az Apple szerint hallgatólagosan azt feltételezi, hogy a csoport minden mintája felcserélhető.
Ez a feltételezés személyre szabott beállításokban összekeverheti az egymástól eltérő felhasználói jutalomeloszlásokat. A kutatók szerint ennek következménye, hogy a tanulás rendszeresen a domináns preferenciák felé tolódhat, miközben a kisebbségi jelzések háttérbe szorulnak. Így a modell kevésbé tudja megőrizni azokat a különbségeket, amelyek az eltérő preferenciák megtanulásához szükségesek.
A P-GRPO külön kezeli a preferenciacsoportokat
Az Apple kutatói erre a problémára dolgozták ki a Personalized GRPO, azaz P-GRPO nevű keretrendszert. A módszer az előnybecslést leválasztja az éppen feldolgozott köteg pillanatnyi statisztikáiról.
A P-GRPO az előnyöket nem a párhuzamosan előállított minták aktuális csoportjához viszonyítva normalizálja. Ehelyett az egyes preferenciacsoportokhoz tartozó jutalomtörténeteket használja. A kutatók szerint ez megőrzi a kontrasztív jelet, amelyre a különböző preferenciák megtanulásához szükség van.
Az Apple kutatási oldala alapján a módszert többféle feladaton értékelték. A beszámoló szerint a P-GRPO következetesen gyorsabb konvergenciát és magasabb jutalmakat ért el a standard GRPO-nál. A kutatók arra jutottak, hogy a jutalmak eltéréseinek figyelembevétele az optimalizálás szintjén fontos a sokféle emberi preferenciához való pontosabb igazodáshoz, miközben az általános képességek megőrzése is cél marad.
Mit jelenthet ez a személyre szabott modelleknek?
A tanulmány alapján a P-GRPO olyan tanítási megközelítést kínál, amely különbséget tesz az eltérő preferenciákból származó visszajelzések között. Ez azért lehet fontos, mert a modell nem egyetlen, mindenki számára azonos jutalomcélhoz igazodik, hanem a preferenciacsoportok saját jutalomtörténeteit is figyelembe veszi.
Az Apple közlése kutatási eredményként mutatja be a P-GRPO-t. A forrás nem közöl konkrét termékbevezetést, felhasználói elérhetőséget vagy megjelenési időpontot. A módszer jelentőségét a vállalat a nyelvi modellek sokféle emberi preferenciához való igazításának problémáján keresztül mutatja be.


