Az Apple kutatói olcsóbbá tennék a gépi tanulási modellek törlését

Az Apple kutatói olyan módszert mutattak be, amely a gépi tanulási modellekből eltávolítandó adatok közül először kiszűri a csekély hatású pontokat. A kutatásban vizsgált valós példák alapján ez akár mintegy 50 százalékos számítási megtakarítást is eredményezhet.
- Az Apple kutatói a csekély hatású tanulási adatpontok azonosítását vizsgálták.
- A módszer nyelvi és képfeldolgozási feladatokra épülő összehasonlító elemzést használ.
- A javasolt keretrendszer a törlés előtt csökkenti az adathalmaz méretét.
- Valós empirikus példákban legfeljebb körülbelül 50 százalékos számítási megtakarítást mértek.
A törlendő adatok hatását vizsgálták
A gépi tanulási modellekből való adatok eltávolítása, vagyis a tanulás visszavonása, egyre fontosabbá válik az adatvédelmi aggályok erősödésével. Az Apple kutatási oldalán bemutatott tanulmány szerzői szerint a korszerű törlési módszerek jellemzően úgy kezelik a törlendő adatok halmazának minden elemét, mintha azonos jelentőségű lenne a modell szempontjából.
A When Unlearning Is Free: Leveraging Low Influence Points to Reduce Computational Costs című munka ezt a megközelítést kérdőjelezi meg. A kutatók arra keresték a választ, hogy valóban szükséges-e eltávolítani azokat az adatpontokat, amelyek elhanyagolható hatással vannak a modell tanulására.
A módszer a tanulási adathalmazt csökkenti
A szerzők nyelvi és képfeldolgozási feladatokon hasonlították össze a befolyásfüggvényeket. Ezek elemzésével olyan képzési adathalmaz-részleteket azonosítottak, amelyek a modell kimeneteire csak elhanyagolható hatást gyakorolnak.
Erre az eredményre építve hatékony törlési keretrendszert javasolnak. Ennek első lépése a tanulási adathalmaz méretének csökkentése, ezt követi az adatok eltávolítására szolgáló eljárás. A kutatás leírása szerint a megközelítés jelentős számítási megtakarítást hozott a valós példák empirikus vizsgálatában, legfeljebb körülbelül 50 százalékos mértékben.
Adatvédelem és számítási költség
A kutatás az Apple oldalán az adattudomány és annotáció, valamint az adatvédelem témaköréhez kapcsolódik. A bemutatott eredmény alapján egy modellből kért adateltávolítás előtt érdemes lehet megvizsgálni, hogy az érintett adatok milyen mértékben befolyásolják a modell működését. A csekély hatású pontok előzetes kiszűrése csökkentheti azt az adatmennyiséget, amelyen a törlési folyamatot végre kell hajtani.
Ez a felhasználók számára azt jelentheti, hogy az adatvédelmi célú modellmódosítás kevesebb számítási erőforrást igényelhet az Apple által vizsgált esetekben. A közlemény nem állít általános, minden modellre érvényes megtakarítást, a mintegy 50 százalékos érték a valós példák empirikus eredményeire vonatkozik.
A tanulmányt Anat Kleiman, Robert Fisher, Ben Deaner, Udi Wieder és Vitaly Feldman jegyzi. Kleiman a Harvard Egyetemhez, Deaner a University College Londonhoz kapcsolódik, a szerzők közül Kleiman munkája a kutatás idején az Apple-nél készült. A tanulmány 2026 júliusában jelent meg, az Apple kutatási oldala pedig 2026. augusztus 13-án közölt róla frissítést.


