Az Apple módszere olcsóbbá teheti a gépi tanulási modellek törlését

Az Apple kutatói olyan módszert mutattak be, amely a csekély hatású tanítási adatpontok azonosításával akár körülbelül 50 százalékkal csökkentheti a gépi tanulási modellekből történő adateltávolítás számítási költségét. A megközelítést nyelvi és képfeldolgozási feladatokon vizsgálták.
- Az Apple kutatói a csekély hatású tanítási adatpontokat vizsgálták.
- A módszer a törlés előtt csökkenti az adatállomány méretét.
- Nyelvi és képfeldolgozási feladatokon elemezték a hatásfüggvényeket.
- Valós empirikus példákban akár körülbelül 50 százalékos számítási megtakarítást jelentett.
- A kutatás az adatvédelmi célú modellből való adateltávolítást célozza.
A felejtés költséges feladat
A gépi tanulási modellekből történő adateltávolítás, vagyis a modell „felejtése”, akkor válhat szükségessé, ha egyes adatpontokat adatvédelmi okokból ki kell venni a betanításból. Az Apple kutatási oldala szerint az adatvédelemmel kapcsolatos aggodalmak növekedésével egyre fontosabbá válik, hogy a már betanított modellekből is eltávolíthatók legyenek konkrét adatok.
Az ehhez készült korszerű módszerek jellemzően a törlendő adathalmaz minden elemét azonos módon kezelik. Az Apple kutatói azt vizsgálták, hogy valóban szükséges-e minden olyan pontot eltávolítani, amelyet a törlendő adathalmazba soroltak, ha annak a modell tanulására gyakorolt hatása elhanyagolható.
A hatás alapján szűrnék a tanítási adatokat
Udi Wieder, Vitaly Feldman, Robert Fisher és Anat Kleiman kutatása a hatásfüggvények (influence functions) összehasonlító elemzésére épül. Ezek segítségével nyelvi és képfeldolgozási feladatokban azonosították azokat a tanítási adathalmaz-részleteket, amelyek csak elhanyagolható mértékben befolyásolják a modell kimeneteit.
A javasolt keretrendszer a tényleges törlési folyamat előtt csökkenti az adathalmaz méretét. A kutatók szerint így a későbbi unlearning, vagyis a modellből való adateltávolítás kevesebb számítási erőforrást igényelhet. A módszer lényege, hogy a kis hatású adatpontokat előzetesen kiszűrik, és a törlési eljárás a relevánsabb adatokra összpontosít.
Akár 50 százalékos megtakarítás a vizsgált példákban
Az Apple közlése szerint a megközelítés valós példákon végzett empirikus vizsgálatokban akár körülbelül 50 százalékkal is csökkentette a számítási költségeket. A forrás nem közöl egyetlen általános megtakarítási értéket minden modellre vagy feladatra, ezért az eredmény a vizsgált valós példákhoz kötődik.
A kutatás jelentősége az Apple szerint abban áll, hogy az adateltávolítási módszerek fejlesztésekor érdemes lehet figyelembe venni az egyes tanítási pontok modellre gyakorolt hatását. Ez a megközelítés olyan helyzetekben lehet hasznos, ahol adatvédelmi követelmények miatt kell módosítani egy már betanított modellt, miközben az ehhez szükséges számítási munka mérséklése is fontos szempont.
A tanulmányt az Apple gépi tanulással foglalkozó kutatási oldalán tették közzé. A szerzők között szerepel Udi Wieder, Vitaly Feldman, Robert Fisher és Anat Kleiman. A forrás szerint Kleiman Harvard-kapcsolattal rendelkezik, a munka pedig az Apple-nél végzett időszakhoz kötődik.


