Apple-kutatás: DSO módszerrel csökkentenék az AI-modellek torzítását

A Direct Steering Optimization, röviden DSO, az Apple kutatói szerint futtatás közben teheti szabályozhatóbbá az AI-modellek torzításcsökkentését. A CVPR-hez kapcsolódó, 2026 áprilisában publikált munka VLM-eken és LLM-eken vizsgálja a méltányosság és a modellképességek közti kompromisszumot.
- Az Apple kutatói a Direct Steering Optimization, röviden DSO módszert mutatták be.
- A módszer célja a torzítás mérséklése VLM-ekben és LLM-ekben futtatás közbeni kontroll mellett.
- A DSO megerősítéses tanulással keres lineáris transzformációkat az aktivációk irányításához.
- Az Apple szerint a DSO state-of-the-art kompromisszumot ér el a méltányosság és a modellképességek között.
- A publikáció 2026 áprilisában jelent meg, a kapcsolódó Apple-oldal 2026. szeptember 18-i dátummal szerepel.
Miért gond a torzítás a generatív modelleknél?
Az Apple gépi tanulási kutatási oldalán megjelent anyag szerint a generatív modelleket gyakran olyan helyzetekben használják, ahol a felhasználók nevében hoznak döntéseket. A forrás példája egy látás-nyelvi modell, vagyis VLM, amely látássérült embereknek segíthet azonosítani, ki lehet orvos egy szobában.
A kutatók szerint ezeknek a modelleknek a döntéseit befolyásolhatják a bemeneten szereplő emberekről észlelt demográfiai jellemzők. Ez olyan torz eredményekhez vezethet, mint amikor a modell nem azonosít nőket orvosként. A probléma azért különösen érzékeny, mert a torzítás csökkentése teljesítményvesztéssel járhat, a felhasználóknak pedig eltérő igényeik lehetnek abban, hogyan egyensúlyozzanak a méltányosság és az általános modellképességek között.
Mit csinál a Direct Steering Optimization?
A DSO teljes neve Direct Steering Optimization. A módszer az úgynevezett aktivációirányításra épít, amely futtatás közbeni kontrollt adhat a modellek viselkedése felett. Az Apple által ismertetett kutatás szerint az aktivációirányítást korábban nagy nyelvi modelleknél, vagyis LLM-eknél biztonságosabb viselkedés előidézésére is használták.
A kutatók ugyanakkor azt írják, hogy a jelenlegi irányítási módszerek nehezen korrigálják az olyan torzításokat, ahol a demográfiai csoportok között azonos valószínűségű kimenetekre lenne szükség. Erre válaszul javasolják a DSO-t, amely megerősítéses tanulással keres lineáris transzformációkat az aktivációk irányításához. A cél a torzítás mérséklése úgy, hogy közben kontroll alatt maradjon a modell teljesítménye.
Az Apple szerint a DSO a VLM-ek és az LLM-ek esetében is state-of-the-art kompromisszumot ér el a méltányosság és a képességek között, miközben a gyakorlati alkalmazóknak futtatás közbeni kontrollt ad ezen kompromisszum felett.
Kik dolgoztak a kutatáson?
A publikáció szerzői Lucas Monteiro Paes, Nivedha Sivakumar, Oliver Wang, Masha Fedzechkina, Barry-John Theobald, Luca Zappella és Nicholas Apostoloff. A forrás jelöli, hogy a Carnegie Mellon University is érintett a munkában, valamint azt is, hogy Oliver Wang munkája az Apple-nél töltött idő alatt készült. Lucas Monteiro Paes, Nivedha Sivakumar és Oliver Wang egyenlő hozzájárulással szerepelnek.
Az Apple oldala a publikáció mellett a forráskód GitHub-linkjét és BibTeX-hivatkozást is megad. A kutatási területek között a Fairness, valamint a Methods and Algorithms szerepelnek, a tartalomtípus pedig paper.
Mit jelenthet ez a felhasználóknak és a fejlesztőknek?
A kutatás jelentősége abból fakad, hogy a modell viselkedésének módosítását futtatás közben célozza, vagyis olyan helyzetekben, amikor a modell már használatban van. A forrás alapján a DSO nem egyszerűen előre meghatározott heurisztikákra támaszkodik, hanem közvetlenül a modellviselkedés kontrollálására optimalizált irányítási stratégiát keres.
Ez a fejlesztőknek és gyakorlati alkalmazóknak azért lehet fontos, mert a forrás szerint a módszer szabályozhatóbbá teszi a torzításcsökkentés és a teljesítmény közti választást. A felhasználói oldalról ez különösen olyan döntéstámogató alkalmazásoknál számíthat, ahol a demográfiai jellemzők alapján kialakuló torz kimenetek közvetlen hatással lehetnek arra, milyen választ ad a modell.


