Az Apple kutatása szerint a diffúziós modellek magabiztossága félrevezető lehet

Az Apple kutatói szerint a diffúziós modellek pozíciónkénti valószínűségei önmagukban nem árulják el, hogy a generált tokenek között fennáll-e függőség. Ez torzíthatja a több token egyidejű előállítására épülő mintavételt és az eredmények értékelését.
- A diszkrét diffúziós modellek egy lépésben több tokenpozíciót is megírhatnak.
- A pozíciónkénti eloszlások nem mutatják meg, hogy a tokenek csoportja függő-e.
- Függő pozíciócsoportot nem lehet pozíciónkénti eloszlások szorzatával pontosan leírni.
- A ScanAndAdd feladaton a generált eloszlás eltérése a mintavételi zaj 29-szerese volt.
- A mintánkénti mérőszámok értéke eközben 1,0 maradt.
A pozíciók közötti függőség a központi probléma
Az Apple Machine Learning oldalán októberben publikált, Limits of Confidence in Diffusion című tanulmányt Russ Webb, Amitis Shidani, Alice Bizeul és Dan Busbridge jegyzi. A kutatás a diszkrét diffúziós modelleket vizsgálja, köztük az újr maszkolást és az egyenletes állapotú mintavételt használó megoldásokat.
Ezek a módszerek egy sorozatot úgy állítanak elő, hogy egy lépésben több tokenpozíciót írnak meg. Minden pozícióhoz külön eloszlást használnak, majd ezekből az eloszlásokból választják ki azokat a pozíciókat is, amelyeket kitöltenek. A vizsgált területeken, például képpontok, fonémák vagy szavak esetében azonban a tokenek között eleve lehetnek függőségek.
A kutatók szerint egy lépés csak akkor egyezik a tanítási eloszlással, ha az éppen megírt pozíciók feltételesen függetlenek a már rögzített tokenek ismeretében. Ha egy csoport elemei között függőség van, azt egyetlen, pozíciónkénti eloszlások szorzataként felírt modell sem tudja pontosan visszaadni.
Az egyedi valószínűségek nem fedik fel a teljes képet
A tanulmány egyik fontos állítása, hogy a pozíciónkénti eloszlásokból nem lehet eldönteni, függő-e egy tokenekből álló csoport. Két közös eloszlás ugyanis ugyanazokat az egyedi, úgynevezett marginális eloszlásokat adhatja, miközben eltérnek abban, hogy az értékek mely kombinációi fordulnak elő.
Ez azt jelenti, hogy a modellen belül egy pozícióhoz rendelt magasabb vagy alacsonyabb bizonyosság önmagában nem írja le a pozíciók közös viselkedését. A magabiztosság alapján felállított sorrend így nem feltétlenül jelzi, hogy az egyszerre kiválasztott tokenek együtt milyen eloszlást alkotnak.
A ScanAndAdd feladaton mért eltérés
Az Apple kutatói a következtetéseiket a ScanAndAdd nevű szintetikus feladaton ellenőrizték. Ennél a feladatnál a közös eloszlás zárt formában ismert, ezért össze lehet hasonlítani a generált eredményeket az elméleti eloszlással.
A kutatás szerint minden olyan, két vagy több még meghatározatlan pozícióból álló csoport függő volt, amelyet a magabiztossági sorrend választott ki. A generált eloszlás teljes variációs távolsága a mintavételi zaj szintjének 29-szerese volt, miközben a mintánkénti mérőszámok értéke 1,0 maradt.
Az eredmény arra hívja fel a figyelmet, hogy az egyedi mintákon számolt mérőszámok és a teljes generált eloszlás eltérése különböző képet adhat. A tanulmány ezért a diffúziós mintavétel elemzéséhez a pozíciók közös függőségeinek vizsgálatát is szükségesnek mutatja.
Apple: Limits of Confidence in Diffusion


