Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple kutatása szerint a diffúziós modellek magabiztossága félrevezető lehet

2026. október 2.Forrás: Apple
Az Apple kutatása szerint a diffúziós modellek magabiztossága félrevezető lehet
Kép: Apple

Az Apple kutatói szerint a diffúziós modellek pozíciónkénti valószínűségei önmagukban nem árulják el, hogy a generált tokenek között fennáll-e függőség. Ez torzíthatja a több token egyidejű előállítására épülő mintavételt és az eredmények értékelését.

A lényeg röviden
  • A diszkrét diffúziós modellek egy lépésben több tokenpozíciót is megírhatnak.
  • A pozíciónkénti eloszlások nem mutatják meg, hogy a tokenek csoportja függő-e.
  • Függő pozíciócsoportot nem lehet pozíciónkénti eloszlások szorzatával pontosan leírni.
  • A ScanAndAdd feladaton a generált eloszlás eltérése a mintavételi zaj 29-szerese volt.
  • A mintánkénti mérőszámok értéke eközben 1,0 maradt.

A pozíciók közötti függőség a központi probléma

Az Apple Machine Learning oldalán októberben publikált, Limits of Confidence in Diffusion című tanulmányt Russ Webb, Amitis Shidani, Alice Bizeul és Dan Busbridge jegyzi. A kutatás a diszkrét diffúziós modelleket vizsgálja, köztük az újr maszkolást és az egyenletes állapotú mintavételt használó megoldásokat.

Ezek a módszerek egy sorozatot úgy állítanak elő, hogy egy lépésben több tokenpozíciót írnak meg. Minden pozícióhoz külön eloszlást használnak, majd ezekből az eloszlásokból választják ki azokat a pozíciókat is, amelyeket kitöltenek. A vizsgált területeken, például képpontok, fonémák vagy szavak esetében azonban a tokenek között eleve lehetnek függőségek.

A kutatók szerint egy lépés csak akkor egyezik a tanítási eloszlással, ha az éppen megírt pozíciók feltételesen függetlenek a már rögzített tokenek ismeretében. Ha egy csoport elemei között függőség van, azt egyetlen, pozíciónkénti eloszlások szorzataként felírt modell sem tudja pontosan visszaadni.

Az egyedi valószínűségek nem fedik fel a teljes képet

A tanulmány egyik fontos állítása, hogy a pozíciónkénti eloszlásokból nem lehet eldönteni, függő-e egy tokenekből álló csoport. Két közös eloszlás ugyanis ugyanazokat az egyedi, úgynevezett marginális eloszlásokat adhatja, miközben eltérnek abban, hogy az értékek mely kombinációi fordulnak elő.

Ez azt jelenti, hogy a modellen belül egy pozícióhoz rendelt magasabb vagy alacsonyabb bizonyosság önmagában nem írja le a pozíciók közös viselkedését. A magabiztosság alapján felállított sorrend így nem feltétlenül jelzi, hogy az egyszerre kiválasztott tokenek együtt milyen eloszlást alkotnak.

A ScanAndAdd feladaton mért eltérés

Az Apple kutatói a következtetéseiket a ScanAndAdd nevű szintetikus feladaton ellenőrizték. Ennél a feladatnál a közös eloszlás zárt formában ismert, ezért össze lehet hasonlítani a generált eredményeket az elméleti eloszlással.

A kutatás szerint minden olyan, két vagy több még meghatározatlan pozícióból álló csoport függő volt, amelyet a magabiztossági sorrend választott ki. A generált eloszlás teljes variációs távolsága a mintavételi zaj szintjének 29-szerese volt, miközben a mintánkénti mérőszámok értéke 1,0 maradt.

Az eredmény arra hívja fel a figyelmet, hogy az egyedi mintákon számolt mérőszámok és a teljes generált eloszlás eltérése különböző képet adhat. A tanulmány ezért a diffúziós mintavétel elemzéséhez a pozíciók közös függőségeinek vizsgálatát is szükségesnek mutatja.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple
Kutatás2026. október 2.

Vizuális információval csökkentené a többnyelvű beszédmodellek lemaradását az Apple

Az Apple kutatói szerint a beszédhez kapcsolt korlátozott vizuális információ jelentősen csökkentheti a többnyelvű, önfelügyelt beszédmodellek lemaradását. A módszer…

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését
Kutatás2026. október 2.

Az Apple új módszerrel vizsgálta a többnyelvű modellek működését

Az Apple kutatói egy tanítás nélküli, ABX-alapú módszercsaládot mutattak be a többnyelvű nyelvi modellek vizsgálatára. A megközelítés azt méri, hogy a modellek mennyire…

Az Apple szerint a nyelvek felismerése javítja a többnyelvű beszédmodelleket
Kutatás2026. október 2.

Az Apple szerint a nyelvek felismerése javítja a többnyelvű beszédmodelleket

Az Apple kutatói szerint a beszédmodellek előzetes tanításakor bevezetett nyelvi megkülönböztetés csökkentheti a többnyelvű és egynyelvű modellek közötti…