Az Apple négy lépésre gyorsítaná a képgenerálást új modellel

Az Apple kutatói bemutatták a Normalizing Trajectory Models nevű módszert, amely a képgeneráló modellek mintavételét négy lépésre sűríti. A megközelítés közben megtartja a generatív folyamat pontos valószínűségi modelljét.
- Az NTM minden visszafelé irányuló lépést feltételes normalizáló áramlásként modellez.
- A módszer pontos likelihood-alapú tanítást és önlepárlást tesz lehetővé.
- Az Apple szerint a modell négy lépésben is jó minőségű mintákat készít.
- Text-to-image teszteken az NTM elérte vagy meghaladta az erős képgenerálási alapmódszereket.
A diffúziós modellek problémájára kínál megoldást
A diffúziós modellek a mintavételt sok, kis méretű, Gauss-féle zajcsökkentési lépésre bontják. Ez a feltételezés nehezebben működik akkor, amikor a képgenerálást csak néhány nagyobb átmenetre próbálják sűríteni. A kevés lépést használó módszerek ezt többek között lepárlással, konzisztenciatanítással vagy adverszariális célfüggvényekkel kezelik.
Az Apple közleménye szerint ezek az eljárások közben feladják a likelihood, vagyis a valószínűségi értékelésen alapuló keretrendszert. A Normalizing Trajectory Models, röviden NTM, ezt a hiányt célozza. A módszer minden visszafelé irányuló lépést kifejező, feltételes normalizáló áramlásként, vagyis normalizing flow-ként modellez, és pontos likelihood-alapú tanítást használ.
Egy hálózatban egyesíti a lépéseket és a teljes pályát
Az NTM felépítésében minden egyes lépés sekély, megfordítható blokkokat használ. Ezeket a kutatók egy, a teljes generálási pályán párhuzamosan működő, mély előrejelzővel kapcsolják össze. Az Apple leírása szerint így egy végponttól végpontig tanítható hálózat jön létre.
A modell a semmiből is betanítható, és előre betanított flow matching modellekből is inicializálható. A megközelítés egyik fontos eleme, hogy a generálási pályára vonatkozó likelihood pontos marad. Ez lehetővé teszi az úgynevezett önlepárlást is. Ilyenkor egy könnyű zajcsökkentőt tanítanak a modell által létrehozott pontozófüggvényen.
A kutatók szerint négy lépésben is erős eredményt ad
Az önlepárlás eredményeként az Apple kutatói egy olyan könnyű zajcsökkentőt mutatnak be, amely négy lépésben képes jó minőségű mintákat előállítani. A vállalat kutatási oldala szerint a text-to-image, vagyis szövegből képet készítő teszteken az NTM négy mintavételi lépésben eléri vagy meghaladja az erős képgenerálási alapmódszerek teljesítményét.
A közlemény kiemeli, hogy a módszer ezzel együtt megtartja a generatív pálya pontos likelihoodját. Ez különbözteti meg az Apple bemutatása szerint a korábbi, kevés lépésre optimalizált megoldásoktól. A tanulmány a NeurIPS konferenciához kapcsolódik, szerzői Jiatao Gu, Tianrong Chen, Ying Shen, David Berthelot, Shuangfei Zhai és Josh Susskind. Gu a University of Pennsylvania, Shen az UIUC kutatója, a szerzői megjegyzés szerint a munka egy része Apple-nél végzett kutatás idején készült.
Az Apple október 8-án közzétett kutatási anyaga alapján az NTM a gyors, kevés mintavételi lépést használó képgenerálás és a likelihood-alapú modellezés közötti kapcsolatot erősíti. A forrás a módszert kutatási eredményként mutatja be, és nem közöl hozzá termékbeépítési vagy felhasználói elérhetőségi információt.
Apple: Normalizing Trajectory Models


