Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Apple négy lépésre gyorsítaná a képgenerálást új modellel

2026. október 8.Forrás: Apple
Az Apple négy lépésre gyorsítaná a képgenerálást új modellel
Kép: Apple

Az Apple kutatói bemutatták a Normalizing Trajectory Models nevű módszert, amely a képgeneráló modellek mintavételét négy lépésre sűríti. A megközelítés közben megtartja a generatív folyamat pontos valószínűségi modelljét.

A lényeg röviden
  • Az NTM minden visszafelé irányuló lépést feltételes normalizáló áramlásként modellez.
  • A módszer pontos likelihood-alapú tanítást és önlepárlást tesz lehetővé.
  • Az Apple szerint a modell négy lépésben is jó minőségű mintákat készít.
  • Text-to-image teszteken az NTM elérte vagy meghaladta az erős képgenerálási alapmódszereket.

A diffúziós modellek problémájára kínál megoldást

A diffúziós modellek a mintavételt sok, kis méretű, Gauss-féle zajcsökkentési lépésre bontják. Ez a feltételezés nehezebben működik akkor, amikor a képgenerálást csak néhány nagyobb átmenetre próbálják sűríteni. A kevés lépést használó módszerek ezt többek között lepárlással, konzisztenciatanítással vagy adverszariális célfüggvényekkel kezelik.

Az Apple közleménye szerint ezek az eljárások közben feladják a likelihood, vagyis a valószínűségi értékelésen alapuló keretrendszert. A Normalizing Trajectory Models, röviden NTM, ezt a hiányt célozza. A módszer minden visszafelé irányuló lépést kifejező, feltételes normalizáló áramlásként, vagyis normalizing flow-ként modellez, és pontos likelihood-alapú tanítást használ.

Egy hálózatban egyesíti a lépéseket és a teljes pályát

Az NTM felépítésében minden egyes lépés sekély, megfordítható blokkokat használ. Ezeket a kutatók egy, a teljes generálási pályán párhuzamosan működő, mély előrejelzővel kapcsolják össze. Az Apple leírása szerint így egy végponttól végpontig tanítható hálózat jön létre.

A modell a semmiből is betanítható, és előre betanított flow matching modellekből is inicializálható. A megközelítés egyik fontos eleme, hogy a generálási pályára vonatkozó likelihood pontos marad. Ez lehetővé teszi az úgynevezett önlepárlást is. Ilyenkor egy könnyű zajcsökkentőt tanítanak a modell által létrehozott pontozófüggvényen.

A kutatók szerint négy lépésben is erős eredményt ad

Az önlepárlás eredményeként az Apple kutatói egy olyan könnyű zajcsökkentőt mutatnak be, amely négy lépésben képes jó minőségű mintákat előállítani. A vállalat kutatási oldala szerint a text-to-image, vagyis szövegből képet készítő teszteken az NTM négy mintavételi lépésben eléri vagy meghaladja az erős képgenerálási alapmódszerek teljesítményét.

A közlemény kiemeli, hogy a módszer ezzel együtt megtartja a generatív pálya pontos likelihoodját. Ez különbözteti meg az Apple bemutatása szerint a korábbi, kevés lépésre optimalizált megoldásoktól. A tanulmány a NeurIPS konferenciához kapcsolódik, szerzői Jiatao Gu, Tianrong Chen, Ying Shen, David Berthelot, Shuangfei Zhai és Josh Susskind. Gu a University of Pennsylvania, Shen az UIUC kutatója, a szerzői megjegyzés szerint a munka egy része Apple-nél végzett kutatás idején készült.

Az Apple október 8-án közzétett kutatási anyaga alapján az NTM a gyors, kevés mintavételi lépést használó képgenerálás és a likelihood-alapú modellezés közötti kapcsolatot erősíti. A forrás a módszert kutatási eredményként mutatja be, és nem közöl hozzá termékbeépítési vagy felhasználói elérhetőségi információt.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket
Kutatás2026. október 1.

Az Apple új módszere saját hibáiból tanítaná tovább az AI-ügynököket

Saját, rövid tanulságok megfogalmazásával javítaná az AI-ügynökök tanulását az Apple új kutatása. Az RLTL;DR nevű módszer olyan feladatokra céloz, ahol a modell…

Az Apple kutatása szerint kevésbé számít az ügynökök körítése
Kutatás2026. október 1.

Az Apple kutatása szerint kevésbé számít az ügynökök körítése

Az Apple kutatói szerint a gépi tanulási feladatokra fejlesztett ügynököknél az alapul szolgáló nagy nyelvi modell teljesítménye fontosabb lehet az ügynök köré épített…

Az Apple SCLATE rendszere hónapok helyett órák alatt teszteli az ügynököket
Kutatás2026. szeptember 30.

Az Apple SCLATE rendszere hónapok helyett órák alatt teszteli az ügynököket

Az Apple bemutatta a SCLATE nevű végrehajtási környezetet, amely hosszú, több munkameneten átívelő forgatókönyvekben képezi és értékeli az AI-ügynököket. A rendszer egy…