Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Antidoom módszerrel csökkentené a modellek végtelen ismétléseit a Liquid AI

2026. július 7.Forrás: Liquid AI
Az Antidoom módszerrel csökkentené a modellek végtelen ismétléseit a Liquid AI
Kép: Liquid AI

A Liquid AI olyan célzott tanítási módszert mutatott be, amely a gondolkodó modellek ismétlődő szöveghurokjait, az úgynevezett doom loopokat mérsékli. Az Antidoom eljárással az LFM2.5-2.6B korai ellenőrzőpontján 10,2 százalékról 1,4 százalékra csökkent a hurkok aránya.

A lényeg röviden
  • Az Antidoom a repetitív doom loopok első ismétlődő tokenjét célozza.
  • Az LFM2.5-2.6B hurkaránya 10,2 százalékról 1,4 százalékra csökkent.
  • A Qwen3.5-4B esetén 22,9 százalékról 1 százalékra esett az arány.
  • A Liquid AI szerint az értékelési pontszámok mindkét modellen javultak.

Amikor a modell ugyanazt a gondolatmenetet ismétli

A Liquid AI július 7-én közzétett bemutatója szerint a repetitív degeneráció gyakori hibajelenség a modellek használata közben. A modell előállít egy szövegrészletet, például a „Wait, let me reconsider…” fordulatot, majd ugyanazt újra és újra megismétli, végül pedig kimeríti a kontextusablakot. A vállalat ezt a jelenséget doom loopnak nevezi.

A kisebb gondolkodó modellek különösen hajlamosak erre hosszú gondolkodási nyomok és nehéz feladatok esetén. A probléma a Liquid AI szerint főként a nehéz matematikai és programozási feladatoknál jelenik meg. A hagyományos megoldás az ismétlési büntetés, vagyis a repetition_penalty használata, ez azonban a vállalat szerint a teljesítményt is ronthatja.

Három tényező erősíti a hurkokat

A Liquid AI három, egymással összefüggő mechanizmust azonosított. Egyes tokenek eleve nagyobb valószínűséggel jelennek meg, különösen bizonytalanság esetén. Ilyenek lehetnek a gondolkodást jelző vagy önreflexív kifejezések, például a „Wait” és az „Alternatively”. Ezek hasznos stratégia- vagy ellenőrzési váltást is jelezhetnek, de bizonytalan helyzetben ismétlődő gondolatmenetet indíthatnak újra.

Az LFM2.5-2.6B korai ellenőrzőpontján a hurkok leggyakoribb kezdőtokenje a „the” volt, 11,39 százalékos aránnyal. Ezt a „So” követte 4,51 százalékkal, majd az „Alternatively” 3,22 százalékkal, a „Wait” 2,56 százalékkal és a „But” 2,46 százalékkal.

A korábbi szöveg emellett tovább erősíti ugyanazon sorozat valószínűségét. Ismétléskor a hurok tokenjeinek esélye egyre közelebb kerülhet az 1-hez. Alacsony hőmérsékleten a modell mindig a legvalószínűbb tokent választja, így a helyileg megerősödött hurokból nehéz kilépnie. A Liquid AI szerint jelentős ismétlés még 0,67-es hőmérsékleten is előfordult.

Az Antidoom csak a kritikus tokennél avatkozik be

Az Antidoom a Final Token Preference Optimization, röviden FTPO nevű eljárásra épül. A Liquid AI először alacsony hőmérsékleten generált válaszokat egy, a hurkok kiváltására összeállított promptkeverékkel. A hibás mintákban olyan ismétlődő szakaszokat keresett, amelyek legalább négyszer és legalább 60 karakteren keresztül jelentek meg.

Ezután a módszer az első ismétlés első tokenjét célozza meg. A modell eredeti eloszlásából legfeljebb 20 ésszerű alternatívát választanak ki, majd a képzés során ezeket részesítik előnyben az elutasított tokennel szemben. A cél az, hogy a modell egyetlen kritikus ponton koherensebb folytatást válasszon, miközben a többi token eloszlása csak korlátozottan változik.

Az FTPO a Direct Preference Optimizationhöz hasonló preferenciatanítási algoritmus, de csak egy, generálás közben már létrejött sorozat utolsó tokenjét tanítja. Mintánként több kiválasztott tokennel dolgozik, logitok alapján számított, KL-szerű veszteséget használ, és külön szabályozza a módosítani kívánt, illetve a többi tokenhez tartozó értékeket.

Jelentősen csökkent a hurkok aránya

Az LFM2.5-2.6B korai ellenőrzőpontján a nehéz matematikai és programozási promptokra adott válaszok 10,2 százalékában jelent meg repetitív hurok. Az Antidoom tanítása után ez az arány 1,4 százalékra esett, miközben a Liquid AI szerint az értékelési pontszámok minden vizsgált területen javultak.

A vállalat a Qwen3.5-4B modellen is lefuttatta a folyamatot. Ennél a modellnél a doom loopok aránya mohó mintavételezés mellett 22,9 százalékról 1 százalékra csökkent, az értékelési eredmények pedig számottevően javultak.

A Liquid AI szerint a tanítási adatkészlet nem új matematikai vagy programozási tudást ad a modelleknek. A cél a vállalat megfogalmazása szerint annak a hibának az eltávolítása, amely megakadályozza, hogy a modell eljusson olyan válaszokhoz, amelyeket egyébként már képes lenne előállítani. A bemutatott eredmények alapján a két vizsgált modellen az alacsony hőmérsékletű, közel mohó mintavételezés bizonyult kedvezőbbnek a hurkok megszüntetése után.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A látható minták még nem bizonyítják, hogyan gondolkodik egy AI
Kutatás2026. október 4. 13:41

A látható minták még nem bizonyítják, hogyan gondolkodik egy AI

A NAVER LABS Europe kutatása szerint a látens gondolkodási modellekben megfigyelhető minták önmagukban nem bizonyítják, hogy a modellek valóban az ezekhez társított…

Kilenc RIKEN-közreműködésű tanulmányt fogadtak el az EMNLP 2026 fő konferenciájára
Kutatás2026. szeptember 30. 03:57

Kilenc RIKEN-közreműködésű tanulmányt fogadtak el az EMNLP 2026 fő konferenciájára

Kilenc, a RIKEN Center for Advanced Intelligence Project kutatóinak közreműködésével készült tanulmányt fogadtak el az EMNLP 2026 fő konferenciájára. További hét…

Gyorsabb lehet a képfeldolgozó LFM2.5-VL modell
Kutatás2026. szeptember 24. 16:08

Gyorsabb lehet a képfeldolgozó LFM2.5-VL modell

A Hugging Face bemutatta az LFM2.5-VL-DSpark megoldást, amely a képet és szöveget is kezelő modellek következtetését gyorsíthatja. A közzétett adatok szerint a gyorsulás…