Az Antidoom módszerrel csökkentené a modellek végtelen ismétléseit a Liquid AI

A Liquid AI olyan célzott tanítási módszert mutatott be, amely a gondolkodó modellek ismétlődő szöveghurokjait, az úgynevezett doom loopokat mérsékli. Az Antidoom eljárással az LFM2.5-2.6B korai ellenőrzőpontján 10,2 százalékról 1,4 százalékra csökkent a hurkok aránya.
- Az Antidoom a repetitív doom loopok első ismétlődő tokenjét célozza.
- Az LFM2.5-2.6B hurkaránya 10,2 százalékról 1,4 százalékra csökkent.
- A Qwen3.5-4B esetén 22,9 százalékról 1 százalékra esett az arány.
- A Liquid AI szerint az értékelési pontszámok mindkét modellen javultak.
Amikor a modell ugyanazt a gondolatmenetet ismétli
A Liquid AI július 7-én közzétett bemutatója szerint a repetitív degeneráció gyakori hibajelenség a modellek használata közben. A modell előállít egy szövegrészletet, például a „Wait, let me reconsider…” fordulatot, majd ugyanazt újra és újra megismétli, végül pedig kimeríti a kontextusablakot. A vállalat ezt a jelenséget doom loopnak nevezi.
A kisebb gondolkodó modellek különösen hajlamosak erre hosszú gondolkodási nyomok és nehéz feladatok esetén. A probléma a Liquid AI szerint főként a nehéz matematikai és programozási feladatoknál jelenik meg. A hagyományos megoldás az ismétlési büntetés, vagyis a repetition_penalty használata, ez azonban a vállalat szerint a teljesítményt is ronthatja.
Három tényező erősíti a hurkokat
A Liquid AI három, egymással összefüggő mechanizmust azonosított. Egyes tokenek eleve nagyobb valószínűséggel jelennek meg, különösen bizonytalanság esetén. Ilyenek lehetnek a gondolkodást jelző vagy önreflexív kifejezések, például a „Wait” és az „Alternatively”. Ezek hasznos stratégia- vagy ellenőrzési váltást is jelezhetnek, de bizonytalan helyzetben ismétlődő gondolatmenetet indíthatnak újra.
Az LFM2.5-2.6B korai ellenőrzőpontján a hurkok leggyakoribb kezdőtokenje a „the” volt, 11,39 százalékos aránnyal. Ezt a „So” követte 4,51 százalékkal, majd az „Alternatively” 3,22 százalékkal, a „Wait” 2,56 százalékkal és a „But” 2,46 százalékkal.
A korábbi szöveg emellett tovább erősíti ugyanazon sorozat valószínűségét. Ismétléskor a hurok tokenjeinek esélye egyre közelebb kerülhet az 1-hez. Alacsony hőmérsékleten a modell mindig a legvalószínűbb tokent választja, így a helyileg megerősödött hurokból nehéz kilépnie. A Liquid AI szerint jelentős ismétlés még 0,67-es hőmérsékleten is előfordult.
Az Antidoom csak a kritikus tokennél avatkozik be
Az Antidoom a Final Token Preference Optimization, röviden FTPO nevű eljárásra épül. A Liquid AI először alacsony hőmérsékleten generált válaszokat egy, a hurkok kiváltására összeállított promptkeverékkel. A hibás mintákban olyan ismétlődő szakaszokat keresett, amelyek legalább négyszer és legalább 60 karakteren keresztül jelentek meg.
Ezután a módszer az első ismétlés első tokenjét célozza meg. A modell eredeti eloszlásából legfeljebb 20 ésszerű alternatívát választanak ki, majd a képzés során ezeket részesítik előnyben az elutasított tokennel szemben. A cél az, hogy a modell egyetlen kritikus ponton koherensebb folytatást válasszon, miközben a többi token eloszlása csak korlátozottan változik.
Az FTPO a Direct Preference Optimizationhöz hasonló preferenciatanítási algoritmus, de csak egy, generálás közben már létrejött sorozat utolsó tokenjét tanítja. Mintánként több kiválasztott tokennel dolgozik, logitok alapján számított, KL-szerű veszteséget használ, és külön szabályozza a módosítani kívánt, illetve a többi tokenhez tartozó értékeket.
Jelentősen csökkent a hurkok aránya
Az LFM2.5-2.6B korai ellenőrzőpontján a nehéz matematikai és programozási promptokra adott válaszok 10,2 százalékában jelent meg repetitív hurok. Az Antidoom tanítása után ez az arány 1,4 százalékra esett, miközben a Liquid AI szerint az értékelési pontszámok minden vizsgált területen javultak.
A vállalat a Qwen3.5-4B modellen is lefuttatta a folyamatot. Ennél a modellnél a doom loopok aránya mohó mintavételezés mellett 22,9 százalékról 1 százalékra csökkent, az értékelési eredmények pedig számottevően javultak.
A Liquid AI szerint a tanítási adatkészlet nem új matematikai vagy programozási tudást ad a modelleknek. A cél a vállalat megfogalmazása szerint annak a hibának az eltávolítása, amely megakadályozza, hogy a modell eljusson olyan válaszokhoz, amelyeket egyébként már képes lenne előállítani. A bemutatott eredmények alapján a két vizsgált modellen az alacsony hőmérsékletű, közel mohó mintavételezés bizonyult kedvezőbbnek a hurkok megszüntetése után.
Liquid AI: Reducing Doom Loops with Final Token Preference Optimization | Blog


