Gyorsabb diffúziós megerősítéses tanulást hoz a VeRL-Omni v0.2.0

A VeRL-Omni v0.2.0 két fő területen fejleszti a multimodális megerősítéses tanulási rendszert: gyorsítja a diffúziós modellek rollout folyamatait, és stabilabb alapot ad az omni modellek tréningjéhez. A vLLM közlése szerint a Qwen-Image FlowGRPO egyik referenciafutásában 226 másodpercről 108 másodpercre csökkent az izolált generálási idő.
- A v0.2.0 kérésenkénti kötegelést vezet be a támogatott diffúziós rolloutokhoz.
- A Qwen-Image referenciafutás generálási ideje 226 másodpercről 108 másodpercre csökkent.
- A diffúziós RL V1 trénerútvonalat és javított log-valószínűségi, súlyfrissítési támogatást kapott.
- Az omni tréning újrahasznosítható adapterekre, V1 trénerre és FSDP2-re épül.
- Az MMK12 referenciafutás 0,833 validációs jutalmat és 0,998 Pearson-korrelációt ért el.
Kérésenkénti kötegeléssel gyorsul a diffúziós RL
A diffúziós megerősítéses tanulásban egyetlen rollout több zajcsökkentési lépést, nagy látens tenzorokat, promptbeágyazásokat, opcionális classifier-free guidance-ot, jutalmazómodell-értékelést, régi log-valószínűségek újraszámítását és a modell súlyainak szinkronizálását is magában foglalhatja. A vLLM szerint a Qwen-Image FlowGRPO esetében ezért nincs egyetlen, minden teljesítményproblémát magyarázó szűk keresztmetszet.
A VeRL-Omni v0.2.0 egyik fő változtatása a request-level batching, vagyis a kérésenkénti kötegelés. A támogatott diffúziós adaptereknél ez lesz az alapértelmezett vLLM-Omni rollout útvonal. A rendszer több kompatibilis kérést egyetlen, nagyobb transzformátorfuttatásba csomagol, és külön párhuzamossági beállításokat kínál az ütemezéshez.
A diffúziós modellekhez V1 trénerútvonal is érkezik. Ez közelebb hozza a diffúziós RL-t a VeRL-Omni más részein használt modern trénerarchitektúrához, és előkészíti a rollout, valamint a tréning végrehajtásának szétválasztását.
A Qwen-Image referenciafutásban 52 százalékkal csökkent az idő
A vLLM példája a Qwen-Image OCR LoRA recept. A v0.1-es sorozatban a rollout gyakorlatilag soros, B≈1 DiT-futtatásokból állt, 10 zajcsökkentési lépéssel. A True-CFG minden lépést két előrefuttatássá duplázott, miközben a GPU-k kihasználtsága körülbelül 80 százalék maradt.
A v0.2.0 kérésenkénti csomagolása több teljes kérést küld egyetlen transzformátorfuttatásba. A közlés szerint ezzel a GPU-k kihasználtsága körülbelül 100 százalékra nőtt, az izolált generálási idő pedig 226 másodpercről 108 másodpercre esett, ami 52 százalékos csökkenés.
A Qwen-Image FlowGRPO LoRA receptben a max_num_seqs értéke 8 és 32 között hangolható, 512 pixeles True-CFG mellett. A forrás szerint a nagyobb értékek HBM-memórianyomást okozhatnak. Az SD3.5 Medium könnyebb memóriaigénye miatt akár 256-os értéket is használhat.
A receptszintű mérésben a Qwen-Image FlowGRPO LoRA alapfuttatása 4 darab H800 GPU-n körülbelül 420 másodpercet igényelt lépésenként. Az aszinkron jutalmazási változat 5 GPU-n körülbelül 360 másodpercet ért el.
Újrahasznosítható adapterek stabilizálják az omni tréninget
A kiadás másik pillére a stabil omni training. A vLLM leírása szerint az omni modellek olyan rendszerek, amelyek processzorokat, modalitásspecifikus tornyokat, tanítható részeket és a rollout során az aktorral összehangolt működést egyesítenek.
A VeRL-Omni v0.2.0 a modell- és architektúraspecifikus integrációk helyett újrahasznosítható tréningkörnyezetet épít. Ebben szerepet kap a verl V1 trénerarchitektúrája, a szabványos konfigurációs felülírás, az FSDP2 és a vLLM-Omni rollout. Az OmniModelBase adapterréteg közös felületet ad a modell, a processzor, a tanítható szakaszok, az FSDP-előkészítés és a rollout összehangolásának beállításához.
A Qwen3-Omni Thinker adaptere a thinker komponensre irányítja át a tréninget, eltávolítja a nem használt Talker és kodekhez kapcsolódó modulokat, valamint FSDP és FSDP2 környezetben is működik. A PPO tréner közben az általános RL-ciklust kezeli, így a rollout ütemezését, az előnyértékek számítását és a szabályzatfrissítéseket.
Multimodális példában 0,833-as validációs jutalom
A stabil omni tréning kiemelt receptje az MMK12. Ez képes, szöveges promptot és szöveges választ használó feladatban tanítja a Qwen3-Omni Thinker modellt GSPO optimalizálással, FSDP aktortréninggel és vLLM-Omni rolloutral. A futtatás LoRA 32-es rangot, valamint 4 darab H800 80GB GPU-n elhelyezett aktor- és rolloutmunkásokat használ.
A rollout mérete 128 prompt és 16 válasz, vagyis rolloutonként 2048 minta. A forrás szerint a tréning után a validációs jutalom 0,833, az aktor és a rollout közötti Pearson-korreláció 0,998 lett, a GPU-memóriahasználat pedig körülbelül 59 GB volt.
A VeRL-Omni v0.2.0 támogatási listáján emellett szerepel Qwen3-Omni Thinker és GSPO szöveg, kép és hang bemenetekkel, valamint DPO multimodális preferenciaadatokra. A fejlesztések a felhasználók számára azt jelentik, hogy a támogatott diffúziós és omni modellekhez több előre elkészített recept, egységesebb trénerútvonal és részletesebb kötegelési dokumentáció áll rendelkezésre.