Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Gyorsabb diffúziós megerősítéses tanulást hoz a VeRL-Omni v0.2.0

2026. augusztus 20.Forrás: vLLM
Gyorsabb diffúziós megerősítéses tanulást hoz a VeRL-Omni v0.2.0
Kép: vLLM

A VeRL-Omni v0.2.0 két fő területen fejleszti a multimodális megerősítéses tanulási rendszert: gyorsítja a diffúziós modellek rollout folyamatait, és stabilabb alapot ad az omni modellek tréningjéhez. A vLLM közlése szerint a Qwen-Image FlowGRPO egyik referenciafutásában 226 másodpercről 108 másodpercre csökkent az izolált generálási idő.

A lényeg röviden
  • A v0.2.0 kérésenkénti kötegelést vezet be a támogatott diffúziós rolloutokhoz.
  • A Qwen-Image referenciafutás generálási ideje 226 másodpercről 108 másodpercre csökkent.
  • A diffúziós RL V1 trénerútvonalat és javított log-valószínűségi, súlyfrissítési támogatást kapott.
  • Az omni tréning újrahasznosítható adapterekre, V1 trénerre és FSDP2-re épül.
  • Az MMK12 referenciafutás 0,833 validációs jutalmat és 0,998 Pearson-korrelációt ért el.

Kérésenkénti kötegeléssel gyorsul a diffúziós RL

A diffúziós megerősítéses tanulásban egyetlen rollout több zajcsökkentési lépést, nagy látens tenzorokat, promptbeágyazásokat, opcionális classifier-free guidance-ot, jutalmazómodell-értékelést, régi log-valószínűségek újraszámítását és a modell súlyainak szinkronizálását is magában foglalhatja. A vLLM szerint a Qwen-Image FlowGRPO esetében ezért nincs egyetlen, minden teljesítményproblémát magyarázó szűk keresztmetszet.

A VeRL-Omni v0.2.0 egyik fő változtatása a request-level batching, vagyis a kérésenkénti kötegelés. A támogatott diffúziós adaptereknél ez lesz az alapértelmezett vLLM-Omni rollout útvonal. A rendszer több kompatibilis kérést egyetlen, nagyobb transzformátorfuttatásba csomagol, és külön párhuzamossági beállításokat kínál az ütemezéshez.

A diffúziós modellekhez V1 trénerútvonal is érkezik. Ez közelebb hozza a diffúziós RL-t a VeRL-Omni más részein használt modern trénerarchitektúrához, és előkészíti a rollout, valamint a tréning végrehajtásának szétválasztását.

A Qwen-Image referenciafutásban 52 százalékkal csökkent az idő

A vLLM példája a Qwen-Image OCR LoRA recept. A v0.1-es sorozatban a rollout gyakorlatilag soros, B≈1 DiT-futtatásokból állt, 10 zajcsökkentési lépéssel. A True-CFG minden lépést két előrefuttatássá duplázott, miközben a GPU-k kihasználtsága körülbelül 80 százalék maradt.

A v0.2.0 kérésenkénti csomagolása több teljes kérést küld egyetlen transzformátorfuttatásba. A közlés szerint ezzel a GPU-k kihasználtsága körülbelül 100 százalékra nőtt, az izolált generálási idő pedig 226 másodpercről 108 másodpercre esett, ami 52 százalékos csökkenés.

A Qwen-Image FlowGRPO LoRA receptben a max_num_seqs értéke 8 és 32 között hangolható, 512 pixeles True-CFG mellett. A forrás szerint a nagyobb értékek HBM-memórianyomást okozhatnak. Az SD3.5 Medium könnyebb memóriaigénye miatt akár 256-os értéket is használhat.

A receptszintű mérésben a Qwen-Image FlowGRPO LoRA alapfuttatása 4 darab H800 GPU-n körülbelül 420 másodpercet igényelt lépésenként. Az aszinkron jutalmazási változat 5 GPU-n körülbelül 360 másodpercet ért el.

Újrahasznosítható adapterek stabilizálják az omni tréninget

A kiadás másik pillére a stabil omni training. A vLLM leírása szerint az omni modellek olyan rendszerek, amelyek processzorokat, modalitásspecifikus tornyokat, tanítható részeket és a rollout során az aktorral összehangolt működést egyesítenek.

A VeRL-Omni v0.2.0 a modell- és architektúraspecifikus integrációk helyett újrahasznosítható tréningkörnyezetet épít. Ebben szerepet kap a verl V1 trénerarchitektúrája, a szabványos konfigurációs felülírás, az FSDP2 és a vLLM-Omni rollout. Az OmniModelBase adapterréteg közös felületet ad a modell, a processzor, a tanítható szakaszok, az FSDP-előkészítés és a rollout összehangolásának beállításához.

A Qwen3-Omni Thinker adaptere a thinker komponensre irányítja át a tréninget, eltávolítja a nem használt Talker és kodekhez kapcsolódó modulokat, valamint FSDP és FSDP2 környezetben is működik. A PPO tréner közben az általános RL-ciklust kezeli, így a rollout ütemezését, az előnyértékek számítását és a szabályzatfrissítéseket.

Multimodális példában 0,833-as validációs jutalom

A stabil omni tréning kiemelt receptje az MMK12. Ez képes, szöveges promptot és szöveges választ használó feladatban tanítja a Qwen3-Omni Thinker modellt GSPO optimalizálással, FSDP aktortréninggel és vLLM-Omni rolloutral. A futtatás LoRA 32-es rangot, valamint 4 darab H800 80GB GPU-n elhelyezett aktor- és rolloutmunkásokat használ.

A rollout mérete 128 prompt és 16 válasz, vagyis rolloutonként 2048 minta. A forrás szerint a tréning után a validációs jutalom 0,833, az aktor és a rollout közötti Pearson-korreláció 0,998 lett, a GPU-memóriahasználat pedig körülbelül 59 GB volt.

A VeRL-Omni v0.2.0 támogatási listáján emellett szerepel Qwen3-Omni Thinker és GSPO szöveg, kép és hang bemenetekkel, valamint DPO multimodális preferenciaadatokra. A fejlesztések a felhasználók számára azt jelentik, hogy a támogatott diffúziós és omni modellekhez több előre elkészített recept, egységesebb trénerútvonal és részletesebb kötegelési dokumentáció áll rendelkezésre.

Kapcsolódó hírek

Fejlesztőknek
Fejlesztőknek2026. október 2.

A Helion gyorsíthatja a vLLM LLM-inferenciáját NVIDIA GPU-kon

A PyTorch Helion-alapú lineáris backendet integrált a vLLM-be, hogy automatikus hangolással javítsa a nagy nyelvi modellek következtetési teljesítményét. Az NVIDIA…

Fejlesztőknek
Fejlesztőknek2026. szeptember 22.

Hardverfüggetlen rétegekkel alakítja át a vLLM-et a PyTorch

A vLLM új, hardverfüggetlen rétegeket kap, hogy a projekt a legújabb GPU-kra szabott optimalizációk mellett továbbra is támogassa a régebbi GPU-kat és a külső…

vllm-metal érkezett az Apple chipes gépek párhuzamos kiszolgálására
Fejlesztőknek2026. szeptember 22.

vllm-metal érkezett az Apple chipes gépek párhuzamos kiszolgálására

A vLLM bejelentette a vllm-metal projektet, amely az Apple Silicon gépekre hozza a vLLM ütemezőjét, lapozott KV-gyorsítótárát és OpenAI-kompatibilis szerverét. A…