A FLUX 3 már robotokat is irányít a Black Forest Labs szerint

A Black Forest Labs és a mimic robotics közösen fejlesztette ki a FLUX-mimic modellt, amely a FLUX 3 multimodális alapmodelljére építve robotok cselekvéseit jósolja meg. A vállalat szerint a rendszert az Audi gyártási környezetében is tesztelték és bevetették.
- A FLUX-mimic a FLUX 3 multimodális alapmodelljére épül.
- A modell videó alapján robotcselekvéseket jelez előre.
- A videógenerálási minőség 3500 tanítási lépés után visszatért a korábbi szintre.
- A rendszert gyártási és logisztikai feladatokra telepítették.
- A Black Forest Labs szerint az Audi környezetében is tesztelték és bevetették.
A képgenerálástól a robotvezérlésig
A Black Forest Labs július 23-i bejelentése szerint a FLUX 3 egy korai változata már robotokon fut. A modell a korábbi FLUX 1 és FLUX 2 képgeneráló rendszerekkel szemben multimodális alapmodellként készül, amely képet, videót és hangot közösen generál.
A cég érvelése szerint egy olyan modell, amely egyszerre képes meggyőző vizuális tartalmat előállítani és robotokat irányítani, a fizikai világ működését is modellezi. A videók előállításához ugyanis a rendszernek meg kell tanulnia többek között a mozgás, az érintkezés, a tömeg, valamint az ok és okozat kapcsolatát.
A Black Forest Labs szerint a videó előrejelzése a FLUX 3 tanításának számítási költségeiből több mint 95 százalékot tett ki. A hang ezzel szemben a 720p felbontású, hanggal kiegészített videó tokenjeinek kevesebb mint 0,5 százalékát adja.
A cselekvések nem igényeltek külön alapmodellt
A fejlesztők egy nagy léptékű tanítási futtatásban a cselekvés-előrejelzést is beépítették a tananyagba, majd megvizsgálták, hogyan változik a videógenerálás minősége. A szövegből videót és képből videót készítő feladatok emberi értékelése kezdetben legfeljebb 10 százalékkal romlott.
A Black Forest Labs közlése szerint 3500 lépés után a modell visszanyerte korábbi videógenerálási minőségét, miközben már cselekvéseket is előre tudott jelezni. A vállalat ebből arra következtet, hogy a videógeneráláshoz és a robotvezérléshez ugyanaz az alapmodell is használható.
A FLUX-mimic egy könnyű cselekvésdekódert alkalmaz a FLUX 3 videó-előrejelzési útvonalából származó köztes jellemzőkön. A megközelítés célja, hogy a modell által megtanult világmodellt robotmozgásokká alakítsa. A fejlesztők szerint a generálás és a reprezentáció minősége kölcsönösen javítható, amit korábbi Self-Flow munkájuk eredményeivel támasztanak alá.
Gyártási és logisztikai feladatokra szánják
A FLUX-mimic fejlesztésében a mimic robotics robotépítési, robotbetanítási, ügyes manipulációs és gyártási bevetési tapasztalatot, a Black Forest Labs pedig multimodális modellezési és tanítási tudást biztosított. A modellt általános célú manipulációra alakították ki, és a mimic teljes körű bevetési rendszerébe integrálták.
A közlemény szerint a FLUX 3-at több tízmillió órányi általános videótartalmon, valamint több százezer órányi, emberi és robotmanipulációra összpontosító videón tanították. A mimic a rendszert olyan feladatokban telepítette, mint az alkatrészek tálcákba rendezése, elektronikus vezérlőegységek szűk illesztésű rögzítőelemekbe helyezése, komponensek összeszerelése, illetve tömítések és kábelek kezelése.
A Black Forest Labs állítása szerint a cselekvésdekóder korábbi látásalapú nyelvi cselekvési modelleknél jobb eredményt ért el még teljesen rögzített FLUX-alapmodell mellett is. Az alapmodell és a dekóder együttes finomhangolásával a FLUX-mimic a közlemény szerint a legmagasabb sikerarányokat érte el. A projekt így a FLUX 3 tartalomkészítési képességeit olyan robotikai alkalmazásokkal kapcsolja össze, amelyeket a fejlesztők valós ipari környezetben is vizsgáltak.
Black Forest Labs: FLUX 3 x mimic: The Next Generation of Video-Action Models


