Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A Black Forest Labs bemutatta a képet, videót és hangot együtt tanuló FLUX 3-at

2026. július 23.Forrás: Black Forest Labs
A Black Forest Labs bemutatta a képet, videót és hangot együtt tanuló FLUX 3-at
Kép: Black Forest Labs

Korai hozzáférésben elérhetővé vált a Black Forest Labs FLUX 3 nevű multimodális alapmodellje, amely képekből, videókból és hanganyagokból közösen tanul. A modell szöveges utasításokból és referenciaanyagokból is képes képet, illetve hanggal kiegészített videót létrehozni.

A lényeg röviden
  • A FLUX 3 képekből, videókból és hangból közösen tanul.
  • A modell legfeljebb 20 másodperces, hanggal kiegészített videókat generál.
  • A Black Forest Labs előzetes tesztjeiben több videós modellnél is gyakrabban kapott előnyt.
  • A rendszer képszerkesztésre és akciók, köztük robotikai műveletek előrejelzésére is használható.
  • A képességeket fokozatosan, korai hozzáférés és biztonsági tesztelés után vezetik be.

Egy modellben egyesíti a képet, a videót és a hangot

A Black Forest Labs július 23-án mutatta be a FLUX 3-at, amelyet a vállalat a valós világ modellezésére szánt multimodális alapmodellként ír le. A rendszer egységes architektúrában tanul képekből, videókból és hangból. A cég szerint ennek célja, hogy a modell ne különálló adatformátumokat kezeljen, hanem a világ tárgyairól, mozgásáról és eseményeinek hangjáról is összefüggő reprezentációt alakítson ki.

A Black Forest Labs magyarázata szerint a kép elsősorban a térbeli struktúrákat és az adott pillanat kapcsolatait mutatja meg, a videó ehhez hozzáadja az időbeli változásokat és a fizikai dinamika jeleit. A hang olyan ok-okozati összefüggésekre is utalhat, amelyeket önmagában a látás nem érzékel. A nyelv ezeket a benyomásokat célokkal, elvonatkoztatásokkal és utasításokkal kapcsolja össze.

A FLUX 3 a vállalat Self-Flow nevű megközelítésére épül, amely a multimodális tartalom létrehozását és megértését ugyanazon architektúrán belül hangolja össze. A Black Forest Labs a modell tanításához a videó, a kép és a hang feldolgozását egyszerre skálázta fel.

Hanggal együtt készít akár 20 másodperces videókat

A FLUX 3 egyetlen generálással legfeljebb 20 másodperces, hanggal kiegészített videót tud létrehozni. Támogatja a szövegből videó készítését, a kezdőképből indított animációt, a képes referenciák használatát, valamint a videóból videóba történő átalakítást. Utóbbi esetben egy forrásvideó központi elemei, például egy karakter, új jelenetbe vagy környezetbe vihetők át.

A felsorolt képességek között szerepel a bemeneti videó és hang folytatása, a kulcsképek közötti átmenetek létrehozása, a többnyelvű párbeszéd, valamint a különböző képarányok és vizuális stílusok kezelése. A modell a Black Forest Labs szerint a kamerás felvételektől az animációkon át a filmes megjelenésig többféle stílussal is dolgozik, és az animált feliratok, illetve tipográfiai elemek létrehozásában is erős.

A vállalat előzetes összevetéseiben a FLUX 3-at 10 másodperces, 720p felbontású, hanggal ellátott szövegből videó klipekkel vizsgálták. A modell a Grok Imagine Video ellen az összehasonlítások legfeljebb 69 százalékában, a Kling v3 Pro ellen 60 százalékában kapott előnyt. A Runway Gen-4.5-tel szemben ez az arány 77 százalék, a Luma Ray 3.2-vel szemben pedig 93 százalék volt. A Black Forest Labs hangsúlyozza, hogy ezek korai, fejlesztés alatt végzett értékelések.

Képgenerálás, robotika és fokozatos bevezetés

A FLUX 3 képek szintetizálására és szerkesztésére is használható, sokféle stílussal, képaránnyal és felbontással. A Black Forest Labs szerint a köztes tanítási szakaszban végzett előzetes vizsgálatok javulást mutattak az összetett utasítások értelmezésében és a szöveg létrehozásában. A modell több nyelven is képes nagy pontosságú szöveget megjeleníteni. A FLUX 3 Image korai hozzáférését a vállalat a következő hetekben tervezi megnyitni.

A modell akciók előrejelzésére is használható. A Black Forest Labs ezt közvetlenül a FLUX 3-ba épített akció-előrejelzéssel, illetve a videós alaprendszerre finomhangolt, feladatspecifikus modellekkel közelíti meg. A korai partnerek egyike a mimic robotics, amellyel közösen fejlesztették a FLUX-mimic rendszert. Ez a FLUX 3 gerincét a robotok ügyes manipulációjához és termelési bevetéséhez kapcsolja.

A következő hetekben és hónapokban a vállalat fokozatosan tervezi elérhetővé tenni a videó- és hanggenerálást, az akció-előrejelzést, valamint a képalkotást és képszerkesztést. Ezek API-kon, privát modellhozzáférésen, kiválasztott kutatási és kereskedelmi partnereken, illetve a FLUX 3 Dev nyílt súlyú multimodális alaprendszeren keresztül jelenhetnek meg. Minden képesség korai hozzáférési szakaszon, visszajelzésgyűjtésen és biztonsági tesztelésen megy keresztül.

Forrás
Black Forest Labs: FLUX 3: Multimodal Video, Image & Audio

Kapcsolódó hírek

A Black Forest Labs 4K-ra skálázza fel a generált videókat
Termékek és eszközök2026. augusztus 20.

A Black Forest Labs 4K-ra skálázza fel a generált videókat

A Black Forest Labs bemutatta a FLUX Video Upscale eszközt, amely a videók felbontását akár natív 4K-ig növeli. A szolgáltatás önálló FLUX Toolként és API-végpontként is…

A Flux 3 egy menetben készíti el a videót és a hangot
Modellek2026. augusztus 13. 22:10

A Flux 3 egy menetben készíti el a videót és a hangot

A Black Forest Labs Flux 3 modellje egyetlen generálási menetben készíti el a videót és a hozzá tartozó hangot. A Picsartban elérhető rendszer legfeljebb 20 másodperces…

Megjelent a FLUX 3 Video, hanggal és akár 20 másodperces klipekkel
Modellek2026. augusztus 4.

Megjelent a FLUX 3 Video, hanggal és akár 20 másodperces klipekkel

A Black Forest Labs elérhetővé tette a FLUX 3 Video kezdeti változatát, amely szövegből és képekből legfeljebb 20 másodperces, hanggal kiegészített videóklipeket készít.…