Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A fal.ai szerint a H3 Max öt másodperces videót is három másodperc alatt készít

2026. szeptember 18. 01:36Forrás: fal.ai
A fal.ai szerint a H3 Max öt másodperces videót is három másodperc alatt készít
Kép: fal.ai

A fal.ai szerint a H3 Max öt másodperces videót kevesebb mint három másodperc alatt generál. A vállalat most azt mutatta be, milyen tréning- és kiszolgálási infrastruktúra áll a modell teljesítménye mögött.

A lényeg röviden
  • A fal.ai szerint a H3 Max öt másodperces videót kevesebb mint három másodperc alatt generál.
  • A modell a cég emberi preferenciavizsgálatában tizenkét videómodellel szemben első lett.
  • A H3 Max utótréningje GB200 NVL72 csomópontokon, fal Compute infrastruktúrán zajlott.
  • A fal Serverless külön kezeli a végrehajtási időt, a sorban állást és a hidegindítást.
  • A Model APIs több mint 1300 végpontot tesz elérhetővé egyetlen API-felületen.

A minőség és a sebesség egyszerre volt cél

A fal.ai szeptember 17-én közzétett ismertetője szerint a H3 Max tizenkét vezető videómodelllel végzett, emberi preferenciákon alapuló értékelésben első helyen végzett a minőség, az utasítások megértése és az esztétika szempontjából. A vállalat beszámolója szerint az Artificial Analysis és a Design Arena független rangsorai szintén első helyre sorolták.

A cikk központi témája nem maga a modell, hanem az a platform, amely a tréningtől az éles használatig támogatja a H3 Max működését. A fal.ai szerint a modellnél az volt a cél, hogy a magas minőség alacsony késleltetéssel párosuljon. A vállalat ezt az iparágban új területként írja le, mivel korábban a gyorsítás gyakran kevesebb mintavételi lépéssel vagy kisebb modellel járt, ami ronthatta a kimenetet.

Három réteg a tréningtől az API-ig

A fal.ai platformja három fő rétegből áll. A fal Compute hosszú futású tréningfeladatokhoz biztosít infrastruktúrát, legalább 16, RDMA-alapú hálózattal összekapcsolt csomópontból álló fürtökkel. A H3 Max utótréningje a fal Research csapatának munkájaként, összekapcsolt GB200 NVL72 csomópontokon zajlott. A végső futtatás nagyjából egy héttől tíz napig tartott, miközben az ezt megalapozó kísérletek ennél is több időt igényeltek.

A második réteg a fal Serverless, ahol a betanított modelleket telepítik és szolgálják ki. A szolgáltatás a cég szerint naponta több milliárd kérést kezel több ezer végponton. A harmadik réteg a Model APIs, amely több mint 1300 végpontot tesz elérhetővé egyetlen API-felületen. A felhasználók a sorba állítást, az automatikus skálázást és a hibakezelést is ezen a rétegen keresztül vehetik igénybe.

A fal.ai szerint sok ügyfél ugyanazt az utat járja be: a modellt a Compute rétegen tréningezi, Serverless környezetben telepíti, majd Model API-ként terjeszti a piactéren. A H3 Max életciklusa is így épült fel.

Kétféle késleltetést különít el a rendszer

A fal.ai különbséget tesz az egyetlen generálás végrehajtási ideje és a felhasználó által érzékelt, teljes várakozás között. Az első azt méri, mennyi idő alatt készül el a videó egy már működő, meleg GPU-n. Ezt befolyásolja többek között a géptípus, a felbontás és a klip hossza.

A második mutató a teljes, végpontok közötti késleltetés. Nagy terhelésnél ehhez hozzáadódik a sorban állás és az új futtatókörnyezetek elindításának ideje. Ha nincs szabad futtató, a kérés várakozik, az automatikus skálázás pedig új futtatót indíthat a beállításoknak megfelelően. Az új futtató hidegindítása így a kérés indítási idejének részévé válik.

A fal Serverless irányítópultja külön méri a Request Startup és a Request Execution értéket, valamint a teljes késleltetést is. A rendszer korlátlan méretű várósort használ, az újrapróbálható futtatói hibákat pedig automatikusan visszahelyezi a sorba, így a leírás szerint a hirtelen terhelési csúcsok kezelhetők anélkül, hogy a kéréseket el kellene dobni.

A felhasználók számára a várakozási idő a kulcskérdés

A fal.ai ismertetője alapján a H3 Max sebessége két mérnöki feladat eredménye. A modell utótréningje a generálás végrehajtási idejét igyekezett csökkenteni úgy, hogy közben megőrizze a minőségi értékelésekben elért helyezését. A Serverless réteg ezzel párhuzamosan a kapacitás, a sorban állás és a hidegindítás kezelésével a terhelés alatti teljes várakozási időt célozza.

Ez a megközelítés a fejlesztőknek egy közös infrastruktúrát kínál a modell tréningjéhez, telepítéséhez és API-n keresztüli eléréséhez. A végfelhasználó ebből elsősorban azt érzékeli, hogy a videó elkészítésének ideje nem csak egyetlen GPU-n végzett számítás sebességétől függ, hanem attól is, hogyan reagál a szolgáltatás a párhuzamos kérésekre.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A Baseten szerint 200 token/másodperc felett fut nála a GLM-5
Fejlesztőknek2026. október 2. 18:25

A Baseten szerint 200 token/másodperc felett fut nála a GLM-5

A Baseten állítása szerint a GLM-5 több mint 200 token/másodperces sebességet ért el a szolgáltatásán, miközben az első tokenig eltelt idő körülbelül 200 ezredmásodperc…

A CoreWeave szerint élmezőnyben a Kimi K2.7 Code ár-teljesítménye
Termékek és eszközök2026. október 2. 16:12

A CoreWeave szerint élmezőnyben a Kimi K2.7 Code ár-teljesítménye

Elérhetővé vált a Moonshot AI Kimi K2.7 Code modellje a CoreWeave Serverless Inference szolgáltatásán. A CoreWeave szerint a modell a szolgáltatók között a legmagasabb…

A fal szerint három másodperc alatt készít videót a H3 Max
Modellek2026. augusztus 27. 21:02

A fal szerint három másodperc alatt készít videót a H3 Max

A fal bemutatta a H3 Max videógeneráló modellt, amely a vállalat szerint 5 másodperces videót kevesebb mint 3 másodperc alatt készít el. A MiniMax H3 továbbképzett…