Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

31 millió dollárt vont be a GPU-kieséseket kezelő Clockwork.io

2026. október 5. 17:40Forrás: PR Newswire
31 millió dollárt vont be a GPU-kieséseket kezelő Clockwork.io
Kép: PR Newswire

A Clockwork.io 31 millió dolláros új finanszírozást jelentett be, miközben szoftverét élesben használja a LinkedIn és a Together AI, a WhiteFiber pedig bővíti az alkalmazását. A vállalat két új TorchPass-funkcióval védené a nagy, elosztott AI-feladatok előrehaladását infrastruktúrahibák esetén.

A lényeg röviden
  • A Clockwork.io 31 millió dolláros új finanszírozást jelentett be.
  • A LinkedIn havonta több tízezer GPU-óra kiesését kerüli el a LinkPass használatával.
  • A TorchPass új platformpillanatképeket és aszinkron ellenőrzőpontokat kapott.
  • A Together AI a TorchPass-t szolgáltatásként indítja el GPU-klaszterein.
  • A WhiteFiber minden klaszterén bővíti a Clockwork.io használatát.

A kieső GPU-idő csökkentése a cél

A kaliforniai Palo Altóban működő Clockwork.io olyan hibatűrő szoftvert fejleszt, amely az AI-modellek tanítását, megerősítéses tanulását és következtetését futtató munkafolyamatokat védi az infrastruktúra meghibásodásaitól. A cég közleménye szerint a technológiát a hardver és a munkafolyamat közötti köztes rétegként telepítik a platformcsapatok.

A nagy, elosztott AI-feladatok akár több ezer, összehangolt GPU-n futhatnak. Egyetlen GPU meghibásodása, hálózati kapcsolat megszakadása vagy szerverhiba az egész feladatot leállíthatja. A Clockwork.io a Metára hivatkozva azt írja, hogy a Llama 3 16 384 GPU-val végzett, 54 napos tanítása alatt átlagosan körülbelül háromóránként történt váratlan megszakítás.

A szokásos helyreállítás egy korábban elmentett ellenőrzőpont betöltése. Ez a vállalat szerint akár 90 percig is tarthat, közben a működő GPU-k tétlenek maradnak, és az utolsó ellenőrzőpont óta végzett munkát meg kell ismételni.

A LinkPass és a TorchPass eltérő hibákra reagál

A Clockwork.io LinkPass nevű megoldása a meghibásodott hálózati kapcsolat megkerülésével tereli át a forgalmat, így a futó feladat elvileg nem érzékeli a hibát. A TorchPass egy hibás GPU-ról működő eszközre helyezi át a munkát, lehetővé téve a tanítás folytatását egy korábbi állapot visszatöltése nélkül. A közlemény szerint mindkét megoldás már éles, termelési környezetben működik.

Az új TorchPass-platformpillanatképek egy futó, elosztott feladat teljes állapotát rögzítik az összes csomóponton, kódmódosítás nélkül. Ez akkor teszi lehetővé a teljes feladat visszaállítását, ha a hibát egyszerű GPU-migrációval nem lehet elhárítani.

A másik új funkció a gyors, aszinkron alkalmazásszintű ellenőrzőpont. Ez a háttérben, a feladat futása közben készül. A megoldás a friss modellparamétereket eljuttatja a következtetési példákat előállító replikákhoz, így azok kevesebb időt tölthetnek várakozással vagy elavult modellel végzett munkával. A vállalat szerint ez gyorsítja a megerősítéses tanulást.

A LinkedIn és a Together AI is használja

A LinkedIn a teljes AI-infrastruktúráján bevezette a LinkPass hálózati hibatűrését. A Clockwork.io szerint ezzel havonta több tízezer GPU-óra kiesését kerülik el. A technológia automatikusan működő útvonalra tereli a forgalmat hálózati kapcsolatok, optikai alkatrészek, kábelek vagy hálózati kártyák hibája esetén.

A Together AI a TorchPass-t szolgáltatásként indítja el GPU-klaszterein. A két vállalat a PyTorch konferencián olyan élő bemutatót tart, amelyben egy többcsomópontos tanítási feladat hálózati és GPU-hibák szándékos előidézése ellenére, újraindítás nélkül fut tovább.

A WhiteFiber, a Clockwork.io jelenlegi ügyfele, a növekvő globális GPU-szolgáltatási infrastruktúráján bővíti a szoftver használatát. A vállalat automatizált flottavizsgálata a közlemény szerint egyszerre ellenőrzi a kapcsolatokat és a csomópontokat, percek alatt azonosítja a hibákat, és lehetővé teszi azok kijavítását a klaszterek átadása előtt. A finanszírozás összegével együtt a bejelentés azt mutatja, hogy a GPU-kapacitás kihasználtsága és a kieső számítási idő kezelése a nagy AI-rendszerek üzemeltetésének központi kérdésévé vált.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A CoreWeave 42 adatközpontig bővítette AI-felhőjét
Chipek és infrastruktúra2026. október 2. 16:12

A CoreWeave 42 adatközpontig bővítette AI-felhőjét

A CoreWeave 2025-ben felgyorsította globális terjeszkedését, és az AI-rendszerek fejlesztését, futtatását és folyamatos üzemeltetését támogató felhőplatformmá bővítette…

Termékek és eszközök
Termékek és eszközök2026. szeptember 30. 23:15

Az Equinix NVIDIA és Together AI együttműködésével gyorsítja az AI-inferenciát

Az Equinix, a NVIDIA és a Together AI közös megoldással gyorsítaná az AI-inferencia kísérleti fázisból éles környezetbe való átvezetését. Az Equinix Inference Exchange…

Termékek és eszközök
Termékek és eszközök2026. szeptember 30. 23:15

Az Equinix, az NVIDIA és a Together AI az AI-következtetést célozza

Az Equinix, az NVIDIA és a Together AI közös platformmal gyorsítaná a vállalati mesterségesintelligencia-modellek éles környezetbe állítását. Az Equinix Inference…