31 millió dollárt vont be a GPU-kieséseket kezelő Clockwork.io

A Clockwork.io 31 millió dolláros új finanszírozást jelentett be, miközben szoftverét élesben használja a LinkedIn és a Together AI, a WhiteFiber pedig bővíti az alkalmazását. A vállalat két új TorchPass-funkcióval védené a nagy, elosztott AI-feladatok előrehaladását infrastruktúrahibák esetén.
- A Clockwork.io 31 millió dolláros új finanszírozást jelentett be.
- A LinkedIn havonta több tízezer GPU-óra kiesését kerüli el a LinkPass használatával.
- A TorchPass új platformpillanatképeket és aszinkron ellenőrzőpontokat kapott.
- A Together AI a TorchPass-t szolgáltatásként indítja el GPU-klaszterein.
- A WhiteFiber minden klaszterén bővíti a Clockwork.io használatát.
A kieső GPU-idő csökkentése a cél
A kaliforniai Palo Altóban működő Clockwork.io olyan hibatűrő szoftvert fejleszt, amely az AI-modellek tanítását, megerősítéses tanulását és következtetését futtató munkafolyamatokat védi az infrastruktúra meghibásodásaitól. A cég közleménye szerint a technológiát a hardver és a munkafolyamat közötti köztes rétegként telepítik a platformcsapatok.
A nagy, elosztott AI-feladatok akár több ezer, összehangolt GPU-n futhatnak. Egyetlen GPU meghibásodása, hálózati kapcsolat megszakadása vagy szerverhiba az egész feladatot leállíthatja. A Clockwork.io a Metára hivatkozva azt írja, hogy a Llama 3 16 384 GPU-val végzett, 54 napos tanítása alatt átlagosan körülbelül háromóránként történt váratlan megszakítás.
A szokásos helyreállítás egy korábban elmentett ellenőrzőpont betöltése. Ez a vállalat szerint akár 90 percig is tarthat, közben a működő GPU-k tétlenek maradnak, és az utolsó ellenőrzőpont óta végzett munkát meg kell ismételni.
A LinkPass és a TorchPass eltérő hibákra reagál
A Clockwork.io LinkPass nevű megoldása a meghibásodott hálózati kapcsolat megkerülésével tereli át a forgalmat, így a futó feladat elvileg nem érzékeli a hibát. A TorchPass egy hibás GPU-ról működő eszközre helyezi át a munkát, lehetővé téve a tanítás folytatását egy korábbi állapot visszatöltése nélkül. A közlemény szerint mindkét megoldás már éles, termelési környezetben működik.
Az új TorchPass-platformpillanatképek egy futó, elosztott feladat teljes állapotát rögzítik az összes csomóponton, kódmódosítás nélkül. Ez akkor teszi lehetővé a teljes feladat visszaállítását, ha a hibát egyszerű GPU-migrációval nem lehet elhárítani.
A másik új funkció a gyors, aszinkron alkalmazásszintű ellenőrzőpont. Ez a háttérben, a feladat futása közben készül. A megoldás a friss modellparamétereket eljuttatja a következtetési példákat előállító replikákhoz, így azok kevesebb időt tölthetnek várakozással vagy elavult modellel végzett munkával. A vállalat szerint ez gyorsítja a megerősítéses tanulást.
A LinkedIn és a Together AI is használja
A LinkedIn a teljes AI-infrastruktúráján bevezette a LinkPass hálózati hibatűrését. A Clockwork.io szerint ezzel havonta több tízezer GPU-óra kiesését kerülik el. A technológia automatikusan működő útvonalra tereli a forgalmat hálózati kapcsolatok, optikai alkatrészek, kábelek vagy hálózati kártyák hibája esetén.
A Together AI a TorchPass-t szolgáltatásként indítja el GPU-klaszterein. A két vállalat a PyTorch konferencián olyan élő bemutatót tart, amelyben egy többcsomópontos tanítási feladat hálózati és GPU-hibák szándékos előidézése ellenére, újraindítás nélkül fut tovább.
A WhiteFiber, a Clockwork.io jelenlegi ügyfele, a növekvő globális GPU-szolgáltatási infrastruktúráján bővíti a szoftver használatát. A vállalat automatizált flottavizsgálata a közlemény szerint egyszerre ellenőrzi a kapcsolatokat és a csomópontokat, percek alatt azonosítja a hibákat, és lehetővé teszi azok kijavítását a klaszterek átadása előtt. A finanszírozás összegével együtt a bejelentés azt mutatja, hogy a GPU-kapacitás kihasználtsága és a kieső számítási idő kezelése a nagy AI-rendszerek üzemeltetésének központi kérdésévé vált.
PR Newswire: Clockwork.io recauda 31 millones de dólares
