Rekordot döntött a CoreWeave és az NVIDIA felhős AI-szuperszámítógépe

A CoreWeave és az NVIDIA több mint 3500 NVIDIA H100 Tensor Core GPU-val, 11 percnél rövidebb idő alatt teljesítette az új MLPerf GPT-3 175B tesztet. A vállalatok szerint az eredmény több mint 29-szer gyorsabb volt a következő legjobb eredménynél.
- A GPT-3 175B MLPerf-teszt kevesebb mint 11 perc alatt futott le.
- A mérés több mint 3500 NVIDIA H100 GPU-t használt.
- Az eredmény több mint 29-szer gyorsabb volt a következő legjobbnál.
- A tesztet az Inflection AI számára kiépített CoreWeave-klaszteren végezték.
- A klaszter több mint 40 000 kábelt és 500 mérföldnyi InfiniBand optikai kábelt tartalmaz.
11 perc alatt futott le a GPT-3 teszt
A CoreWeave és az NVIDIA közös nevezése rekordot jelentő eredményt ért el az MLPerf Training benchmarkon. A teszt során a CoreWeave nyilvánosan elérhető felhős infrastruktúrája több mint 3500 NVIDIA H100 Tensor Core GPU felhasználásával kevesebb mint 11 perc alatt tanította be az új GPT-3 175B nagy nyelvi modellre épülő benchmarkfeladatot.
A CoreWeave közlése szerint ez több mint 29-szer gyorsabb volt a következő legjobb versenyző eredményénél. A több mint 3500 GPU-s futtatás mérete négyszerese volt a következő legjobb nevezésének. A tesztet egy olyan éles, Inflection AI számára kiépített klaszteren végezték, amely NVIDIA Quantum-2 InfiniBand hálózatot használ.
H100 GPU-k és nagy sávszélességű hálózat
A CoreWeave felhős szuperszámítógépe a világ egyik legnagyobb NVIDIA HGX-klasztere a vállalat szerint. Az infrastruktúra legújabb HGX-szervereket, NVIDIA H100 Tensor Core GPU-kat, Intel 4. generációs Xeon Scalable processzorokat, valamint NVIDIA ConnectX-7 400 Gb/s InfiniBand hálózatot és BlueField-2 DPU-kat tartalmaz.
Az MLPerf iparági szabványként használt teljesítményteszt a modellbetanítást és a következtetést is vizsgálja. A benchmarkokat akadémiai, kutatólaboratóriumi és iparági szakemberek értékelik, és olyan feladatokat fednek le, amelyek az AI aktuális állapotát tükrözik. Az MLPerf Training 3.0 verziója vezette be a GPT-3 175B tesztet. Ez a Transformer hálózati architektúrára épülő nagy nyelvi modell olyan szolgáltatások alapját adja, mint az OpenAI ChatGPT-je.
Az Inflection AI klaszterén futott a mérés
A benchmarkhoz használt klasztert jelenleg az Inflection AI használja, amely a teszteléshez rendelkezésre bocsátotta a számítási kapacitást. A vállalat Pi nevű személyes AI-szolgáltatása természetes hangvételű beszélgetéseket, baráti tanácsokat és tömör információkat kínál. A Pi-t a CoreWeave NVIDIA H100 példányain tanították be.
Az Inflection AI klasztere több mint 40 000 kábelt és 500 mérföldnyi, vagyis a forrás szerint körülbelül 805 kilométernyi InfiniBand optikai kábelt tartalmaz. A CoreWeave által használt NVIDIA Quantum InfiniBand technológia lehetővé teszi, hogy a GPU-k alacsony késleltetéssel, nagy léptékben közvetlenül kommunikáljanak egymással.
A felhős AI-infrastruktúra méretezése a tét
A CoreWeave szerint a generatív AI-alkalmazások és a nagy nyelvi modellek nagy mennyiségű adat feldolgozásához jelentős számítási kapacitást igényelnek. A vállalat úgy építette ki specializált infrastruktúráját, hogy a párhuzamos munkaterhelések több NVIDIA GPU-n fussanak, és a csapatok a számítási, tárolási, hálózati és szoftveres erőforrásokat a feladataikhoz igazíthassák.
Mike Intrator, a CoreWeave vezérigazgatója és társalapítója szerint az eredmények azt mutatják, hogy a vállalat képes az AI-laborok által igényelt léptékben és tempóban biztosítani a szolgáltatásait. Brian Venturo technológiai vezető és társalapító azt írta, hogy a vállalat korábban jellemzően 2000 és 3000 közötti GPU-ról beszélt egy szolgáltatónál, egy helyszínen, miközben a CoreWeave 20 000-nél több NVIDIA GPU-t tartalmazó telepítéseket épít.
A mostani eredmény a CoreWeave értelmezésében azt jelzi, hogy a nagy, párhuzamos AI-munkaterhelésekhez a nyilvános felhőben is elérhető a több ezer GPU-t összekapcsoló infrastruktúra. A vállalat a következő időszakban az AI-következtetés iránti kereslet növekedésére készül, mivel a betanított modelleket termékekben és szolgáltatásokban is használni kell.


