A CoreWeave szerint akár tízszer gyorsabb az AI-inferencia

A CoreWeave saját benchmarkja szerint inferenciaszolgáltatása 8-10-szer gyorsabban skálázódott fel egy népszerű, általános célú felhőszolgáltatónál. A GPT-J-6B modellel végzett tesztekben a konténerek indítása és a modell betöltése is gyorsabb volt.
- A CoreWeave szerint inferenciaszolgáltatása 8-10-szer gyorsabb volt a vizsgált általános felhőnél.
- A konténerek indítása 30-45 másodpercet vett igénybe, szemben a 120-150 másodperccel.
- A modellletöltési sebesség átlaga 700 MB/s, illetve 72 MB/s volt.
- A tesztekben az EleutherAI GPT-J-6B modelljét használták.
- A CoreWeave az előnyt bare metal infrastruktúrával és automatikus GPU-skálázással magyarázza.
Rövidebb konténerindítás, gyorsabb modellbetöltés
A CoreWeave 2026. október 2-án közzétett vizsgálata az inferenciaszolgáltatások automatikus skálázását hasonlította össze saját infrastruktúráján és egy meg nem nevezett, népszerű általános célú felhőszolgáltatónál. A tesztekben az EleutherAI GPT-J-6B modelljét használták. A vállalat szerint ez egy közepes méretű, 6 milliárd paraméteres modell, amely sokféle GPU-n futtatható, és alkalmas nyelvi modell alapú gépi tanulási inferencia mérésére.
A CoreWeave mérésében a konténerek indítása átlagosan 30 és 45 másodperc között tartott, míg az általános felhőszolgáltatónál 120 és 150 másodperc között. Ez a cég számítása szerint 3-5-szörös előnyt jelentett.
A modell objektumtárolóból történő letöltésénél a CoreWeave kompatibilis objektumtárolója ugyanabban a régióban átlagosan 700 MB/s sebességet ért el, szemben a másik szolgáltató 72 MB/s értékével. A CoreWeave összefoglalója szerint gyorsított objektumtároló-hálózata 3-5-ször gyorsabb volt. A részletes leírás egyes esetekben akár 12 Gb/s sebességet említ, míg az összefoglaló 12 GB/s elérhető átviteli sebességet ír.
Az automatikus skálázásnál lett a legnagyobb különbség
A teljes folyamatot is megvizsgálták, amikor a növekvő forgalom miatt új podokat kell elindítani, és a modellt be kell tölteni. A CoreWeave-nél ez átlagosan 45-70 másodpercet vett igénybe. Ebből 30-45 másodperc jutott a konténer indítására, 15-25 másodperc pedig a modell betöltésére.
Az általános célú felhőben ugyanez a folyamat 270-390 másodpercig tartott. A CoreWeave szerint ez 8-10-szer gyorsabb inferenciaszolgáltatást eredményezett a vizsgált környezetben.
A vállalat azzal indokolja a különbséget, hogy a hagyományos felhőinfrastruktúrában a Kubernetes virtuális gépeken fut, amelyek működését egy hipervizor kezeli. Ez további réteget jelent az operációs rendszer és a hardver között. A CoreWeave architektúrájában a Kubernetes szinte közvetlenül a hardveren működik, egy könnyű operációs rendszer mellett. Ezt a megközelítést a cég szerver nélküli Kubernetesnek nevezi.
A GPU-hozzáférés és a podok indítása is számít
A CoreWeave szerint az általános felhőkben a podok indítása előtt gyakran gondot okozhat a szükséges számítási kvóta biztosítása. Ha a rendelkezésre álló keret nem elég, további hozzáférést kell kérni. A vállalat állítása szerint ez különösen nagyobb GPU-igény esetén teheti nehézkessé és időigényessé a bővítést.
A CoreWeave platformján a cég szerint nincs szükség virtuális gép indítására minden új podhoz. A szolgáltatás igény szerint több tíz, akár több ezer GPU között is képes automatikusan skálázni, majd a kereslet csökkenésekor visszaskálázni. A modell gyors betöltéséhez a CoreWeave a Tensorizer nevű, nyílt forráskódú eszközt is használja, amely PyTorch-modellek HTTP, HTTPS és S3-végpontokról történő betöltésére szolgál.
Mit jelent ez az AI-alkalmazások számára?
A CoreWeave szerint az eredmények azt mutatják, hogy az inferencia sebességét nem kizárólag a GPU-k határozzák meg. A konténerek, podok és modellek gyors indítása különösen akkor fontos, amikor rövid idő alatt nagy forgalmi csúcs jelentkezik.
A vállalat állítása szerint a gyorsabb automatikus skálázás rövidebb válaszidőt és jobb hozzáférést adhat az igény szerinti számítási kapacitáshoz. A lassabban bővíthető infrastruktúrák esetében ugyanakkor a skálázás közben érkező kérések egy része időtúllépést szenvedhet, ha a várakozási sor kapacitása nem elegendő. A bemutatott számok egyetlen, GPT-J-6B-vel végzett CoreWeave-tesztsorozat eredményei, ezért a közlemény alapján más modellekre vagy terhelésekre nem lehet automatikusan kiterjeszteni őket.


