Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

A CoreWeave szerint akár tízszer gyorsabb az AI-inferencia

2026. október 2.Forrás: CoreWeave
A CoreWeave szerint akár tízszer gyorsabb az AI-inferencia
Kép: CoreWeave

A CoreWeave saját benchmarkja szerint inferenciaszolgáltatása 8-10-szer gyorsabban skálázódott fel egy népszerű, általános célú felhőszolgáltatónál. A GPT-J-6B modellel végzett tesztekben a konténerek indítása és a modell betöltése is gyorsabb volt.

A lényeg röviden
  • A CoreWeave szerint inferenciaszolgáltatása 8-10-szer gyorsabb volt a vizsgált általános felhőnél.
  • A konténerek indítása 30-45 másodpercet vett igénybe, szemben a 120-150 másodperccel.
  • A modellletöltési sebesség átlaga 700 MB/s, illetve 72 MB/s volt.
  • A tesztekben az EleutherAI GPT-J-6B modelljét használták.
  • A CoreWeave az előnyt bare metal infrastruktúrával és automatikus GPU-skálázással magyarázza.

Rövidebb konténerindítás, gyorsabb modellbetöltés

A CoreWeave 2026. október 2-án közzétett vizsgálata az inferenciaszolgáltatások automatikus skálázását hasonlította össze saját infrastruktúráján és egy meg nem nevezett, népszerű általános célú felhőszolgáltatónál. A tesztekben az EleutherAI GPT-J-6B modelljét használták. A vállalat szerint ez egy közepes méretű, 6 milliárd paraméteres modell, amely sokféle GPU-n futtatható, és alkalmas nyelvi modell alapú gépi tanulási inferencia mérésére.

A CoreWeave mérésében a konténerek indítása átlagosan 30 és 45 másodperc között tartott, míg az általános felhőszolgáltatónál 120 és 150 másodperc között. Ez a cég számítása szerint 3-5-szörös előnyt jelentett.

A modell objektumtárolóból történő letöltésénél a CoreWeave kompatibilis objektumtárolója ugyanabban a régióban átlagosan 700 MB/s sebességet ért el, szemben a másik szolgáltató 72 MB/s értékével. A CoreWeave összefoglalója szerint gyorsított objektumtároló-hálózata 3-5-ször gyorsabb volt. A részletes leírás egyes esetekben akár 12 Gb/s sebességet említ, míg az összefoglaló 12 GB/s elérhető átviteli sebességet ír.

Az automatikus skálázásnál lett a legnagyobb különbség

A teljes folyamatot is megvizsgálták, amikor a növekvő forgalom miatt új podokat kell elindítani, és a modellt be kell tölteni. A CoreWeave-nél ez átlagosan 45-70 másodpercet vett igénybe. Ebből 30-45 másodperc jutott a konténer indítására, 15-25 másodperc pedig a modell betöltésére.

Az általános célú felhőben ugyanez a folyamat 270-390 másodpercig tartott. A CoreWeave szerint ez 8-10-szer gyorsabb inferenciaszolgáltatást eredményezett a vizsgált környezetben.

A vállalat azzal indokolja a különbséget, hogy a hagyományos felhőinfrastruktúrában a Kubernetes virtuális gépeken fut, amelyek működését egy hipervizor kezeli. Ez további réteget jelent az operációs rendszer és a hardver között. A CoreWeave architektúrájában a Kubernetes szinte közvetlenül a hardveren működik, egy könnyű operációs rendszer mellett. Ezt a megközelítést a cég szerver nélküli Kubernetesnek nevezi.

A GPU-hozzáférés és a podok indítása is számít

A CoreWeave szerint az általános felhőkben a podok indítása előtt gyakran gondot okozhat a szükséges számítási kvóta biztosítása. Ha a rendelkezésre álló keret nem elég, további hozzáférést kell kérni. A vállalat állítása szerint ez különösen nagyobb GPU-igény esetén teheti nehézkessé és időigényessé a bővítést.

A CoreWeave platformján a cég szerint nincs szükség virtuális gép indítására minden új podhoz. A szolgáltatás igény szerint több tíz, akár több ezer GPU között is képes automatikusan skálázni, majd a kereslet csökkenésekor visszaskálázni. A modell gyors betöltéséhez a CoreWeave a Tensorizer nevű, nyílt forráskódú eszközt is használja, amely PyTorch-modellek HTTP, HTTPS és S3-végpontokról történő betöltésére szolgál.

Mit jelent ez az AI-alkalmazások számára?

A CoreWeave szerint az eredmények azt mutatják, hogy az inferencia sebességét nem kizárólag a GPU-k határozzák meg. A konténerek, podok és modellek gyors indítása különösen akkor fontos, amikor rövid idő alatt nagy forgalmi csúcs jelentkezik.

A vállalat állítása szerint a gyorsabb automatikus skálázás rövidebb válaszidőt és jobb hozzáférést adhat az igény szerinti számítási kapacitáshoz. A lassabban bővíthető infrastruktúrák esetében ugyanakkor a skálázás közben érkező kérések egy része időtúllépést szenvedhet, ha a várakozási sor kapacitása nem elegendő. A bemutatott számok egyetlen, GPT-J-6B-vel végzett CoreWeave-tesztsorozat eredményei, ezért a közlemény alapján más modellekre vagy terhelésekre nem lehet automatikusan kiterjeszteni őket.

Kapcsolódó hírek

A CoreWeave a működő AI-gyárak megbízhatóságát fejleszti
Chipek és infrastruktúra2026. október 2.

A CoreWeave a működő AI-gyárak megbízhatóságát fejleszti

A CoreWeave szerint a nagy AI-klaszterek értékét nem önmagában a hardver sebessége, hanem a ténylegesen elvégzett hasznos munka határozza meg. A vállalat az NVIDIA-val…

A CoreWeave szerint az AI-gyárakat élesben is bizonyítani kell
Chipek és infrastruktúra2026. október 2.

A CoreWeave szerint az AI-gyárakat élesben is bizonyítani kell

A GPU-k önmagukban már nem bizonyítják, hogy egy AI-infrastruktúra készen áll a termelésre. A CoreWeave és az NVIDIA a számítási kapacitást, a hálózatot, a tárhelyet, az…

Rekordot döntött a CoreWeave és az NVIDIA felhős AI-szuperszámítógépe
Chipek és infrastruktúra2026. október 2.

Rekordot döntött a CoreWeave és az NVIDIA felhős AI-szuperszámítógépe

A CoreWeave és az NVIDIA több mint 3500 NVIDIA H100 Tensor Core GPU-val, 11 percnél rövidebb idő alatt teljesítette az új MLPerf GPT-3 175B tesztet. A vállalatok szerint…