Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az NVIDIA több GPU-ra terjeszti ki az óriási lineáris optimalizálást

2026. október 7. 17:45Forrás: NVIDIA Developer
Az NVIDIA több GPU-ra terjeszti ki az óriási lineáris optimalizálást
Kép: NVIDIA Developer

Az NVIDIA új, több GPU-s mPDLP megoldóval bővíti a cuOpt döntésoptimalizálási platformját. A vállalat szerint a technológia akár 100 millió változónál nagyobb lineáris programozási feladatok kezelését is lehetővé teszi, miközben GPU-nként akár hatszor alacsonyabb csúcsmemória-használatot érhet el.

A lényeg röviden
  • Az mPDLP több NVLink-kapcsolatú GPU között osztja el a lineáris programozási feladatokat.
  • GPU-nként akár hatszor alacsonyabb csúcsmemória-használatot ígér az egy GPU-s PDLP-hez képest.
  • A legnagyobb tesztelt feladatoknál a PDLP-lépések gyorsulása elérte a 11,4-szeres értéket.
  • A Kinaxis 3,3-szoros, a PSR ötszörösnél nagyobb gyorsulásról számolt be.

Több GPU között osztja szét a feladatokat

Az NVIDIA Developer október 7-én mutatta be a cuOpt Multi-GPU Primal-Dual hybrid gradient for Linear Programming, röviden mPDLP megoldóját. A rendszer a lineáris programozási feladatokat NVLink-kapcsolatú GPU-k között osztja el, így olyan modellek is feldolgozhatók, amelyek egyetlen GPU számára túl nagyok vagy túl lassan oldhatók meg.

A vállalat szerint az mPDLP két fő előnyt kínál. Nagy feladatoknál csökkenti a megoldási időt, emellett a csúcsmemória használata GPU-nként akár hatszor alacsonyabb lehet az egy GPU-n futó PDLP-hez képest. Az összehasonlítás legfeljebb 2,1 milliárd nem nulla mátrixelemet tartalmazó lineáris programozási feladatokra vonatkozik.

A technológiát olyan területekre szánják, ahol a tervezési modellek egyre több terméket, szállítási útvonalat és korlátot tartalmaznak. Az NVIDIA példaként említi az ellátási láncok tervezését és az energiaipari kapacitásbővítési modelleket.

A kommunikáció csökkentése a kulcs

A PDLP egy elsőrendű módszer lineáris programozási feladatok megoldására. A számítási ciklus központi eleme a ritka mátrixvektor-szorzás, amelyet több GPU-n is jól lehet párhuzamosítani. A megosztott futtatásnál ugyanakkor a GPU-k közötti kommunikáció és a munkaterhelés egyenetlen eloszlása lassíthatja a feldolgozást.

Az mPDLP a korábbi D-PDLP kétdimenziós particionálási megközelítésétől eltérően a két egymást követő mátrixvektor-szorzást közösen veszi figyelembe. A mátrix felosztásakor min-cut particionálást használ, amely igyekszik ugyanazon a GPU-n tartani a szorosan összekapcsolódó bemeneti és kimeneti vektorokat. Ezzel csökkenthető a GPU-k közötti adatcsere.

Az NVIDIA szerint az NVLink és az NVSwitch biztosítja a hardveres adatkapcsolatot, az NCCL könyvtár pedig a GPU-k közötti pont-pont kommunikációt és kollektív műveleteket támogatja. A vállalat megfogalmazása szerint ezek együtt egy gyors, megosztott gépként kezelhető több különálló GPU-t tesznek lehetővé.

A tesztekben a legnagyobb modellek profitáltak a legtöbbet

Az NVIDIA több mint 100 lineáris programozási feladaton végzett méréseket DGX B200 rendszereken. A beszámoló szerint az mPDLP előnye szorosan összefüggött a problémák méretével. A gyorsulás akkor vált érzékelhetővé, amikor a nem nulla mátrixelemek száma meghaladta a 10 milliót, a legnagyobb feladatoknál pedig a PDLP-lépések önmagukban akár 11,4-szer gyorsabbak voltak.

A 10 milliónál több nem nulla elemet tartalmazó nagy feladatok többségénél az mPDLP 1,2 és 2,5 közötti gyorsulást ért el a korábbi D-PDLP megoldáshoz képest. A teljesítmény ugyanakkor a mátrix ritkasági szerkezetétől és az úgynevezett élvágási arányoktól is függött.

Az NVIDIA egy korábbi, több mint 104 millió nem nulla elemet tartalmazó zib03 benchmarkot is kiemel. A vállalat szerint ezt a feladatot mPDLP-vel több GPU-n futtatva csaknem tízszer gyorsabban oldották meg, mint egy évvel korábban.

Ellátási láncban és energiatervezésben is tesztelték

A technológiát két partneralkalmazással is bemutatják. A Kinaxis globálisan korlátozott ellátási és termelési tervezési modellje több mint 135 millió változót tartalmazott. A vállalat nyolc, NVLink-kapcsolatú H100 GPU használatával 3,3-szeres gyorsulásról számolt be.

A PSR egy sztochasztikus energiabővítési modellen mért ötszörösnél nagyobb gyorsulást. Ebben a tesztben 185 millió változó szerepelt, a futtatás pedig nyolc B200 GPU-n történt.

Az mPDLP forráskódja elérhető a GitHubon, az NVIDIA pedig külön oktatóanyagot kínál a cuOpt telepítéséhez, a megoldó beállításához és a különböző GPU-számok mellett mért megoldási idők összehasonlításához. A bejelentés alapján a fejlesztés azoknak a tervezési munkafolyamatoknak lehet fontos, amelyeknél a modell mérete már egyetlen GPU memóriáját vagy a rendelkezésre álló tervezési időt is meghaladja.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

Az NVIDIA és a Microsoft helyi AI-ügynökökre építi a Windows jövőjét
Chipek és infrastruktúra2026. október 7. 20:45

Az NVIDIA és a Microsoft helyi AI-ügynökökre építi a Windows jövőjét

Az NVIDIA és a Microsoft olyan hardveres és szoftveres alapokon dolgozik, amelyekkel az AI-ügynökök közvetlenül Windows PC-ken futhatnak. Az RTX Spark laptopok…

Az NVIDIA szerint három tényezőn múlik az AI-gyárak megtérülése
Chipek és infrastruktúra2026. október 1. 15:00

Az NVIDIA szerint három tényezőn múlik az AI-gyárak megtérülése

Az AI-gyárak megtérülését az NVIDIA szerint a megawattonkénti teljesítmény, a hardver hasznos élettartama és a kiszolgálható kereslet együtt határozza meg. A vállalat a…

Az NVIDIA szerint 24 százalékkal több token fér el ugyanakkora keretben
Chipek és infrastruktúra2026. szeptember 15. 18:55

Az NVIDIA szerint 24 százalékkal több token fér el ugyanakkora keretben

Az NVIDIA két példán keresztül mutatta be, hogyan növelhető az AI-adatközpontok teljesítménye változatlan energia-keret mellett. A Lambda tesztjében 24 százalékkal nőtt…