Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

NVIDIA: alig lassult a titkosított DeepSeek-R1 futtatás B200 GPU-kon

2026. szeptember 22.Forrás: NVIDIA Developer
NVIDIA: alig lassult a titkosított DeepSeek-R1 futtatás B200 GPU-kon
Kép: NVIDIA Developer

A nagy nyelvi modellek érzékeny adatokon végzett inferenciájához az NVIDIA szerint úgy adható hardveres védelem, hogy közben a teljesítményveszteség mérsékelt marad. A vállalat méréseiben nyolc NVIDIA B200 GPU-n a DeepSeek-R1 futtatása Confidential Computing mellett a baseline kimeneti tokenátviteli teljesítmény 96,1 és 98,2 százaléka között maradt.

A lényeg röviden
  • Az NVIDIA Confidential Computing memóriatitkosított CVM-eket, bizalmas GPU-kat és titkosított NVLinket használ.
  • A tesztben 8 NVIDIA B200 GPU-n futott a nvidia/DeepSeek-R1-0528-NVFP4 modell TensorRT LLM-mel.
  • CC bekapcsolása mellett a kimeneti tokenátviteli teljesítmény a baseline 96,1 és 98,2 százaléka között maradt.
  • A mean TPOT többlete 1,2 és 4,3 százalék között volt 1 és 16 közötti konkurenciaszinteken.
  • A TensorRT LLM CC-tudatos módosításai az adatmozgatást, az autotuner időmérését és a több GPU-s kommunikációt érintik.

Titkosított környezetben futó AI-inferencia

Az NVIDIA 2026. szeptember 22-én közzétett fejlesztői blogbejegyzése szerint a nagy nyelvi modellek inferenciája egyre gyakrabban dolgoz fel érzékeny információkat és saját modellkontextust személyes, vállalati és szabályozott környezetekben. A vállalat erre a problémára a NVIDIA Confidential Computing, röviden CC használatát emeli ki, amely memóriatitkosított bizalmas virtuális gépekre, bizalmas GPU-kra és titkosított NVIDIA NVLink kapcsolatra épít.

A bejegyzés középpontjában az áll, hogyan lehet termelési AI-inferenciát futtatni megbízható hardveren úgy, hogy a biztonsági réteg ne bontsa meg túlzottan a futtatási teljesítményt. Az NVIDIA szerint az olyan inferenciakeretrendszerek, mint a NVIDIA TensorRT LLM, a keretrendszerszintű optimalizációkat és az NVIDIA gyorsított számítástechnikát kombinálják, de a CC-környezet megváltoztatja a memóriamozgatásra, időzítésre, ütemezésre és több GPU-s kommunikációra vonatkozó feltételezéseket.

A cég állítása szerint ezért a keretrendszert és a bizalmas számítási környezetet együtt kell optimalizálni. A bejegyzés kifejezetten azoknak az AI platformmérnököknek szól, akik NVIDIA Blackwell GPU-kon értékelik a bizalmas inferenciát.

Így mérték a Confidential Computing többletterhét

Az NVIDIA teljesítménymérnökei olyan terhelést választottak, amely láthatóvá teszi a CC többletterhét. A forrás szerint a magas kérésmennyiség elfedheti a fix titkosítási költségeket, ezért a vizsgált munkaterhelés hosszú bemeneti kontextust, hosszabb kimenetgenerálást és alacsony párhuzamosságot használt.

A konfigurációban a modell nvidia/DeepSeek-R1-0528-NVFP4 volt, az inferenciakeretrendszer a TensorRT LLM PyTorch backenddel. Az I/O szekvenciahossz 32K bemenet és 1K kimenet volt, a párhuzamos kérések száma 1, 2, 4, 8 és 16. A párhuzamosítás TP=8, EP=1, PP=1 beállítással futott, a KV cache pedig FP8 formátumot használt.

A kontrollált összehasonlításban ugyanazt a terhelést futtatták CC nélkül és CC-vel, miközben a modell, a hardver, a keretrendszer-verzió, a szekvenciahossz, a párhuzamosítás és a konkurenciaszint változatlan maradt. A teljesítményt két mutatóval írták le: mennyi kimeneti token per másodperc maradt meg a CC nélküli baseline-hoz képest, valamint mekkora volt a Time Per Output Token, vagyis a kimeneti tokenenkénti idő többlete.

A B200 tesztrendszeren 96 százalék felett maradt az áteresztés

A mérésekhez az NVIDIA egy NVIDIA DGX B200 rendszert használt, benne 8 NVIDIA B200 GPU-val. A platform Intel TDX volt, a host operációs rendszer Ubuntu 25.10, a host kernel 6.17.0-20-generic, a vendég operációs rendszer Ubuntu 24.04.4 LTS, a vendég kernel 6.8.0-124-generic. A vendég 256 vCPU-t és 2 NUMA csomópontot kapott.

A szoftveres környezetben az NVIDIA driver 595.71.05, a VBIOS FW 1.4.x [97.10.64.00.0C], a GPU teljesítménylimit 1,000 W, a CUDA 13.2, a TensorRT LLM konténer pedig nvcr.io/nvidia/tensorrt-llm/release:1.3.0rc22 volt. A rendszer NCCL v2.30-at, OpenSSL 3.6.0-t, valamint Docker Container és NVIDIA Container Toolkit alapú orchestrationt használt.

Az NVIDIA eredményei szerint 1 és 16 közötti konkurenciaszinteken a CC bekapcsolása mellett a kimeneti tokenátviteli teljesítmény a CC nélküli baseline 96,1 és 98,2 százaléka között maradt. A mean TPOT a baseline-hoz képest 1,2 és 4,3 százalék közötti többletet mutatott. A forrás hangsúlyozza, hogy az ilyen összehasonlítás segíthet a csapatoknak saját terheléseiken számszerűsíteni, mennyit tartanak meg a CC nélküli teljesítményből CC engedélyezésekor.

Milyen módosításokkal csökkentették a lassulást

A bejegyzés három fő területet nevez meg, ahol a biztonságos futtatás miatt a keretrendszernek alkalmazkodnia kellett. Az első a host és az eszköz közötti adatmozgás. B200 CC módban a hostról az eszközre történő átvitel egy szoftveres, titkosított bounce bufferen halad át, mert a GPU nem fér hozzá közvetlenül a védett CVM memóriához.

Emiatt a pinned memory nem adja a megszokott aszinkron átviteli előnyt, egyes másolások pedig blokkolhatják a hívó szálat. A TensorRT LLM erre CC-tudatos memóriaválasztással reagál: az érintett útvonalakon pageable memoryt választ, és az ismétlődő token-, valamint samplingadat-visszaolvasást aszinkron workerbe helyezi, hogy a védett másolások ne blokkolják a fő ütemezőt dekódolás közben.

A második terület a kernel autotuner időmérése. A TensorRT LLM normál esetben CUDA events alapján hasonlítja össze a lehetséges taktikákat, de a tesztelt CC-konfigurációban ezek az időbélyegek instabil jelet adtak, ami lassabb taktika kiválasztásához vezethetett. A megoldás az, hogy CC alatt a GPU %globaltimer szolgál a taktikai mérésekhez, CC-n kívül pedig maradnak a CUDA events mérések.

A harmadik terület a több GPU-s kommunikáció. Az NVIDIA szerint az NVLS, vagyis NVLink SHARP multicast nem érhető el B200 CC konfigurációkban. Emiatt a keretrendszereknek érzékelniük kell az NVLS elérhetőségét, és olyan kommunikációs algoritmusokat kell választaniuk, amelyek az adott üzenetméret, topológia és munkaterhelés mellett csökkentik a késleltetést.

Mit jelent ez a felhasználóknak és a piacnak

Az NVIDIA üzenete az, hogy a bizalmas inferencia bevezetése nem szünteti meg a teljesítménymérnöki munka szükségességét, sőt fontosabbá teszi a keretrendszer szintjén történő alkalmazkodást. A vállalat szerint a Confidential Computing hardveresen érvényesített védelmet terjeszt ki a bizalmas virtuális gépekre, az NVIDIA Blackwell GPU-kra és a titkosított NVLinkre, miközben saját modellek, vállalati kontextusok és érzékeny promptok feldolgozását védi.

A gyakorlati következtetés a forrás alapján az, hogy a CC teljesítményhatását nem lehet általános számmal lezárni: azt az adott modell, szekvenciahossz, párhuzamosság, topológia és keretrendszer határozza meg. Az NVIDIA által bemutatott mérési módszer viszont mintát ad arra, hogyan lehet azonos körülmények között, CC ki és CC be állapotban összehasonlítani a termelési inferencia viselkedését.

A TensorRT LLM CC-tudatos módosításai a biztonságos adatmozgatásra, az autotuningra és a több GPU-s kommunikációra koncentrálnak. A bemutatott DeepSeek-R1 terhelésnél ezekkel a módosításokkal a bizalmas inferencia a CC nélküli kimeneti tokenátviteli teljesítmény több mint 96 százalékát megtartotta, miközben a tokenenkénti késleltetési többlet 1,2 és 4,3 százalék között maradt.

Kapcsolódó hírek

64 GB memóriával jön az NVIDIA DGX Spark új változata
Chipek és infrastruktúra2026. október 2.

64 GB memóriával jön az NVIDIA DGX Spark új változata

Az NVIDIA 2026. október 2-án bejelentette a DGX Spark 64 GB-os, egyesített memóriával szerelt konfigurációját. A rendszer október 23-án érkezik az Acer, ASUS, Dell…

NVIDIA Vera BlueField-4 STX: agentikus AI-tárolás szilíciumszintű védelemmel
Chipek és infrastruktúra2026. szeptember 28.

NVIDIA Vera BlueField-4 STX: agentikus AI-tárolás szilíciumszintű védelemmel

A Vera BlueField-4 STX az NVIDIA új bejelentése szerint az agentikus AI-hoz kapcsolódó tárolási feldolgozást szilíciumszintű biztonsággal köti össze. A közlemény 2026.…

NVIDIA: a Jetson már helyben futtat kompakt érvelő AI-modelleket
Chipek és infrastruktúra2026. szeptember 4.

NVIDIA: a Jetson már helyben futtat kompakt érvelő AI-modelleket

Az NVIDIA Developer 2026. szeptember 4-én bemutatta, hogyan telepíthetők és optimalizálhatók új, kompakt érvelő modellek NVIDIA Jetson eszközökön. A cég példaként a…