Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

C++-os mintákkal gyorsítaná a helyi AI-futtatást az NVIDIA

2026. október 1. 19:59Forrás: NVIDIA Developer
C++-os mintákkal gyorsítaná a helyi AI-futtatást az NVIDIA
Kép: NVIDIA Developer

Az NVIDIA nyílt forráskódú C++-mintákat tett közzé helyi AI-alkalmazások fejlesztéséhez. A DIN Deploy az ONNX Runtime-ot és a TensorRT RTX végrehajtási szolgáltatót kapcsolja össze Windows és Linux alatt.

A lényeg röviden
  • A DIN Deploy ONNX Runtime és TensorRT RTX használatával kínál C++-os mintákat.
  • A minták Windows és Linux alatt, x86-64 és Arm64 platformokon használhatók.
  • A támogatott feladatok között beszédfelismerés, képszegmentálás és képgenerálás szerepel.
  • A DGX Spark mérésén a Parakeet TDT GPU-val 206,41-szeres valós idejű értéket ért el.
  • A kvantált ONNX-modell az NVIDIA szerint alkalmazáskód-módosítás nélkül behelyettesíthető.

A modellkonverziót és az alkalmazást különválasztják

Az NVIDIA Developer október 1-jén mutatta be a Do Inference Now, vagyis DIN Deploy mintagyűjteményt. A cél, hogy a fejlesztők egy modell-ellenőrzőpontból helyi, natív és hardveresen gyorsított alkalmazásig juthassanak el.

Minden minta egy Python-alapú exportálóval indul. Ez a Hugging Face-ről letöltött modell-ellenőrzőpontot ONNX-formátumú modellé alakítja. A futtatási oldal egy natív C++ parancssori alkalmazás, amely az ONNX Runtime munkamenet- és tenzorkezelő API-jaira épül.

Ez a felépítés külön kezeli a modell átalakítását és a telepítési logikát. Az NVIDIA szerint így az exportált modell helyi alkalmazásba vihető anélkül, hogy modell-specifikus futtatókörnyezetre lenne szükség. A közös kódban a gyártóspecifikus megoldások, például a CUDA API-k és kernelek, csak az opcionális gyorsítási útvonalakon jelennek meg.

Beszédfelismerés, szegmentálás és képgenerálás

A DIN Deploy többféle AI-feladathoz kínál mintát. Automatikus beszédfelismeréshez az OpenAI Whisper offline átírást biztosít különböző modellméretekben. Az NVIDIA Parakeet TDT és az NVIDIA Nemotron ASR Streaming streaming feldolgozási folyamatokat szemléltet.

A Meta SAM 2.1-re épülő minták képek és videók interaktív maszkolását támogatják. A modell kimenetei olyan szegmentációs maszkokká alakíthatók, amelyeket natív alkalmazások kijelöléshez, követéshez és más számítógépes látási feladatokhoz használhatnak.

A FLUX.2-klein-4B minta szöveges utasításokra épülő képgenerálást mutat be. A Vulkan és DirectX grafikus API-kkal kialakított együttműködés lehetővé teszi a GPU-n tárolt erőforrások integrálását egy több gyártó megoldásaival használható shaderfelületen keresztül. A DirectX-es támogatás csak Windows alatt érhető el.

A DGX Spark mérési eredményei

Az NVIDIA a kiválasztott munkafolyamatokat DGX Spark rendszeren mérte meg. A hangfeldolgozási eredményeket a valós idő többszöröseként közölték, ahol a magasabb érték gyorsabb feldolgozást jelent.

  • OpenAI Whisper large-v3-turbo: 58,5-szeres teljesítmény GPU-val és 3,8-szoros CPU-val.
  • NVIDIA Nemotron ASR Streaming 0.6B: 39,01-szeres GPU-s és 3,24-szeres CPU-s érték.
  • NVIDIA Parakeet TDT 0.6B v3: 206,41-szeres GPU-s és 14,44-szeres CPU-s érték.
  • Meta SAM 2.1 Hiera Base Plus: 38,3 képkocka másodpercenként GPU-val, szemben a CPU-n mért 0,5 képkockával.

Ezeket az adatokat az NVIDIA a DIN Deploy kiválasztott terheléseinek DGX Sparkon végzett méréseként közli.

Kvantálás és fejlesztői indulás

A FLUX.2-minta a tanítás utáni kvantálást is bemutatja az NVIDIA Model Optimizer használatával. Az így létrehozott kvantált ONNX-modell az NVIDIA szerint közvetlenül behelyettesíthető, mivel az ONNX-interfészek változatlanok maradnak, ezért az alkalmazás kódján nem kell módosítani. A kvantálás hardverfüggő.

A tárház Windows és Linux rendszerekhez, x86-64 és Arm64 platformokra is tartalmaz CMake-előbeállításokat. A projekt összeállítása után a fejlesztők ONNX-formátumba exportálhatják a modellt, majd TensorRT RTX használatával futtathatják a C++ parancssori alkalmazást. A CMake alapértelmezés szerint letölti az ONNX Runtime-ot és a TensorRT RTX-et.

A mintakódok a fejlesztők saját alkalmazásaiba is átemelhetők. Az NVIDIA a DIN Deploy mellett a TensorRT for RTX dokumentációját, az NVIDIA Local AI anyagait és a modellkvantálásról szóló blogbejegyzéseit ajánlja a további munkához.

Kapcsolódó hírek

NVIDIA Blackwell GPU-kon gyorsul az OpenAI GPT-6 Astra Ultrafast
Modellek2026. október 2. 01:44

NVIDIA Blackwell GPU-kon gyorsul az OpenAI GPT-6 Astra Ultrafast

Az NVIDIA 2026. október 1-jén közölte, hogy az OpenAI GPT-6 Astra Ultrafast módja NVIDIA Blackwell GPU-kon fut, és már elérhető az OpenAI API-ban, valamint jogosult…

C++-os mintákkal gyorsítja a helyi AI-futtatást az NVIDIA
Fejlesztőknek2026. október 1. 19:59

C++-os mintákkal gyorsítja a helyi AI-futtatást az NVIDIA

Az NVIDIA nyílt forráskódú C++-mintákat tett elérhetővé helyi AI-alkalmazások fejlesztéséhez. A DIN Deploy az ONNX Runtime-ot és a TensorRT RTX végrehajtási szolgáltatót…

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható
Kutatás2026. október 1. 07:00

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható

Az NVIDIA olyan finomhangolási munkafolyamatot mutatott be, amellyel a Nemotron 3.5 ASR a szaúdi najdi és hidzsázi arab dialektusok felismerésére szabható. A vállalat…