Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

C++-os mintákkal gyorsítja a helyi AI-futtatást az NVIDIA

2026. október 1. 19:59Forrás: NVIDIA Developer
C++-os mintákkal gyorsítja a helyi AI-futtatást az NVIDIA
Kép: NVIDIA Developer

Az NVIDIA nyílt forráskódú C++-mintákat tett elérhetővé helyi AI-alkalmazások fejlesztéséhez. A DIN Deploy az ONNX Runtime-ot és a TensorRT RTX végrehajtási szolgáltatót kapcsolja össze Windows és Linux rendszereken.

A lényeg röviden
  • A DIN Deploy nyílt forráskódú C++-mintákat kínál helyi AI-alkalmazásokhoz.
  • A minták az ONNX Runtime-ot és a TensorRT RTX-et kapcsolják össze.
  • A támogatott feladatok között beszédfelismerés, szegmentálás és képgenerálás szerepel.
  • A DGX Spark mérésén a Parakeet TDT GPU-n 206,41-szeres valós idejű értéket ért el.
  • A projekt Windows, Linux, x86-64 és Arm64 környezethez ad CMake-beállításokat.

A modellátalakítást és a futtatást különválasztják

Az NVIDIA Developer október 1-jei bejegyzése szerint a Do Inference Now, röviden DIN Deploy, olyan gyakorlati C++-mintagyűjtemény, amely a modell-ellenőrzőponttól a natív, hardveresen gyorsított alkalmazásig vezető folyamatot mutatja be. A megoldás az ONNX Runtime-ra és az NVIDIA TensorRT RTX végrehajtási szolgáltatójára épül.

Minden minta egy Python-exportálóval indul. Ez a Hugging Face-ről letöltött modell-ellenőrzőpontot ONNX-formátumú modellé alakítja. Az alkalmazás oldala natív C++ parancssori felület, amely az ONNX Runtime munkamenet- és tenzorfelületeit használja. Az NVIDIA szerint ez a felosztás külön kezeli a modellkonvertálást és a telepítési logikát, így az exportált modell helyi alkalmazásba vihető modellhez kötött futtatókörnyezet nélkül.

A megosztott kódban a gyártóspecifikus elemek, köztük a CUDA API-k és kernelek, csak az opcionális gyorsított útvonalakon jelennek meg. Az ONNX Runtime tenzormásolási API-ja segít kezelni az adatok helyét anélkül, hogy a közös kódban külön gyártói API-kra lenne szükség.

Beszédfelismerés, szegmentálás és képgenerálás

A DIN Deploy automatikus beszédfelismerési mintái offline és folyamatos feldolgozást is támogatnak. Az OpenAI Whisper különböző modellméretekkel offline átírást kínál, míg az NVIDIA Parakeet TDT és az NVIDIA Nemotron ASR Streaming folyamatos feldolgozási folyamatokat mutat be. A minták azt szemléltetik, hogyan vihető a hang egy natív alkalmazáson keresztül a feldolgozásig, majd hogyan adhatók vissza az átírás eredményei.

A Meta SAM 2.1-re épülő minták képek és videók interaktív maszkolását támogatják. A modell kimeneteiből olyan szegmentációs maszkok készülnek, amelyeket a natív alkalmazások kiválasztásra, követésre és más számítógépes látási feladatokra használhatnak.

A FLUX.2-klein-4B minta szöveges utasítások alapján történő képgenerálást mutat be. A feldolgozás részeként Vulkan és DirectX grafikus API-k közötti együttműködést is alkalmaz, így a GPU-n tárolt erőforrások több gyártó shaderfelületén keresztül integrálhatók. A DirectX használata csak Windowson érhető el.

Mért eredmények és fejlesztői indulás

Az NVIDIA a kiválasztott munkafolyamatokat DGX Spark rendszeren mérte. A Whisper large v3 turbo GPU-val 58,5-szeres valós idejű teljesítményt ért el, CPU-val 3,8-szorosat. A Nemotron 3.5 ASR Streaming 0.6B esetében ezek az értékek 39,01-szeres, illetve 3,24-szeresek voltak. A Parakeet TDT 0.6B v3 GPU-val 206,41-szeres, CPU-val 14,44-szeres értéket produkált. A SAM 2.1 Hiera Base Plus GPU-n 38,3, CPU-n 0,5 képkockát dolgozott fel másodpercenként. Az audioeredményeket valós idő többszöröseként jelentették, ahol a magasabb érték gyorsabb feldolgozást jelent.

A FLUX.2-minta a poszttréninges kvantálást is bemutatja az NVIDIA Model Optimizerrel. Az NVIDIA szerint a kvantált ONNX-modell változatlan ONNX-interfészek mellett közvetlenül behelyettesíthető, ezért az alkalmazás kódját nem kell módosítani. A kvantálás hardverfüggő.

A fejlesztők Windows, Linux, x86-64 és Arm64 környezethez használhatják a tárhely CMake-beállításait. A projekt összeállítása után ONNX-formátumba exportálhatják a modellt, majd TensorRT RTX-szel futtathatják a parancssori alkalmazást, vagy saját programjukba emelhetik a pipeline-ok kódját. A CMake alapértelmezés szerint letölti az ONNX Runtime-ot és a TensorRT RTX-et.

Kapcsolódó hírek

NVIDIA Blackwell GPU-kon gyorsul az OpenAI GPT-6 Astra Ultrafast
Modellek2026. október 2. 01:44

NVIDIA Blackwell GPU-kon gyorsul az OpenAI GPT-6 Astra Ultrafast

Az NVIDIA 2026. október 1-jén közölte, hogy az OpenAI GPT-6 Astra Ultrafast módja NVIDIA Blackwell GPU-kon fut, és már elérhető az OpenAI API-ban, valamint jogosult…

C++-os mintákkal gyorsítaná a helyi AI-futtatást az NVIDIA
Fejlesztőknek2026. október 1. 19:59

C++-os mintákkal gyorsítaná a helyi AI-futtatást az NVIDIA

Az NVIDIA nyílt forráskódú C++-mintákat tett közzé helyi AI-alkalmazások fejlesztéséhez. A DIN Deploy az ONNX Runtime-ot és a TensorRT RTX végrehajtási szolgáltatót…

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható
Kutatás2026. október 1. 07:00

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható

Az NVIDIA olyan finomhangolási munkafolyamatot mutatott be, amellyel a Nemotron 3.5 ASR a szaúdi najdi és hidzsázi arab dialektusok felismerésére szabható. A vállalat…