Két paranccsal vihető C++ inferenciáig egy nyílt modell az NVIDIA új eszközével

Az NVIDIA 2026. augusztus 28-án bemutatta a TensorRT Model Connect nevű nyílt referencia-implementációs gyűjteményt. Az eszköz célja, hogy támogatott nyílt modelleket lehessen Hugging Face modellazonosítóból natív C++ alkalmazásban futtatható TensorRT inferenciáig eljuttatni.
- Az NVIDIA 2026. augusztus 28-án ismertette a TensorRT Model Connectet.
- A támogatott modellekből Python CLI-vel bundle készíthető, majd C++ alkalmazás töltheti be azt.
- Az éles futtatáshoz a forrás szerint nincs szükség PyTorchra vagy Python interpreterre.
- Két C++ API-szint érhető el: szemantikus API és modul szintű API.
- A TVM FFI segítségével egyedi GPU-kernelek illeszthetők a TensorRT által futtatott pipeline-ba.
Hugging Face azonosítótól C++ futtatásig
Az NVIDIA Developer blogon megjelent bejegyzés szerint a TensorRT Model Connect arra a problémára ad választ, hogy a nyílt AI-modellek natív alkalmazásokba vitele gyakran modellfüggő konverziót, előfeldolgozást, utófeldolgozást és futtatókódot igényel. A Model Connect támogatott modellekhez ad olyan referencia-implementációkat, amelyeket a fejlesztők használhatnak, megvizsgálhatnak, módosíthatnak és kiterjeszthetnek.
A munkafolyamat két fázisból áll. Először egy Python parancssori eszköz deployment bundle-t készít egy Hugging Face modellazonosítóból vagy helyi checkpointból. A blog példája a Qwen/Qwen3-0.6B modellre ezt a parancsot adja meg: trtmc build Qwen/Qwen3-0.6B -o qwen3-0.6B.bundle. A bundle tartalmazza a TensorRT engine-eket és a futtatáshoz szükséges modellfüggő elemeket.
A második lépésben egy natív C++ alkalmazás betölti ezt a bundle-t, majd feladatszintű bemenetekkel és kimenetekkel dolgozik. A forrás példája szerint a program a trtmc::load hívással tölti be a csomagot, majd a generate metódussal kér szöveggenerálást.
Két C++ API és egy közös alap
A Model Connect két C++ API-szintet kínál. A szemantikus API ismerős bemenetekkel és kimenetekkel dolgozik, például promptokkal, képekkel és hanggal, miközben az eszköz kezeli a modellfüggő előfeldolgozást, végrehajtást és utófeldolgozást.
Aki részletesebb irányítást szeretne, a modul szintű API-val névvel ellátott tenzorokhoz és egyes TensorRT-komponensekhez férhet hozzá, így testreszabhatja az inferencia-folyamatot. Az NVIDIA leírása szerint mindkét API ugyanazokra a Model Connect implementációkra épül, ezért a fejlesztők egyszerű feladatszintű felületről indulhatnak, és csak szükség esetén nyúlhatnak mélyebben a pipeline-hoz.
A blog kiemeli, hogy a telepített alkalmazás éles futási környezetében nincs szükség PyTorchra vagy Python interpreterre. A Python a modell előkészítésénél használható, a futtatás viszont natív módon történik.
Egyedi GPU-kernelek TVM FFI-n keresztül
A TensorRT Model Connect egyedi GPU-kernelek integrálását is támogatja a TVM FFI segítségével. A forrás szerint a TVM FFI nyelvfüggetlen interfészt ad GPU-kernelek meghívásához anélkül, hogy a hívó rendszer szorosan kötődne a kernel implementációs keretrendszeréhez vagy futtatókörnyezetéhez.
Ennek gyakorlati jelentősége, hogy a modell egy célzott részét egyedi GPU-kernellel lehet kiváltani, miközben az inferencia-folyamat többi részét továbbra is a TensorRT hajtja végre. Az NVIDIA szerint ez megkönnyíti speciális vagy újonnan fejlesztett kernelek beépítését úgy, hogy az alkalmazást nem kell külön futtatókörnyezet köré újraépíteni.
Nem új inferenciakeretrendszer, hanem híd a TensorRT felé
Az NVIDIA külön hangsúlyozza, hogy a Model Connect nem új inferenciakeretrendszer, hanem híd a nyílt modellek végponttól végpontig tartó inferenciaélménye és a TensorRT GPU-n gyorsított engine-építési képessége között. Egy-egy modell implementációja három célt szolgál: támogatott nyílt modell futtatását natív TensorRT-képes alkalmazásban, tanulható és ellenőrizhető teljes implementáció biztosítását, valamint kiterjesztési alapot rokon architektúrákhoz, egyedi checkpointokhoz vagy alkalmazási igényekhez.
A projektet az NVIDIA AI-native szoftverprojektként írja le. A közlemény szerint kódoló ügynökök emberi irányítás és felülvizsgálat mellett generálnak implementációs kódot, teszteket, integrációkat és dokumentációt. A Model Connect éjszakai kiadásokat használ, az automatizált validáció pedig kiadási kapuként működik.
Mit jelent ez a fejlesztőknek
A forrás alapján a Model Connect fő ígérete az, hogy a fejlesztőknek ne kelljen minden modellcsaládhoz külön felépíteniük a checkpoint mappinget, a TensorRT engine-ek létrehozását, az előfeldolgozást, a futtatási összehangolást és az utófeldolgozást. Ehelyett egy teljes, működő implementációból indulhatnak ki.
Az NVIDIA szerint a Model Connect TensorRT-re épül, ezért a teljesítmény központi szempont marad. A cég állítása szerint támogatott és validált munkaterheléseknél a Model Connect gyorsabb inferenciát tud nyújtani, mint a torch.compile. A fejlesztők a GitHubon található NVIDIA/TensorRT-Model-Connect repóban kereshetnek támogatott implementációkat és építhetnek modellcsomagot, a dokumentáció pedig a modell-lefedettségről, az architektúráról és a fejlesztői útmutatóról ad további információt.


