Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Két paranccsal vihető C++ inferenciáig egy nyílt modell az NVIDIA új eszközével

2026. augusztus 28.Forrás: NVIDIA Developer
Két paranccsal vihető C++ inferenciáig egy nyílt modell az NVIDIA új eszközével
Kép: NVIDIA Developer

Az NVIDIA 2026. augusztus 28-án bemutatta a TensorRT Model Connect nevű nyílt referencia-implementációs gyűjteményt. Az eszköz célja, hogy támogatott nyílt modelleket lehessen Hugging Face modellazonosítóból natív C++ alkalmazásban futtatható TensorRT inferenciáig eljuttatni.

A lényeg röviden
  • Az NVIDIA 2026. augusztus 28-án ismertette a TensorRT Model Connectet.
  • A támogatott modellekből Python CLI-vel bundle készíthető, majd C++ alkalmazás töltheti be azt.
  • Az éles futtatáshoz a forrás szerint nincs szükség PyTorchra vagy Python interpreterre.
  • Két C++ API-szint érhető el: szemantikus API és modul szintű API.
  • A TVM FFI segítségével egyedi GPU-kernelek illeszthetők a TensorRT által futtatott pipeline-ba.

Hugging Face azonosítótól C++ futtatásig

Az NVIDIA Developer blogon megjelent bejegyzés szerint a TensorRT Model Connect arra a problémára ad választ, hogy a nyílt AI-modellek natív alkalmazásokba vitele gyakran modellfüggő konverziót, előfeldolgozást, utófeldolgozást és futtatókódot igényel. A Model Connect támogatott modellekhez ad olyan referencia-implementációkat, amelyeket a fejlesztők használhatnak, megvizsgálhatnak, módosíthatnak és kiterjeszthetnek.

A munkafolyamat két fázisból áll. Először egy Python parancssori eszköz deployment bundle-t készít egy Hugging Face modellazonosítóból vagy helyi checkpointból. A blog példája a Qwen/Qwen3-0.6B modellre ezt a parancsot adja meg: trtmc build Qwen/Qwen3-0.6B -o qwen3-0.6B.bundle. A bundle tartalmazza a TensorRT engine-eket és a futtatáshoz szükséges modellfüggő elemeket.

A második lépésben egy natív C++ alkalmazás betölti ezt a bundle-t, majd feladatszintű bemenetekkel és kimenetekkel dolgozik. A forrás példája szerint a program a trtmc::load hívással tölti be a csomagot, majd a generate metódussal kér szöveggenerálást.

Két C++ API és egy közös alap

A Model Connect két C++ API-szintet kínál. A szemantikus API ismerős bemenetekkel és kimenetekkel dolgozik, például promptokkal, képekkel és hanggal, miközben az eszköz kezeli a modellfüggő előfeldolgozást, végrehajtást és utófeldolgozást.

Aki részletesebb irányítást szeretne, a modul szintű API-val névvel ellátott tenzorokhoz és egyes TensorRT-komponensekhez férhet hozzá, így testreszabhatja az inferencia-folyamatot. Az NVIDIA leírása szerint mindkét API ugyanazokra a Model Connect implementációkra épül, ezért a fejlesztők egyszerű feladatszintű felületről indulhatnak, és csak szükség esetén nyúlhatnak mélyebben a pipeline-hoz.

A blog kiemeli, hogy a telepített alkalmazás éles futási környezetében nincs szükség PyTorchra vagy Python interpreterre. A Python a modell előkészítésénél használható, a futtatás viszont natív módon történik.

Egyedi GPU-kernelek TVM FFI-n keresztül

A TensorRT Model Connect egyedi GPU-kernelek integrálását is támogatja a TVM FFI segítségével. A forrás szerint a TVM FFI nyelvfüggetlen interfészt ad GPU-kernelek meghívásához anélkül, hogy a hívó rendszer szorosan kötődne a kernel implementációs keretrendszeréhez vagy futtatókörnyezetéhez.

Ennek gyakorlati jelentősége, hogy a modell egy célzott részét egyedi GPU-kernellel lehet kiváltani, miközben az inferencia-folyamat többi részét továbbra is a TensorRT hajtja végre. Az NVIDIA szerint ez megkönnyíti speciális vagy újonnan fejlesztett kernelek beépítését úgy, hogy az alkalmazást nem kell külön futtatókörnyezet köré újraépíteni.

Nem új inferenciakeretrendszer, hanem híd a TensorRT felé

Az NVIDIA külön hangsúlyozza, hogy a Model Connect nem új inferenciakeretrendszer, hanem híd a nyílt modellek végponttól végpontig tartó inferenciaélménye és a TensorRT GPU-n gyorsított engine-építési képessége között. Egy-egy modell implementációja három célt szolgál: támogatott nyílt modell futtatását natív TensorRT-képes alkalmazásban, tanulható és ellenőrizhető teljes implementáció biztosítását, valamint kiterjesztési alapot rokon architektúrákhoz, egyedi checkpointokhoz vagy alkalmazási igényekhez.

A projektet az NVIDIA AI-native szoftverprojektként írja le. A közlemény szerint kódoló ügynökök emberi irányítás és felülvizsgálat mellett generálnak implementációs kódot, teszteket, integrációkat és dokumentációt. A Model Connect éjszakai kiadásokat használ, az automatizált validáció pedig kiadási kapuként működik.

Mit jelent ez a fejlesztőknek

A forrás alapján a Model Connect fő ígérete az, hogy a fejlesztőknek ne kelljen minden modellcsaládhoz külön felépíteniük a checkpoint mappinget, a TensorRT engine-ek létrehozását, az előfeldolgozást, a futtatási összehangolást és az utófeldolgozást. Ehelyett egy teljes, működő implementációból indulhatnak ki.

Az NVIDIA szerint a Model Connect TensorRT-re épül, ezért a teljesítmény központi szempont marad. A cég állítása szerint támogatott és validált munkaterheléseknél a Model Connect gyorsabb inferenciát tud nyújtani, mint a torch.compile. A fejlesztők a GitHubon található NVIDIA/TensorRT-Model-Connect repóban kereshetnek támogatott implementációkat és építhetnek modellcsomagot, a dokumentáció pedig a modell-lefedettségről, az architektúráról és a fejlesztői útmutatóról ad további információt.

Kapcsolódó hírek

64 GB memóriával jön az NVIDIA DGX Spark új változata
Chipek és infrastruktúra2026. október 2.

64 GB memóriával jön az NVIDIA DGX Spark új változata

Az NVIDIA 2026. október 2-án bejelentette a DGX Spark 64 GB-os, egyesített memóriával szerelt konfigurációját. A rendszer október 23-án érkezik az Acer, ASUS, Dell…

NVIDIA Blackwell GPU-kon gyorsul az OpenAI GPT-6 Astra Ultrafast
Modellek2026. október 1.

NVIDIA Blackwell GPU-kon gyorsul az OpenAI GPT-6 Astra Ultrafast

Az NVIDIA 2026. október 1-jén közölte, hogy az OpenAI GPT-6 Astra Ultrafast módja NVIDIA Blackwell GPU-kon fut, és már elérhető az OpenAI API-ban, valamint jogosult…

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható
Kutatás2026. október 1.

A Nemotron 3.5 ASR a szaúdi arab dialektusokra hangolható

Az NVIDIA olyan finomhangolási munkafolyamatot mutatott be, amellyel a Nemotron 3.5 ASR a szaúdi najdi és hidzsázi arab dialektusok felismerésére szabható. A vállalat…