NVIDIA: AI-kódolóügynökkel építettek Holoscan-alkalmazást

Az NVIDIA Developer 2026. augusztus 19-én közzétett bejegyzésében azt mutatta be, hogyan építettek valós idejű endoszkópos eszközszegmentáló alkalmazást a Holoscan platformon AI-kódolóügynök segítségével. A munkafolyamatban a HoloHub példái, fejlesztési útmutatói és a Holoscan CLI közös fejlesztési felületként szerepeltek.
- Az NVIDIA egy Holoscan-alapú, valós idejű endoszkópos eszközszegmentáló alkalmazást mutatott be.
- A fejlesztés HoloHub példákra, fejlesztési skillekre és a ./holohub CLI-parancsokra épült.
- Az alkalmazás három futtatási módot kapott: visual, smoke és benchmark.
- A benchmark mód 300 képkockán mért alkalmazásútvonal-késleltetést.
- Az NVIDIA szerint az optimalizálás 50,5 százalékkal növelte a renderelt áteresztést, és 33,6 százalékkal csökkentette az átlagos késleltetést.
Mérnök által irányított, ügynökalapú fejlesztési folyamat
Az NVIDIA Holoscan a cég leírása szerint valós idejű edge AI-alkalmazások építésére szolgáló platform, például orvosi képalkotási és robotikai feladatokra. A hozzá kapcsolódó HoloHub referenciaalkalmazásokat és komponenseket tartalmaz, amelyek mintaként szolgálhatnak fejlesztés közben.
A bejegyzésben az NVIDIA azt vizsgálta, hogyan tud egy általános célú kódolóügynök ugyanazokra a példákra, dokumentációkra és fejlesztői eszközökre támaszkodni, amelyeket egy mérnök is használna egy valódi fejlesztési feladatban. A cél egy end-to-end endoszkópos eszközszegmentáló alkalmazás volt, valós idejű következtetéssel, élő maszkkijelzéssel és statisztikai elemzéssel.
A folyamatban a Holoscan CLI a ./holohub wrapperen keresztül adta a közös futtatási felületet. Az ügynök ezen keresztül tudta felfedezni és végrehajtani a fejlesztési műveleteket, a mérnök pedig ugyanazokat a parancsokat ellenőrizhette és ismételhette meg. Az NVIDIA szerint a munkafolyamat ügynökfüggetlen, a bemutatott példában Codexet használtak GPT-5.6 sol max módban, az ügynöki feldolgozási idők pedig hozzávetőlegesek voltak.
Három iterációban készült el a dashboard
A fejlesztés nem egyetlen nagy prompttal indult, hanem kisebb, ellenőrizhető mérnöki iterációkra bontották. A kérdések között szerepelt, hogy a fejlesztési környezet képes-e helyben futtatni egy hasonló meglévő alkalmazást, külön alkalmazásban futtatható-e a modell és a videó, értelmes információt ad-e a vizualizáció, ismételhetően mérhető-e a késleltetés, valamint javítható-e a renderelési áteresztés funkcióvesztés nélkül.
Az első érdemi iterációban egy minimálisan működő új Python HoloHub-alkalmazást hoztak létre. Ehhez újrahasználták a MONAI endoscopic tool segmentation modellt, a mintavideót, az előfeldolgozást és a következtetést. A prompt kifejezetten előírta, hogy ne tanítsák és ne módosítsák a modell súlyait. Az ügynök elolvasta az alkalmazás-életciklushoz kapcsolódó fejlesztési útmutatót, a közeli HoloHub-példákat, a projekt metaadatait és a CLI dokumentációját.
Az eredményül kapott alkalmazás összekapcsolta a videó-visszajátszást, az előfeldolgozást, a TensorRT-következtetést, az SDK szegmentációs utófeldolgozóját, a telemetriát és a HoloViz megjelenítést. A következtetés és a maszk utófeldolgozása minden visszajátszott képkockán lefutott, az overlay képkockából származtatott méréseket jelenített meg. Ennél az iterációnál az ügynöki feldolgozási idő 40 perc volt.
A második iteráció célja az volt, hogy a vizuális demóból ismételhető fejlesztési artefaktum legyen. Az ügynök módosította a dinamikus méréseket és a képernyőkép olvashatóságát, majd három futtatási módot alakított ki: visual, smoke és benchmark. A visual mód a teljes mintát forrásütemben, interaktív ablakban futtatta, a smoke mód 60 képkockás, fej nélküli felvételt készített véges eredménnyel, a benchmark mód pedig 300 képkockát dolgozott fel képernyőn kívül, és méréseket, valamint ábrákat exportált. Az iteráció ügynöki feldolgozási ideje 20 perc volt.
Mérhető gyorsulást hozott az optimalizálás
A benchmark mód Holoscan Data Flow Trackinget használt a beállított útvonalon, a videó-visszajátszótól az előfeldolgozáson, következtetésen, telemetrián és offscreen HoloVizen át a renderelt képkockák fogadójáig. Az NVIDIA szerint ez a megoldás a meglévő holoscan flow benchmarking modulban bemutatott ötleteket hasznosította.
A harmadik iterációban a cél a késleltetés és a renderelési áteresztés javítása volt a funkciók visszafejlődése nélkül. A bejegyzés elején közölt összefoglaló szerint az optimalizálások 50,5 százalékkal javították a renderelt áteresztést, és 33,6 százalékkal csökkentették az átlagos alkalmazásútvonal-késleltetést.
Az NVIDIA egy ablációs vizsgálatot is ismertetett. Eszerint a CLI, a HoloHub fejlesztési skillek és a dokumentáció együttes használata adta a leggyorsabb ügynöki feldolgozási időt, 40 percet, valamint a legalacsonyabb tokenhasználatot, 11M tokent, azokhoz a konfigurációkhoz képest, amelyekben nem voltak skillek vagy CLI-alapú útmutatás.
Mit jelent ez a fejlesztőknek
A bemutatott folyamat lényege, hogy a kódolóügynök és a mérnök ugyanazokat az artefaktumokat használja: a HoloHub példáit, a dokumentációt, a fejlesztési skilleket és a ./holohub parancsokat. Így az ügynök nem elszigetelt kódrészleteket készít, hanem olyan alkalmazásmódokat, teszteket és benchmarkokat hoz létre, amelyeket a mérnök ugyanazon a felületen futtathat és ellenőrizhet.
A felhasználói és piaci jelentőség a forrás alapján abban áll, hogy a Holoscanhoz kapcsolódó referenciaalkalmazások és a CLI nemcsak kézi fejlesztéshez, hanem mérnök által irányított ügynöki munkafolyamatokhoz is használhatók. Az NVIDIA következő lépésként a HoloHub repository, a HoloHub fejlesztési skillek és a Holoscan CLI kipróbálását javasolja alkalmazások létrehozásához, futtatásához és teszteléséhez.
NVIDIA Developer: Developing NVIDIA Holoscan Applications with CLI, Skills, and AI Coding Agents


