Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

NVIDIA NeMo Switchyard: modellválasztó réteg AI-ügynökökhöz

2026. augusztus 11.Forrás: NVIDIA Developer
NVIDIA NeMo Switchyard: modellválasztó réteg AI-ügynökökhöz
Kép: NVIDIA Developer

Az NVIDIA Developer 2026. augusztus 11-én ismertette a NeMo Switchyard működését, amely AI-ügynökök feladatait irányítja különböző specializált és frontier modellek között. A cél, hogy a fejlesztők egyetlen modell helyett feladatonként választhassanak megfelelő modellt.

A lényeg röviden
  • A NeMo Switchyard AI-ügynökök feladatait irányítja több modell között.
  • A NeMo switchyard-libsy szolgáltatófüggetlen SDK-ként választja el a routinglogikát a modellvégpontoktól.
  • A rendszer hangolás nélküli és hangolható útvonalválasztókat is támogat.
  • A LangChain benchmarkja 74% költségcsökkenést jelzett az escalation routerrel.
  • A partneri integrációk között szerepel a LangChain, Kong, Boomi, Cognition, Ramp, Cadence és Siemens.

Miért kell több modell között útvonalat választani?

Az NVIDIA szerint egy AI-ügynök építése nem ér véget egyetlen modell kiválasztásával. Egy ügynöki feladat egyik lépése lehet osztályozás, a következő következtetés, majd jöhetnek rutinszerű követő műveletek, amelyekhez kisebb modell is elegendő lehet.

A vállalat példája szerint ha minden kérést a legnagyobb modell kap, az növelheti a költséget és a késleltetést. Ha viszont minden kérést kisebb modellre küldenek, a bonyolultabb feladatok minősége romolhat. A modellútvonal-választás erre ad megoldást: a rendszer a specializált és frontier modellek között osztja szét a munkát, az adott feladathoz illő választással.

A NeMo Switchyard futásidőben értékeli a kérést és a rendelkezésre álló kontextust, majd a feladat követelményei, korlátai és szabályai alapján küldi tovább a munkát. Az NVIDIA megfogalmazása szerint a több modellből álló rendszer bizonyos terheléseknél javíthatja a pontosságot és csökkentheti a költséget ahhoz képest, mintha minden kérés a legerősebb modellhez kerülne.

Szolgáltatófüggetlen réteg a modellek felett

A NeMo Switchyard alapja a NeMo switchyard-libsy, egy szolgáltatófüggetlen SDK. Ez reprezentálja a kéréseket, meghatározza a rendszerben elérhető modelleket, és kezeli a kiválasztott modell meghívását.

A forrás szerint minden modellcél szemantikus nevet kap, miközben a mögötte lévő kliens ezt a nevet a szolgáltatói végponthoz és a modellazonosítóhoz rendeli. Ez szétválasztja az útvonalválasztási logikát a konkrét szolgáltatótól. Így egy csapat frissíthet egy modellt, áthelyezheti másik végpontra, vagy másik szolgáltatót használhat anélkül, hogy az útvonalválasztási integrációt módosítaná.

A NeMo Switchyard képes útvonalválasztási állapotot vinni egy ügynök munkamenetén belül, ha ezt a szabályzat megköveteli. Megőrizhet korábbi körökből származó információkat is, például eszközeredményeket vagy affinitási döntést, és ezt későbbi döntésekhez felhasználható kontextusként adhatja tovább.

A NeMo Switchyard szerver referenciamegoldásként közös API-kon keresztül teszi elérhetővé az útvonalválasztást, egy LLM-átjáró szimulálására. OpenAI, Anthropic és Responses API kéréseket fogad, ezeket belső NeMo Switchyard formátumra alakítja, majd a várt válaszformátumban adja vissza. Emellett rögzíti a kiválasztott modellt, a döntés indoklását, a tokenhasználatot, a késleltetést és a hívások kimenetelét.

Hangolás nélküli és tanítható útvonalválasztók

A NeMo Switchyard többféle útvonalválasztási megközelítést támogat. Az NVIDIA két fő csoportot emel ki: hangolás nélküli és hangolható útvonalválasztókat.

A hangolás nélküli megoldások közé tartozik az LLM classifier, a stage router és az escalation router. Az LLM classifier egy LLM-et használ bíróként a jelölt LLM kiválasztásához, majd munkamenet-affinitást tart fenn a kiválasztott modellel a későbbi fordulókban. Ennek célja, hogy a rendszer ne osztályozza újra ismételten azt a munkát, amely az ügynök feladatmegoldási folyamatában érdemben nem változott.

A forrás a hangolható megoldások között a prefill routereket említi, amelyek terhelési adatokból tanulnak, és azt próbálják előre jelezni, milyen valószínűséggel jár sikerrel egy modell az adott feladaton.

Az útvonalválasztási döntésekhez a rendszer többféle jelet használhat. Ilyen lehet a modell képessége, a költségprofil, a késleltetés, a rendszerterhelés, az ügynökspecifikus hibák, a kérés témája vagy becsült nehézsége, valamint a modellállapotokból származó információk.

Mérések és partneri integrációk

Az NVIDIA által közölt összefoglaló szerint a LangChain benchmarkja 74% költségcsökkenést mutatott az escalation router használatával a Nemotron 3.5 Lightning és a Claude Opus 4.8 között. A Cognition Devin Desktop esetében a staged routing a forrás szerint közel frontier szintű kódolási teljesítményt ért el 28% alacsonyabb költséggel.

A NeMo Switchyard útvonalválasztását partnerek is integrálják meglévő ügynöki eszközökbe, átjárókba és vállalati munkafolyamatokba. A forrás a LangChain, Kong, Boomi, Cognition, Nous Research, Ramp, Cadence és Siemens nevét sorolja fel.

A felhasználók és a fejlesztői csapatok szempontjából a bejelentés lényege, hogy az ügynöki rendszerekben a modellválasztás külön kezelhető réteggé válhat. Ez megkönnyítheti a különböző modellek kombinálását, a szolgáltatói végpontoktól való függetlenítést, valamint a költség, késleltetés és minőség közötti döntések ellenőrizhetőbb kezelését.

Kapcsolódó hírek

Az NVIDIA szerint így érdemes mérni az AI-ügynökök valódi teljesítményét
Fejlesztőknek2026. szeptember 21.

Az NVIDIA szerint így érdemes mérni az AI-ügynökök valódi teljesítményét

Az AI-ügynökök értékelésénél az NVIDIA Developer szerint már nem elég azt nézni, hogy egy modell helyesen hív-e meg egy eszközt. A lényeg az, hogy a több lépésből álló…

NVIDIA: öt irányelv gyorsíthatja az LLM-ek spekulatív dekódolását
Fejlesztőknek2026. szeptember 2.

NVIDIA: öt irányelv gyorsíthatja az LLM-ek spekulatív dekódolását

Az NVIDIA Developer 2026. szeptember 2-án közölt technikai útmutatót arról, hogyan gyorsítható az LLM-inferencia spekulatív dekódolással. A bejegyzés öt irányelvet ad a…

Az NVIDIA új nyílt modellel és útválasztóval gyorsítaná az ügynökös AI-t
Modellek2026. augusztus 11.

Az NVIDIA új nyílt modellel és útválasztóval gyorsítaná az ügynökös AI-t

Az NVIDIA 2026. augusztus 11-én bejelentette a Nemotron 3.5 Lightning modellt és a NeMo Switchyard nyílt forrású könyvtárat. A vállalat szerint az újdonságok a hosszú…