Az NVIDIA Vera az ügynöki AI gyorsabb CPU-s végrehajtására épül

Az NVIDIA bemutatta a Vera CPU-t, amelyet az ügynöki mesterséges intelligencia folyamatos, párhuzamos feladatvégzéséhez tervezett. A vállalat szerint a processzor minden magon nagy egyszálas teljesítményt kínál terhelés alatt is, hogy gyorsabban fussanak az eszközhívások, a kódvégrehajtás és az adatfeldolgozási lépések.
- Az NVIDIA Vera az ügynöki AI ciklusaihoz tervezett CPU.
- A processzor legfeljebb 1,2 TB/s LPDDR5X memória-sávszélességet kínál.
- A Vera 88 maggal és 3,4 TB/s magok közötti sávszélességgel készül.
- Az NVIDIA szerint terhelés alatt 1,8-szor nagyobb magonkénti teljesítményt nyújt az x86-nál.
- A Perplexity a Vera éles rendszerben való használatát vizsgálja.
Az ügynöki AI-nál minden lépés számít
Az NVIDIA július 7-i közleménye szerint az ügynöki rendszerek működésében a CPU kulcsszerepet játszik. A processzor hajtja végre a modell által elrendelt eszközhívásokat, a kód futtatását, az adatfeldolgozást, a KV-gyorsítótár kezelését és az eredmények elemzését.
Egy AI-ügynök egyetlen kérés után nem áll le. A modell meghatározza a következő lépést, a CPU végrehajtja a modell körüli feladatokat, az eredmény visszakerül a modellhez, majd a ciklus újraindul. Az NVIDIA szerint ez a működés eltér a hagyományos, rövid és felhasználói interakciók által elindított CPU-terheléstől, mivel az ügynöki munka folyamatos és párhuzamos.
A több mag több egyidejű feladat végrehajtását teszi lehetővé, de önmagában nem rövidíti le egyetlen ügynöki lépés idejét. A vállalat úgy látja, hogy a nagy magszámra optimalizált processzoroknál az erőforrásokért folyó verseny az egyes magok teljesítményét is visszafoghatja. Emiatt az egyszálas teljesítmény meghatározza, milyen gyorsan halad előre az ügynöki ciklus.
Az NVIDIA Vera fő műszaki jellemzői
A Vera központi eleme az NVIDIA egyedi Olympus processzormagja, amely a vállalat állítása szerint 50 százalékkal több utasítást hajt végre ciklusonként, mint a Grace. Ez a szekvenciális feladatoknál lehet fontos, ahol egy eszközhívásnak, kódfuttatásnak vagy tesztnek be kell fejeződnie a következő modellhívás előtt.
A processzor legfeljebb 1,2 TB/s LPDDR5X memória-sávszélességet kínál, a memória energiaigénye pedig 40 watt alatt marad. A Vera monolitikus számítási lapkája 3,4 TB/s magok közötti sávszélességet biztosít, az NVIDIA szerint ez háromszor nagyobb bármely más adatközponti CPU-énál. A kialakítás célja, hogy mind a 88 mag hozzáférjen a processzor teljes memória-teljesítményéhez, szűk keresztmetszetek nélkül.
Az NVIDIA közlése alapján a Vera ügynöki végrehajtást modellező, terhelt CPU-munkafolyamatokban 1,8-szor nagyobb tartós magonkénti teljesítményt nyújt az x86-hoz képest. A Perplexity egy valódi kódolási munkafolyamatban, adattár klónozásával és tesztcsomag futtatásával vizsgálta a processzort. A vállalat szerint a Vera körülbelül 1,5-szer gyorsabban fejezte be a feladatot, a párhuzamos tesztkörnyezeteket pedig akár 1,9-szer gyorsabban indította el.
Adatfeldolgozás, AI-gyárak és a következő lépés
Az ügynökök folyamatosan lekérdeznek, visszakeresnek, szűrnek és mozgatnak adatokat. Az NVIDIA szerint a partnerek a Vera használatával a vezető x86 szerverprocesszorokhoz képest háromszor gyorsabb nagyléptékű SQL-elemzést mértek a Starbursttel, a Redpanda valós idejű adatfolyamainál pedig akár hatszor kisebb késleltetést.
A vállalat a Verát olyan processzorként pozicionálja, amely eszközöket és homokozókat futtat, adatokat dolgoz fel, kéréseket szolgál ki, valamint a következő modell megerősítéses tanulását is támogatja. A processzor ugyanazt az architektúrát használja, amely az NVIDIA Vera Rubin GPU-it és az NVIDIA BlueField-4 STX tárolási processzort is kiszolgálja. Az NVIDIA szerint ez egy közös architektúrát és eszközkészletet biztosít az AI-gyár számára.
A Perplexity a közlemény szerint a Vera közelgő éles rendszerében való bevezetését vizsgálja. Az NVIDIA egy következő generációs Rosa CPU-n is dolgozik, amely a Rigel magot használja. Ez egy Arm v9.2 alapú mag, amely a vállalat tervei szerint az Olympusnál nagyobb magonkénti teljesítményt kínál azonos szilíciumterület mellett. A fejlesztések között jobb utasítás-kiszolgálás, nagyobb L2-gyorsítótár és hatékonyabb memóriakezelés szerepel.


