A SambaNova szerint a gyorsabb AI-inferenciához a rendszer számít

Az AI-ügynökök több tokent generálnak, ezért az inferencia nagy részét a memóriakorlátos dekódolás teszi ki. A SambaNova a Hot Chips 2026 konferencián az SN50 RDU rendszerét mutatta be, amely az adatmozgatást és a hálózati kapcsolatokat hangolja össze több chip között.
- A SambaNova hat modellkonfigurációban 75 és 97 százalék közötti dekódolási arányt mért.
- Az SN50 RDU 432 MB chipen belüli SRAM memóriát használ.
- Az SN50 RDU-nként 2 TB/s összesített Ethernet-sávszélességet kínál a vállalat szerint.
- A modellezett DeepSeek-R1 sebesség 64 és 256 RDU között 200-ról 500 token/másodpercre nőtt.
- A bemutatott skálázási eredmények modellezett működési pontok, nem termelési mérések.
A dekódolás lett az inferencia szűk keresztmetszete
A SambaNova 2026. szeptember 2-án közzétett beszámolója szerint az AI használata az egyszeri válaszoktól az olyan ügynöki rendszerek felé mozdul, amelyek következtetnek, eszközöket hívnak meg és hosszabb ideig dolgoznak. Ez több generált tokent és több dekódolással töltött időt jelent.
A vállalat hat, élvonalbeli modellkonfigurációt vizsgált. Ezekben a dekódolás az inferencia idejének 75 és 97 százaléka között tette ki. A DeepSeek-V3 egyik vizsgált esetében, 8K bemenettel, 1K kimenettel, B300 FP4 pontossággal és egy aktív kéréssel, ez az arány 97 százalék volt.
A SambaNova a Model Bandwidth Utilization, vagyis MBU mutatót használja annak bemutatására, hogy a telepített memória-sávszélesség mekkora része mozgatja ténylegesen a modell súlyait és a kulcsérték-gyorsítótárat. A vállalat leírása szerint a telepített sávszélesség és az MBU együtt határozza meg a modell számára elérhető sávszélességet, amely a dekódolás során a tokenenkénti sebességhez kapcsolódik.
A SN50 RDU adatfolyammal tartja mozgásban a modellt
Az SN50 RDU adatfolyam-alapú végrehajtási modellt használ. A fordító a modellt számítási és memóriaműveletekből álló csempézett hálóra képezi le. A chip 432 MB elosztott, chipen belüli SRAM memóriája a gyakran használt adatokat közel tartja a számításhoz, így a köztes értékeknek nem kell minden művelet után a nagy sávszélességű memóriához visszatérniük.
A tartós dekóder-végrehajtás és a műveletek összevonása csökkenti a megállásokat a tokenek feldolgozása közben. A dupla pufferelésű memóriaegységek már a következő modellrészlet mozgatását végzik, miközben az aktuális számítás zajlik. A kollektív kommunikáció SRAM-ban is befejeződhet, így a számítás, a memóriaelérés és a kommunikáció átfedésben dolgozhat.
A SambaNova szerint ez azért fontos, mert a hasznos sávszélesség nem pusztán a memória tulajdonsága. Az egész végrehajtási folyamat termelékenységétől függ, hogy a rendelkezésre álló sávszélességből mennyi jut el a modellhez.
Hálózati felépítés több RDU és csomópont számára
Az SN50 három hálózati tartományt használ. Egy nyolcfoglalatos csomóponton belül hét, egyenként 800G Ethernet-kapcsolat teljesen összekapcsolt topológiát alkot. A csomóponton kívüli skálázáshoz RDU-nként további két 800G port áll rendelkezésre. Az SN50 összesen tíz darab 800G Ethernet-portot integrál, RDU-nként 2 TB/s összesített sávszélességgel.
A skálázási példában két, egyenként 64 portos, 800G kapcsoló köti össze a csomópontokat. A skálázás másik rétegét RDU-nként egy 400G RoCEv2 hálózati vezérlő adja, amely a skálázási tartományokat kapcsolja össze, és támogatja a szétválasztott inferenciát, valamint a KV-gyorsítótár átvitelét.
A SambaNova által modellezett DeepSeek-R1 konfigurációban az egy felhasználóra jutó sebesség 64 SN50 RDU esetén 200, 128 RDU-nál 300, 256 RDU-nál pedig 500 token/másodperc volt. Az MBU rendre 51, 44 és 45 százalék maradt. Ezek modellezett működési pontok, nem termelési mérések, és az eredmények a munkaterheléstől függnek.
SambaNova: Hot Chips 2026: SN50 RDU Dataflow at Scale


