DeepSeek-V3

Az NVIDIA szerint tízszer gyorsabb lett a dropless MoE tanítása JAX-ban
Az NVIDIA Transformer Engine JAX-szal kombinálva a vállalat mérése szerint 10,4-szeres teljesítménynövekedést hozott a dropless Mixture of Experts modellek tanításában.…

A SambaNova szerint a gyorsabb AI-inferenciához a rendszer számít
Az AI-ügynökök több tokent generálnak, ezért az inferencia nagy részét a memóriakorlátos dekódolás teszi ki. A SambaNova a Hot Chips 2026 konferencián az SN50 RDU…
FejlesztőknekAz AMD GPU-kon is gyorsult az FP8-as PyTorch-tréning
A PyTorch közvetlen AMD Instinct GPU-támogatással bővítette a TorchTitan rendszert, miközben a TorchAO FP8-optimalizációi több modellen is gyorsulást hoztak. Az AMD…

Világrekordot ért el az NVIDIA GB300 NVL72 MoE-modellek tanításában
Az NVIDIA szerint a GB300 NVL72 rackméretű rendszer világrekordot állított fel a DeepSeek-V3 671B kevert szakértői modell előtanításában. A 256 GPU-val végzett mérés…

A JAX host offloadinggal enyhíthető a GPU-memória szűkössége
A JAX host offloading a kiválasztott aktivációkat a GPU nagy sávszélességű memóriája helyett a processzor rögzített host memóriájában tárolja. Az NVIDIA mérései szerint…