Transformer Engine

Az NVIDIA szerint akár 2,21-szer gyorsabb lehet az MoE-modellek tanítása
Az NVIDIA olyan módszert mutatott be biológiai alapmodellek szakértői keveréke, vagyis MoE-architektúrákra épülő változatainak tanításához, amely a vállalat…

Az NVIDIA szerint tízszer gyorsabb lett a dropless MoE tanítása JAX-ban
Az NVIDIA Transformer Engine JAX-szal kombinálva a vállalat mérése szerint 10,4-szeres teljesítménynövekedést hozott a dropless Mixture of Experts modellek tanításában.…