NVIDIA Transformer Engine 在 JAX 中加速无Drop MoE训练

许可证: 见LICENSE文件 · 更新于 2026-09-14 · AI Generated

来源:https://developer.nvidia.com/blog/accelerating-dropless-moe-training-in-jax-with-nvidia-transformer-engine/

NVIDIA Transformer Engine 新增JAX支持的MoE优化内核,助力大规模AI模型高效稀疏训练。

标签: MoEJAXNVIDIA深度学习模型训练
相关条目
  • PhysicsNeMo v2.2.2 · NVIDIA PhysicsNeMo v2.2.2 发布,修补了文档与 PyPi 包名不一致的问题,提升了安装指引的准确性。
  • DeepXDE v1.15.0 · DeepXDE v1.15.0 发布,新增 L-LAAF 激活函数与 PyTorch 后端 MPS GPU 支持,提升微分方程深度学习求解效率。
  • AIPerf:大规模LLM推理性能基准测试工具 · AIPerf 是 NVIDIA 推出的 LLM 推理基准测试工具,用于在部署场景下评估大规模语言模型的推理速度和性能表现。
  • NVIDIA NVLink 6 为 AI 工厂提供多层弹性保障 · NVIDIA NVLink 6 通过多层弹性设计提升大规模 AI 工厂的 GPU 集群可靠性,保障 AI 训练连续性与系统稳定性。
  • JAX-Fluids · 基于 JAX 的全自动可微 CFD 求解器,支持 CPU/GPU/TPU,专注端到端可微流体仿真,可与神经网络无缝耦合做梯度反传。