AI 资讯聚合 · 开源生态

NVIDIA 发布 Dropless MoE 训练方案:JAX 下无需 token 丢弃,专家负载自动均衡

国外开源生态NVIDIAMoE · 2026-09-14 · 约1分钟 · 来源:NVIDIA 技术博客
NVIDIA 发布 Dropless MoE 训练方案:JAX 下无需 token 丢弃,专家负载自动均衡

NVIDIA 于 9 月 14 日发布基于 JAX 的 Dropless MoE 训练技术拆解:在 Transformer Engine 中取消传统 MoE 训练的容量因子与 token 丢弃机制,让每个 token 都能路由到其专家,专家负载靠自动重路由均衡。

它改变的是 MoE 训练的调参面:传统带容量因子的实现需要为每个专家设定 token 容量,容量设小丢 token、设大浪费显存与算力;Dropless 方案把这一权衡交给系统层处理,配合 JAX 的 JIT 编译在训练吞吐与专家利用率上同时受益,对 Qwen、DeepSeek、Mixtral 一系的 MoE 开源训练管线有直接参考价值。

原文链接:NVIDIA 技术博客

核验记录
官方博客直读,datePublished 2026-09-14T16:39:15Z 与 RSS published 双证;配图裸请求+带 Referer 均 200 且为真实 WebP