Yandex 开源 AliceAI-T5:35B 里每次只激活 0.6B 的编解码 MoE
Yandex 9 月 10 日公开 AliceAI-T5-35B-A0.6B 的基座权重:编码器-解码器架构叠加稀疏 MoE,34.35B 总参数、每个 token 只激活 8 个专家(每层共 512 个),激活量约 0.6B;15T token 自建语料上按 UL2 去噪目标训练,末尾用 YaRN 把上下文从 8K 扩到 128K。官方 9 月 11 日同步放出训练细节(优化器从 Adan/AdamW 换到自研方案、MoE 路由的平衡损失调整)。
基准表里它在俄语侧明显领先:CultCat 68.0、WikiWebFacts 81.3,均高于 Qwen3.5-35B-A3B 的 59.2 / 62.4;代价是通用能力落后(MMLU 78.5 对 84.4、MATH-500 62.9 对 81.9)。两个可记的点:编码器-解码器 + MoE 这个组合在大厂开源里几乎没有先例,官方自己只能举出 2021–2023 年的 NLLB-MoE、Switch Transformer、FLAN-MoE;开放范围也有边界——只放了基座权重与 Hugging Face 推理路径,优化过的生产推理仍留在 Yandex 内部。
原文链接:Hugging Face 官方模型卡
核验记录
模型公开时间取 HF 仓库 createdAt 2026-09-10T15:13:39Z(lastModified 9/11);Yandex 官方博客在 Habr 的 datePublished 为 2026-09-11T09:05:13+03:00(=9/11 06:05 UTC),比权重晚一天,两个日期相差不到 24 小时,本条按权重公开日 9/10 记,若以博客发稿为准应为 9/11。架构与基准数字读自模型卡原文表格与博客正文;「生产推理仅内部可用」为官方博客原文表述。配图 HF 缩略图两次实测 418,648B PNG 1200×648。风险点:基准由 Yandex 内部基础设施自测,无第三方复现。