AI 资讯聚合 · 开源生态

腾讯混元开源 SAS:不蒸馏密集注意力,让语言建模损失端到端学 KV 块排序

国内开源生态注意力稀疏化腾讯混元 · 2026-09-14 · 约2分钟 · 来源:腾讯混元 / Hugging Face
腾讯混元开源 SAS:不蒸馏密集注意力,让语言建模损失端到端学 KV 块排序

腾讯混元开源 Simple Attention Sparsification(SAS):一套后训练的 KV 块稀疏注意力方案。它不蒸馏原模型的密集注意力分布,而是在注意力 softmax 内以对数形式注入连续门控,让语言建模损失通过反向传播直接把选择器训到最优——归一化 softmax 门负责在「永远保留的当前块」与竞争预算的历史块之间做校准,且保留连续分数而非只留硬选择,使模型学到的是相对优先级。为支持长序列训练,配套实现了把 SAS 接进 FlashAttention 式计算的 Triton 内核。

已放出三个门控检查点:Qwen3-4B 与 8B 各 33.0M 参数(64 MiB),Qwen3-14B 42.0M(81 MiB),块大小 64 token、训练 Top-K 31 个历史块、训练序列长度 32,768;主干权重全程冻结,默认 2,048 token 稀疏解码预算,同一份检查点可在 1,024 / 2,048 / 4,096 三档之间切换而无需重训。推理走自研的 sglang-blocksparse(提供 seer_attn 后端的 SGLang 分支)。需注意这三份是 router-only 检查点,不能直接用 transformers 的 from_pretrained 起服务。

稀疏注意力此前的训练目标多是模仿原模型的密集注意力,硬 Top-K 截断会把语言建模损失的梯度挡在外面、造成排序错位;SAS 把训练目标改成「按任务效果排序」本身。腾讯给出的组合(门控 + 冻结主干)也意味着把长上下文推理成本压下来不必重训基座。

原文链接:腾讯混元 / Hugging Face

核验记录
三个官方一手源分别直读:arXiv 2609.13141 页内 citation_date / citation_online_date 均为 2026/09/11;Hugging Face 仓库 tencent/Simple-Attention-Sparsification 的 createdAt 2026-09-14T07:43:25Z(likes 6);GitHub 仓库 Tencent-Hunyuan/Simple-Attention-Sparsification created 2026-09-10、commits 7 条落在 09-13 至 09-14。本条目按「权重与代码公开发布日」取 9/14,论文在线日 9/11 单独记录——两层时间戳口径不同,若以论文为发布日应记为 9/11。配图 opengraph.githubassets.com 直读 200、PNG 1200x600(裸请求与带 Referer 各一次,字节相同)。