Nunchux AI 发 VC-Attention:免训练低比特注意力核,视频生成提速至 1.6 倍
Nunchux AI 联合 MIT、CMU、NVIDIA 等发布 VC-Attention(arXiv 2609.15810):一个免训练的低比特注意力框架,用 V-Smooth(在线聚类重排 value token)加融合概率 Cast,同时解决低比特量化的数值误差与慢 softmax 两端。
它不需重训任何权重即可接入现有视频扩散模型:在 B200/B300/H200 上对 BF16 FlashAttention-4 提速 1.46–1.59 倍,工作站卡上 2.3–3.6 倍,端到端生成提速 1.13–1.70 倍,支持 Wan2.2、HunyuanVideo-1.5、MiniMax-H3 等主流视频模型。它改变的是视频推理的成本线:注意力占单步去噪约三分之二,免训练内核意味着存量模型直接受益。
原文链接:arXiv / MarkTechPost
核验记录
arXiv 摘要页直读(2609.15810,cs.CV);MarkTechPost 9/17 报道交叉;端到端与内核倍速为论文自报基准