DeepSeek V4.1-Flash 上线:CED 架构把 KV cache 压到 1/4,V4-Pro 退役
DeepSeek 于 9 月 10 日发布 V4.1-Flash 并全量开源(MIT 协议),552B 参数 MoE、100 万 token 上下文、原生多模态,架构上首次采用因果编码器-解码器(CED):解码器全局 KV 从编码器末层隐状态投影而来,预填充每 token 仅激活 8B 参数、解码 16B,主 KV 缓存配合 FP4 压缩后为 890 字节/token,约为上代 V4-Flash 的 1/4,SSD 持久化存储需求降至 1/8。
变更的核心意义在成本结构:缓存命中费用占智能体推理成本的大头,KV 压缩直接压低这一项。官方同时宣布 9 月 14 日 04:00 UTC 起 deepseek-v4-pro 请求全部路由至 V4.1-Flash 并按其计价,V4-Pro 进入淘汰流程——新架构家族的最小模型在性能、成本、速度上全面超过上代旗舰。
原文链接:DeepSeek 官方发布页 / HF
核验记录
官方发布页 api-docs.deepseek.com/news/news260910 直读,页面标注 Release 2026/09/10;HF 仓库 deepseek-ai/DeepSeek-V4.1-Flash createdAt 2026-09-10T02:17Z 与 OpenRouter created 时间戳三源互证;架构细节(CED、8B/16B 激活、890 字节/token、FP4 KV)取自官方 README 直读