Inception 发布 Mercury 2.5:扩散 LLM 提速,每秒 1100 Tokens
Inception Labs 于 9 月 8 日发布 Mercury 2.5:新一代扩散大语言模型(dLLM),生产环境输出超 1100 Tokens/秒,自称最快的推理 LLM,较 Mercury 2 智能提升 40%,上线价 2 折(输入 0.04 美元/百万 Tokens)。
扩散路线是自回归之外的另一条路:首 token 延迟压到 300ms 内、吞吐 5-7 倍、单任务成本低 7 成;同步预览 Mercury Voice 与 Mercury Router,已上架 Inception API、OpenRouter 与 Baseten。
原文链接:Inception Labs 官方博客