AI 资讯聚合 · 榜单评测

Epoch 实测长上下文延迟:GPT-5.6 二次增长,Claude 5 接近线性

国外榜单评测推理Epoch AIEpoch AI · 2026-09-08 · 约1分钟 · 来源:Epoch AI 官方报告
Epoch 实测长上下文延迟:GPT-5.6 二次增长,Claude 5 接近线性

Epoch AI 9 月 8 日发布报告,测量首字延迟(TTFT,关闭推理)随上下文长度的变化:OpenAI 的 GPT-5.6 Terra 与 Sol 呈明显上凸曲率,与显著的二次项一致;Anthropic 的 Claude Sonnet 5 与 Opus 5 接近线性。作者用三种对延迟噪声做不同假设的估计量重算(Student-t、随机前沿回归、spike-plus-contention),曲率结论不变——不像离群点把曲线拉上去。

报告把差异归到架构取舍而非单纯工程调优:Kimi K3 与 Qwen3.5 用线性注意力与全注意力 3:1 混合,把二次项压掉四分之三;Qwen3.8-Flash-Next 与 GLM-5.3-Flash 进一步替换为稀疏注意力,gpt-oss 则用滑窗注意力。Claude 的近线性被读作同类选择,而 OpenAI 侧的定价(超过 27.2 万输入 token 后翻倍)与 Codex 默认在 27.2 万前自动压缩,也和二次曲线一致。含义很直接:长上下文的成本差异正在从「谁家便宜」变成「谁家架构选对了」。

原文链接:Epoch AI 官方报告

核验记录
Epoch 官方 Publications 列表与报告页均标 Report Sep. 8, 2026,两处一致;报告含测量方法与三种估计量说明。未直读其公开数据集,曲线结论取自官方正文。配图为该报告 og:image(Epoch 自有资产)。