AI 资讯聚合 · 行业资本

Anthropic 首次公开内部研发度量:Claude 主导 26% 的 AI 研发,3 万个智能体在跑

us行业资本对齐安全行业治理Anthropic · 2026-09-17 · 约2分钟 · 来源:Anthropic 官方新闻室
Anthropic 首次公开内部研发度量:Claude 主导 26% 的 AI 研发,3 万个智能体在跑

Anthropic 在官网公开了一套用于观察前沿实验室内部进展的度量方法,并提出三个维度:AI 在多大程度上参与构建下一代模型、实验室能否有效监督智能体的动作、算力如何被分配。它给出的内部快照是:以 Epoch AI 的自动化等级(AL0 到 AL5)衡量,截至 2026 年 8 月 Claude 尚未在任何被测量的 AI 研发子集上完全自主运行,但「主导」(AL4,给高层提示即可端到端完成大部分工作)的工作占 Anthropic AI 研发工作的 26%,处于「协作」及以上(AL3+)的超过 90%。

监督一侧的数字更具体:Anthropic 最常用的内部平台上「随时约有 3 万个智能体」在做研究与工程工作,这些动作 100% 经过在线监控(执行前拦截危险动作)并被离线监控采录;监控每周标记约 10 万份对话记录,其中最高优先级约 50 份升级到人工复核。该公司统计了 2026 年 8 月研究工程智能体的超过 10 亿次决策,其中 0.002%(约每 4.7 万次一次)被在线监控拦下。算力一层,Anthropic 抽查 7 月 13 日至 20 日一周:用于 AI 研发的算力里约 6% 投向安全研究,用于「AI 驱动的 AI 研发」的算力里约 12% 投向安全——公司自述这是刻意保守的估计。

这套数字的意义不在绝对值,而在于它把「实验室内部进展」变成可跨公司、跨时间比较的口径:Anthropic 主张任何前沿开发者都能按公开方法定期发布同类指标,并计划引入多家第三方评估方进入内部流程、系统与数据做核验。它也承认两个障碍——缺少共同方法学,以及用自家模型评估自家系统时「裁判」可能犯与选手同样的错。

原文链接:Anthropic 官方新闻室

核验记录
官方页 anthropic.com/institute/measuring-pace-of-ai-development 直读(三节方法+数字:AL 26%/90%、约 3 万智能体、10 亿次决策、0.002%/约每 4.7 万次一次、算力 6%/12%);该页无 JSON-LD datePublished,日期取自官方 /news 列表页该条目卡片的可见日期「Sep 17, 2026」。配图为官方 og 图,本机 curl 两次(裸请求 + 带 Referer)均 200 / JPEG 1200×630。数字全部为厂商自报,未独立复现。