Anthropic 红队测评模型「找人」与「造武器」:前沿模型已能替代稀缺专家的一部分

Anthropic 的 Frontier Red Team 9 月 10 日发布一组能力评测,覆盖情报定位链条的三类任务:跨平台账号关联与人物分类、仅凭照片的地理定位、以及常规武器的工程改进。评测用模型生成的模拟社媒内容(WhatsApp、Telegram、Instagram、Facebook)构造 200 个任务,其中位样本约 3.7 万字——人类分析师读完约需 2.5 小时,而 Claude Mythos Preview 平均 11 分钟给出完整评估。
官方结论分两层:前沿模型在模拟情报与武器开发任务上持续进步,测试中落后的开源权重模型处于 Sonnet 与 Mythos 级之间,但仍往往展现出令人担忧的能力,因此「远未达到前沿的模型也会有情报与军事用途」;问题于是从「要不要设防」变成模型该如何训练、防护与开放。这条与同日发布的威胁情报滥用案例报告互为表里:一份讲已经发生了什么,一份讲模型现在能做什么。本次评测数据为官方合成数据,官方自己也标注了「不够真实」的局限。
原文链接:Anthropic 官方研究页
核验记录
研究页正文与 Anthropic 官方新闻页的 Publications 列表两处均标 Sep 10, 2026,互相印证;该页无 JSON-LD datePublished 字段,故日期取自两处可见日期。与此前已收录的 9/10 威胁情报报告(anthropic-threat-intelligence-report-september-2026)同为 9/10 但为两份不同文档,本条是能力评测、那条是滥用案例。