AI 资讯聚合 · 智能体

Claude Code 上线 plugin evals:用 Δ 证明 skill 真的起了作用

国外智能体评测Claude CodeAnthropic · 2026-09-11 · 约1分钟 · 来源:Anthropic Claude Code 官方文档

Anthropic 为 Claude Code 加了插件评测工作流:claude plugin eval 把插件放到真实 prompt 上跑、对模型的产出打分,并自动做一次「不装插件」的对照。每个用例默认跑两臂,二者之差 Δ 就是插件贡献——官方文档的示例是单用例 WITH 1.00、W/OUT 0.33、Δ +0.67(6 次运行、约 0.41 美元、74 秒)。

6 种评分器里有 4 种不花钱(regex、tool_used、tool_order、file_exists),llm 与 baseline 两种要调裁判模型、计入费用。官方点名最常见的首个发现是「Δ 接近 0 且 tool_used: Skill 失败」——说明 Claude 在自然表达下根本没有触发这个 skill,而这正是只校验 manifest 语法的 claude plugin validate 看不到的行为缺陷。配上 --threshold、--max-cost-usd、--trust-plugin 即可当 CI 门禁,需 Claude Code v2.1.269 及以上。

原文链接:Anthropic Claude Code 官方文档

核验记录
文档页无 datePublished 字段;日期取官方 CHANGELOG 条目对应的 GitHub release v2.1.269,published_at 2026-09-11T19:17:55Z。