Real-SWE 上线:只用企业私有代码库出题的编程榜,Fable 5.1 也只解出 38.8%
Specific Labs 于 9 月 10 日发布 Real-SWE:一个只用私有、真实企业代码库构建的编程评测。每道题都来自向真实公司授权取得的私有生产代码库,内容就是那些公司工程师手上的事——账单计费、税额计算、客户迁移,改动往往横跨多个服务,答案与实现都不存在于公网。榜单上 Claude Fable 5.1(配 Claude Code)解出率 38.8% 居首,GPT-6 Astra(Codex CLI)33.8%,Gemini 3.8 Flash(Gemini CLI)31.2%,GLM 5.3 28.8%,Grok 4.6 与 Muse Spark 1.3 并列 23.8%,Kimi K3 18.8%。
它的意义是给现有榜单的可信度打了一个折。SWE-bench 一类的题目来自公开仓库,而公开仓库的解法很可能已经进了训练数据——分数高不代表能在没人见过的代码库里干活。把题目换成私有代码库,等于堵上「记忆」这条捷径:头名的绝对分数从 70% 档掉到 38.8%,这个落差本身就是信息。对企业买家来说,这也是第一次出现一个能直接对标「我的代码库」的参考坐标。