Base Labs 联合 Hugging Face、Goodfire 发起开放权重模型安全标准:HF 上已有 6000+ abliterated 模型
Baseten 研究部门 Base Labs 于 9 月 17 日宣布与 Hugging Face、Goodfire AI 合作,为开放权重模型构建安全评估与监控基础设施,定位为「开放模型安全标准」:安全控制应透明并内建于模型训练与部署流程,而非部署后加装。背景是「abliteration」(去除安全护栏的权重改写)已成规模——Hugging Face 现列有超 6,000 个此类模型。
Base Labs 将开发并公开发布开放模型的训练与监控方法,Goodfire(可解释性方向)负责「内建」部分,HF 承担托管分发,并向更广开发者社区开放共建。截至发稿三方未披露任何技术规格、评估套件、时间表或治理模型——公告只给出方向而非可运行的系统,标准成色取决于后续发布的方法能否被外部复现检验。TechCrunch 9/17 10:15 PDT 首发。
原文链接:TechCrunch
核验记录
TechCrunch 9/17 文章(datePublished 2026-09-17T23:21Z 同轮核过)+ Base Labs 官方帖与 Goodfire 回复交叉;未直读官方公告正文
← 上一篇联合国联合 Google 上线 UN System Data Commons:UN 统计数据对 AI 智能体开放 MCP 查询下一篇 →Google DeepMind 成立 DeepMind Institute:AGI 影响研究平台,Legg 主编首批 4 篇文章