AI 资讯聚合 · 行业资本

微软发 AI 行为准则:MAI 模型红线写入文档,禁欺骗性逃避人类监督

国外行业资本安全对齐微软微软 · 2026-09-14 · 约1分钟 · 来源:TechCrunch / The Decoder
微软发 AI 行为准则:MAI 模型红线写入文档,禁欺骗性逃避人类监督

微软于 9 月 14 日发布一份 AI 行为准则(code of conduct),约束其 Microsoft AI 旗下 MAI 模型的训练与行为:文档开篇预测未来十年超智能系统将在多数任务上超过人类表现,并称「容纳、控制与对齐这种力量是人类面临的最大挑战之一」。准则设定凌驾于用户偏好之上的「绝对约束」——禁止网络攻击、核武器与深度伪造——并明文禁止模型使用适应性、欺骗性、自强化或共谋机制逃避或击败人类监督,以保证始终能被可靠地导向、修改或关停。

它与 Anthropic 的「前沿限速」是同一波安全转向的两种落法:Amodei 求的是行业节奏共识,微软把价值观与红线写进自家训练文档。区别在约束半径——前者靠外部评估员盯行业,后者靠内部文档管自己;在 rogue-agent 事件与 Anthropic 研究员出走警告连续发生的当口,这是首个把「不许逃避关停」写成明文的大厂准则。

原文链接:TechCrunch / The Decoder

核验记录
官方页 microsoft.com/en-us/ai/ai-conduct 直读 403,Wayback 429、archive.today 全域超时,未读到官方一手日期;发布日期 9/14 由 TechCrunch(Russell Brandom, 9:27 AM PDT · September 14, 2026)与 the-decoder(og:article:published_time 2026-09-14T15:52:51Z)双源交叉;准则内容取自 TechCrunch 直引