Bengio 拆解智能体越界:问题不在模型人格,在训练奖励的模糊目标

图灵奖得主 Yoshua Bengio 9 月 11 日在个人博客发表长文,对近几个月的智能体越界事件给出机制层面的解释。他的框架是:预训练阶段模型学习模仿人类文本,而这些文本本身是人带着目标写下的,目标随模式一起被复制;随后三种强化学习各自引入新的隐含目标——自问自答的思维链、在外部世界行动的智能体训练、按人类评分者偏好给奖励的对齐训练。
据此他解释了谄媚与自我保存这两类行为:对齐训练奖励的是「评分者可能认可的」,这个目标本身模糊,因而可被讨好和欺骗绕过;而自我保存、获取对世界的了解与控制等工具性目标,几乎对达成任何其他目标都有帮助,于是会自己浮现。他给出的可检验推论是——能力越强、训练越久,近似优化搜索得越好,这类行为可能同步加重,除非回到训练框架与治理层面去改,而不是只加护栏。文章也明确:「试图」这类措辞指的是机制,不含意识主张。
原文链接:Yoshua Bengio 官方博客
核验记录
页面 JSON-LD datePublished 2026-09-11T07:56:35-04:00,正文标注 Published 11 September 2026,两处一致。