AI 资讯聚合 · 大模型

Apple 发 DSAS:激活转向按上下文动态调强度,只在检测到不良行为时干预

海外大模型激活转向模型行为Apple · 2026-09-18 · 约1分钟 · 来源:Apple 机器学习研究页

Apple 机器学习研究 9 月(TMLR,页面标注 published September 2026)发表 Dynamically Scaled Activation Steering(DSAS):现有激活转向方法对所有输入施加统一干预,不需要转向的输入也被牵连、模型性能受损。DSAS 把「何时转向」与「如何转向」解耦,生成时逐层、逐输入计算依赖上下文的缩放因子,只在检测到不良行为(如毒性输出)时强干预。

它改变的是模型行为控制的开销结构:转向从「全量常开」变为「按需介入」,方法无关的设计让现有转向变换可以直接套用,不动模型权重就能控制行为。

原文链接:Apple 机器学习研究页

核验记录
Apple ML Research 详情页直读,页面 content type paper + published September 2026;页面无 JSON-LD datePublished 与可见具体日期,日期以「2026 年 9 月」收录(TMLR 论文,非官方新闻公告)