Apple 发 DSAS:激活转向按上下文动态调强度,只在检测到不良行为时干预
Apple 机器学习研究 9 月(TMLR,页面标注 published September 2026)发表 Dynamically Scaled Activation Steering(DSAS):现有激活转向方法对所有输入施加统一干预,不需要转向的输入也被牵连、模型性能受损。DSAS 把「何时转向」与「如何转向」解耦,生成时逐层、逐输入计算依赖上下文的缩放因子,只在检测到不良行为(如毒性输出)时强干预。
它改变的是模型行为控制的开销结构:转向从「全量常开」变为「按需介入」,方法无关的设计让现有转向变换可以直接套用,不动模型权重就能控制行为。
原文链接:Apple 机器学习研究页
核验记录
Apple ML Research 详情页直读,页面 content type paper + published September 2026;页面无 JSON-LD datePublished 与可见具体日期,日期以「2026 年 9 月」收录(TMLR 论文,非官方新闻公告)