Apple 发 REVERSAL-BENCH:首个度量「免重置强化学习悬崖」的可逆性基准
Apple 于 9 月 17 日在其机器学习研究页发布 REVERSAL-BENCH:面向自主强化学习的可逆性评测基准,度量「免重置 RL 悬崖」——智能体一旦进入不可逆状态就无法继续训练的失败模式。基准提出可逆性轴(reversibility axis)与重置预言机(reset oracle)两个构件,用于把「可恢复」与「不可恢复」的状态转移显式分开。
核心发现:安全盾(safety shield)能在不可逆失败发生前准确预测风险,但主动恢复只在智能体能物理避开陷阱时才奏效——被预测准确不等于能被救回。论文链接 arXiv 2609.17745,官方页 published 2026-09-17,未开源代码与数据集。
原文链接:Apple 机器学习研究页
核验记录
官方详情页直读 JSON-LD published 2026-09-17,arXiv 链接 2609.17745 互证;代码/数据集字段为空(官方未开源)
← 上一篇Crusoe 融 39 亿美元 F 轮:估值 309 亿,投向 AI 工厂与模块化算力单元下一篇 →GPT-6 Astra 拿下 ARC-AGI-3 62.7%:宝可梦 18 小时通关、Minecraft 141 小时史上最远,遇挫后种了数小时土豆