Motus2:一套权重同时当策略、模拟器与评分器,让机器人自己迭代

生数科技与清华团队的世界模型 Motus2 论文 9 月 10 日更新到 v2(v1 为 8 月 31 日):同一个共享权重模型暴露三个接口——策略(世界-动作模型)生成候选动作、模拟器(动作条件世界模型)预测这些动作的画面后果、评分器(价值模型)给预测结果打分,三者耦合成「生成动作→预测后果→评估结果→更新策略」的闭环,模型可以用自己的预测与评分当反馈继续改进策略。
另一处变化在数据用法:成功轨迹教动作,失败与次优交互不再被当噪声过滤,而是用来学动力学与价值判断;推理时用 Best-of-N 先想几个候选、脑内模拟后择优执行,训练时把打分转成策略更新信号,且只更新动作相关参数以免把已学好的预测与评估带偏。需要说清边界:这轮放出的只是论文与项目页,代码与检查点按官方 roadmap 在 2026 年 9 月内逐步开源、当前一项未勾选,所谓「自进化」指的是用自身预测与价值反馈改进策略,不是机器人已在开放环境里无限自主学习。
原文链接:arXiv 论文页 / 官方项目主页
核验记录
日期取自 arXiv 2608.30237v2 的 citation_online_date 2026/09/10(v1 提交 8/31,超 7 天窗);代码仓库 shengshu-ai/Motus2 的 created_at 为 2026-09-11,官方项目页只标「September 2026」无具体日期,中文报道(量子位)为 9/12 二次转述。因此本条是论文级更新而不是模型发布——README 的 Open-Source Roadmap 七项全部未勾选,权重与代码尚未放出。官方站 shengshu-ai.com 对本机直读超时 / Jina 422,未能取得官方发布公告,此点存疑。配图取项目页头图,两次实测(裸请求 + 带 Referer)均返回 542,218B PNG 2110×1071。