微软与 UIUC 发 StudentSim:用学生的数字替身训练 AI 导师,三科成绩反超体量更大的 GPT-5.4
微软研究院与伊利诺伊大学厄巴纳-香槟分校 9 月 14 日发布 StudentSim:为每个学生建一个数字替身,由替身在训练回路里代替真人给 AI 导师反馈。动机很直接——要弄清哪种讲解对哪个学生有效,就需要大量真人学习者反复参与,作者在论文里称其代价高到「贵得做不动」,结果导师的迭代速度一直落后于底模本身。
难点在数据:英语写作数据集里学生中位数只写过 3 篇作文,超过三分之二不超过 5 篇,直接拿这点数据微调会过拟合。于是采用两阶段训练——第一阶段在所有学生的汇总数据上学共性(常见错误、以及拿到提示后怎么改),第二阶段再用个人少量记录做个性化适配。既有做法各缺一半:从真实数据学出来的行为模型能复现学生,却听不懂导师的讲解;直接用提示让语言模型扮演学生,又会顺着讲解走、不复现该学生的特有错误。
在象棋、英语(外语)、数学三科上,系统以阿里巴巴 Qwen3-4B-Instruct 为基座,用 60 名学生的公开数据集训练与评测。官方称 StudentSim 三科均优于体量更大的 GPT-5.4:象棋里三个真实棋手的走法它逐项预测正确,而 GPT-5.4 全错。它的意义不在于又一个榜单分数,而在于把「学习者」本身做成了可复用、低成本的训练设施——教学模型的瓶颈第一次从模型侧移到模拟精度侧。
原文链接:微软研究院官方博客
核验记录
官方博文 microsoft.com/en-us/research/blog/studentSim 的 JSON-LD datePublished 2026-09-14T14:22:34+00:00 直读,作为发布日;对应论文 arXiv 2609.01591 页内 citation_date 与 citation_online_date 均为 2026/09/01,早于博文,不作为发布日。正文经 r.jina.ai 直读官方博文;数字(中位数 3 篇、60 名学生、Qwen3-4B-Instruct 基座)取自博文与 The Decoder 9/20 报道交叉,论文 PDF 全文未读。