StudentSim用逼真模拟学生加速训练AI导师

The Decoder··作者 Jonathan Kemper

关键信息

StudentSim首先使用汇总的学生数据训练共享模型,再利用某个学习者的少量记录进行个性化调整,其基础模型为Alibaba的Qwen3-4B-Instruct。测试涵盖国际象棋、英语作为外语和数学三个领域的60名学生,但目前披露的证据仍属于研究评估,并非大规模真实环境部署。

资讯摘要

自适应AI导师需要理解每名学生的优势、弱点以及对指导的反应,但从真实学习者那里收集这些信息成本高且耗时。StudentSim通过为每名学生构建独立的数字副本来解决这一问题,即使只有少量个人作业记录也能进行建模。以往方法往往只能做到其中一点:要么模仿学生的既有行为却无法理解提示,要么能够遵循提示却无法匹配特定学生的真实能力,而StudentSim同时优化行为还原度和对指导的响应能力。该系统采用两阶段训练,先从同一学科的汇总数据中学习常见错误和修改答案的方式,再用某名学生的稀疏记录进行个性化调整。

这种设计旨在减少过拟合,因为英语写作数据集中每名学生提交文章数量的中位数仅为三篇,而且超过三分之二的学生最多只有五篇。在覆盖国际象棋、英语作为外语和数学的60名学生评估中,StudentSim据称优于通过提示扮演学生的更大规模GPT-5.4模型。在国际象棋任务中,它预测玩家下一步棋的正确率约为后者的两倍,能够重现不同学习者面对同一局面时的不同选择,并且几乎总能遵循纠正性指导。职业棋手还认为,使用StudentSim训练的导师优于未接受此类训练以及使用GPT-5.4模拟学生训练的版本,包括出现严重事实错误的情况更少、解释质量得分更高。

StudentSim用逼真模拟学生加速训练AI导师

资讯正文

微软与伊利诺伊大学开发的一套新系统,可以利用有限的数据,为每名学生构建逼真的数字复制体。当从真实学生那里获取反馈的成本过高、速度过慢时,这些复制体能够迅速提供反馈,帮助研究人员改进 AI 辅导系统。

AI 辅导系统在能够适应每名学生的优势和薄弱环节时效果最佳。但要确定哪种指导方式适合每名学生,既耗时又费钱,因为这需要真实学习者参与。

论文作者写道,使用规模庞大且背景多样的学生群体来训练 AI 辅导系统,“成本高得令人望而却步,而且非常耗时”。因此,这类辅导系统的改进速度一直落后于 AI 模型的发展。

研究人员提出用学生的数字复制体代替真人提供快速反馈。他们的系统名为 StudentSim,即使某名学生只有非常少的学习记录,也能为其单独构建一个复制体。

学生复制体既要能犯下符合实际的错误,也要能从指导中学习

研究人员表示,现有方法只能具备两项必要能力中的一项。一些模型通过真实学生数据进行学习,能够可靠地复现某名学生的行为,但无法利用辅导系统给出的解释。另一些则是通过提示词被要求扮演学生的语言模型。它们很容易遵循辅导系统的提示,却无法准确反映其所模仿学生的真实能力。

StudentSim 将这两项能力都转化为可衡量的目标。该系统会衡量复制体的回答与学生本人有多接近,包括能否复现其典型错误,以及在辅导系统提供帮助后,复制体是否会及时修改答案。训练辅导系统既需要一个真实可信的起点,也需要一个能够对教学指导作出响应的模拟学生。

两阶段训练让有限的学生数据也能派上用场

研究人员面临的最大障碍是数据不足。在英语写作数据集中,学生写作数量的中位数仅为三篇作文,超过三分之二的学生写过的作文不超过五篇。研究人员称,直接利用如此少的样本训练复制体并不可行,因为模型会对这些样本产生过拟合。

StudentSim 转而采用两阶段训练。首先,一个基础模型会学习某一学科中所有学生汇总后的数据,从中掌握学生常犯的错误,以及他们在得到辅导系统提示后如何修改答案。

随后,研究人员再利用某名学生仅有的少量记录,对该模型进行针对性调整。在所有学科中,该系统均采用阿里巴巴的 Qwen3-4B-Instruct 语言模型作为基础模型。

StudentSim 在国际象棋、英语和数学上的表现优于 GPT-5.4

研究人员在国际象棋、英语作为外语和数学三个领域,对来自 60 名学生的数据进行了测试。他们使用了包含真实学习者记录的公开数据集。当 GPT-5.4 通过提示词扮演学生时,StudentSim 在全部三个学科中的表现均优于规模更大的 GPT-5.4 语言模型。在国际象棋方面,StudentSim 正确预测棋手下一步走法的概率约为后者的两倍,而且几乎总能遵循纠正性指导。GPT-5.4 和专门的国际象棋模型均落后于 StudentSim。

研究人员表示,现有的各种方法都有不同的弱点。GPT-5.4 会遵循提示,但无法复现某个特定学生所犯的错误。国际象棋模型能够匹配棋手的行为,却无法理解文字提示,并会将其忽略。在一个棋局中,三名真实棋手选择了三种不同的走法。StudentSim 复现了每名棋手的选择,而一个国际象棋模型则为三人预测了同一个最有可能的走法。GPT-5.4 对三人的预测全都错了。

使用模拟学生进行训练可改善国际象棋辅导模型

作为另一项概念验证,研究人员使用一个学生复刻模型来改进国际象棋辅导模型。职业国际象棋棋手评估了三个版本:一个没有接受这类训练,一个以 GPT-5.4 作为学生进行训练,另一个则使用 StudentSim 进行训练。

经 StudentSim 训练的辅导模型在三项指标上都获得了最高分。它出现的严重事实性错误最少,并在讲解质量和针对个别学生进行调整的能力方面获得了最高评价。在这个案例中,学生更喜欢通过提问引导他们找到解决方案,而不是直接给出指示。

以 GPT-5.4 训练的辅导模型在事实准确性方面,表现甚至不如没有接受额外训练的辅导模型。

研究人员表示,这只是一项概念验证,并不意味着他们声称已经打造出最好的辅导模型。国际象棋适合作为测试案例,是因为引擎可以客观判断在任何给定局面中某一步棋是否合理。作文写作和开放式数学题则更难,因为这类任务缺乏能够可靠评估自由形式答案的评分函数。

接下来,该团队希望模拟学生如何在多次练习过程中获取、保留和遗忘知识。相关代码已发布在 GitHub 上。

2024 年,研究人员根据对每位参与者进行的两小时访谈,使用 AI 智能体复刻了约 1,000 名真人。另一项研究则展示了这些复刻模型多么容易出错。九个被要求模仿 X、Bluesky 和 Reddit 用户行为的开放语言模型,越是表现得像真人,其生成内容的准确性反而越低。

Microsoft 也在与真实学生一起测试 AI 辅导工具。在尼日利亚开展的一项试点项目中,学生连续六周、每周两次使用 Copilot。他们测试成绩的提升幅度,相当于额外接受了近两年的学习。

OpenAI 和 Google 也分别通过 Study Mode 和 Guided Learning 提供自己的学习模式。这些模式依赖系统指令以及针对教学进行微调的模型,但两者都不会维护针对个别学习者的模型。如果缺乏这种适应性,AI 辅助可能会损害学习表现。研究显示,在短暂接受 AI 辅助后,用户的表现比从一开始就独立完成任务的人更差。

来源与参考

  1. 原始链接
  2. Simulated students that make realistic mistakes help AI tutors learn faster