462段真实辅导记录:AI家教最难学会少帮一步

2026年08月08日 由 ATYUN编辑部 发表 929 0
学生在书桌前使用AI数学辅导工具并独立思考几何题
学生使用AI数学辅导工具继续独立推理的场景示意图。

会解题,不等于会教人解题。北京时间8月8日凌晨,Allen人工智能研究所(Ai2)推出TutorMoments预览版,把七个大模型放进真实数学辅导的关键节点:学生卡住时,AI究竟该给提示,还是该少说一句、让学生再想一步?基于462段真实一对一辅导记录的测试显示,大模型默认的“乐于助人”倾向,恰恰可能成为AI家教的教学盲区。

这套评测不问答案对不对,而问帮助是否来得合适

看点一:数据来自462段去标识化的真实数学辅导对话,覆盖美国二至七年级学生。
看点二:27名有经验的数学教师标注超过1500个关键时刻,评测集进一步冻结为520个平衡样本。
看点三:七个模型在明确写出“何时搭脚手架、何时提高要求”后均有改善,但自动评分并不等于学生真的学会。

传统AI辅导评测往往奖励固定行为,例如始终不给最终答案,或每次都先给一个提示。但真实教学没有一条永远正确的动作规则。学生完全无从下手时,需要把任务拆小;学生已经形成思路时,继续提示反而会夺走必要的认知努力。TutorMoments把这种取舍定义为“支架”和“严谨度”之间的判断,而不是又做一套解题准确率榜单。

研究数据来自以美国Title I学校学生为主的高强度辅导项目,记录经过两轮去标识化处理。27名教师阅读对话,标记导师必须做出选择的时刻,并写下学生状态、导师动作及其效果。完整标注包含超过1500个关键节点和数千条文字说明;公开的可运行评测集从中冻结520个样本,支架与提高要求各260个,便于不同模型在相同条件下复测。

把真实对话暂停,再让模型接手五轮

评测会在教师标出的关键时刻暂停原对话,把此前上下文交给待测模型,让它接管导师角色五轮;另一模型扮演学生,并使用预先冻结的学生特征。随后,评分流程判断AI是否在需要时提供恰当支架、是否在学生准备好时推动更深思考,以及是否出现过度支架——例如过早拆完步骤、把难点直接讲透。

“正确动作”来自多名教师的多数标签,不由模型自行定义。研究者为七个模型分别设置两种提示:一种只要求“好好辅导”,另一种明确解释支架、提高要求与过度帮助之间的取舍。后者让每个受测模型的得分都提高,说明不少教学能力并非完全缺失,而是没有被普通助手式提示稳定调动出来。

但最清楚的共同倾向仍是帮得太多。普通提示下,模型更愿意解释、拆步和给线索,却较少要求学生说明理由、检验答案或独立完成下一步。增强提示能让AI更常推动严谨思考,但策略种类仍比真人导师单一,经常反复使用“解释你的答案”;真人则更可能暂时退后,让学生自行工作。

分数看似能超过真人,却不能写成AI更会教

同一评分流程下,原对话中的真人导师在恰当支架、恰当提高要求和避免过度支架三项的参考值分别为0.458、0.182和0.496;部分模型在增强提示下高于这些数字。然而这不是“AI击败教师”。标注者本来就在寻找可以改进的教学节点,样本因此集中包含真人导师的错失机会,而不是随机抽取的完整课堂,更不是最佳教师表现的上限。

更重要的是,TutorMoments测量的是模型在决策点采取了什么动作,并不测量真实学生是否学得更好。学生由模型模拟,评分也含模型分类器;研究团队承认,对“推动严谨思考”的识别比支架判断更不稳定。数据还局限于美国小学和初中数学、单一教师标注群体与纯文本对话,无法直接外推到高中、语言学习、特殊教育或多模态课堂。

开放数据让AI家教从“会回答”转向“会克制”

Ai2已开放去标识化数据、评测代码、冻结样本和模型续写记录,并在运行配置中记录数据版本、内容哈希、提示哈希与模型参数。开发团队可以用同一批关键时刻复测自有模型,也能比较不同系统提示、学生模拟器和评分器带来的变化。这种可重复性比单次演示更有价值,因为AI家教最危险的失败未必是答错,而是以流畅、耐心的方式替学生完成了本该发生的思考。

ATYUN认为,TutorMoments真正改变的是评测问题:从“模型能否给出正确解法”,推进到“模型能否判断此刻该不该给”。它仍只是预览版,距离真实学习增益、长期依赖和公平性验证还有明显距离;但对教育产品团队而言,下一步不应只扩充题库和答案准确率,还要把少帮一步、追问理由和等待学生纳入产品指标。一个总能立刻回答的助手,未必是一个合格的老师。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消