想象你是一位老师,正试图帮助一名学生,而该学生总是犯同一种特定类型的错误。也许他们总是在加法中忘记进位,或者混淆面积公式与周长公式。要有效地教导他们,你需要针对这些薄弱环节的练习题。
问题在于:获取真实的学生错误数据非常困难。隐私法律和伦理规定意味着学校无法直接共享一个庞大的“学生如何失败”数据库。
本文提出了一种解决方案:让 AI 假装成一个会犯特定错误的学生。 但这里有个陷阱:现代 AI 非常擅长给出正确答案,也非常擅长制造随机的错误答案。要让 AI 故意犯下特定且结构化的错误,则要困难得多。
以下是作者如何解决这一问题的说明,通过一个富有创意的类比来阐述。
“厨师与美食评论家”类比
将 AI 系统想象成一个拥有两个不同角色的厨房:
生成智能体(GA)是厨师。
厨师的工作是烹饪一道菜(解决一道数学或科学问题)。但厨师的任务不是做出最美味的菜,而是接到了一项具体指令:“做一道尝起来像是有人忘了加盐的菜。”
- 挑战: 如果你只是告诉厨师“做一道咸的菜”,他们可能会直接往菜里倒一桶盐(随机错误)。如果你告诉他们“做一道尝起来像是有人忘了加盐的菜”,他们可能会因为烹饪技艺太精湛而不小心做出一道完美的菜。
审查智能体(EA)是美食评论家。
评论家品尝这道菜。他们有两个问题:
- “这道菜真的很难吃(答案错误)吗?”
- “它的味道是否 exactly 像‘忘了加盐’(特定错误类型),还是厨师只是随机搞砸了?”
- 如果评论家说:“不,这尝起来像是‘忘了加胡椒’,”那么这道菜就会被送回给厨师重新尝试。
五种“糟糕烹饪”类型
研究人员并没有仅仅要求“难吃的食物”。他们根据人们实际学习的方式,制定了一份菜单,列出了学生(或厨师)可能失败的五种具体方式:
- 失误(思维笔误): 厨师知道食谱,但不小心掉了勺子。(例如:把 6 写成 9)。
- 缺少食材(知识缺口): 厨师不知道什么是“小苏打”。
- 错误信念(误解): 厨师认为糖会让东西变咸,因为他们过去有过糟糕的经历。
- 错误食谱(错误选择): 厨师试图用汤的食谱来做蛋糕。
- 盲区(结构性盲视): 厨师不理解食材之间如何相互作用。他们认为烤箱时间和温度是相互独立、互不相关的两件事,而不是一个系统。
他们的发现
该团队在数百道高难度的科学和数学问题上测试了这个“厨师与评论家”系统。以下是他们的发现:
- 这比你想象的更难: 让 AI 犯特定类型的错误,比仅仅让它犯任何错误要困难得多。这就像要求一位钢琴大师在演奏时故意弹错一个特定的音符,而不是仅仅偶然弹错一个音符。
- “答案锚定”技巧: 当厨师(GA)被允许先看到正确答案,但被要求以特定方式故意偏离它时,系统效果最好。这就像说:“这是完美的蛋糕。现在,请做一个看起来完美但具有特定缺陷的蛋糕。”
- 评论家至关重要: “评论家”(EA)是必不可少的。如果没有第二个 AI 来检查工作,厨师往往会制造随机错误,或者不小心得出正确答案。
- 最难的错误: “盲区”(结构性盲视)是最难生成的错误。这是最复杂的错误,整个思维方式都是错的,而不仅仅是一个小的计算错误。即使是最高级的 AI 也难以逼真地模拟这种错误。
- 更多信息并不总是更好: 给厨师额外的食谱或更多的示例并没有太大帮助。关键在于反馈循环:厨师做菜 -> 评论家说“不,再试一次” -> 厨师再试一次。
结果
作者构建了一个“食谱”(一个框架),可以生成成千上万种这种特定且有针对性的错误。他们将其作为工具发布,以便教育工作者和研究人员无需真实的学生数据即可构建练习材料。
简而言之: 他们找到了方法,让超级聪明的 AI 假装成一个困惑的学生,且正是以真实学生感到困惑的方式,从而我们可以构建更好的工具来帮助学生学习。他们通过让一个 AI 尝试制造错误,并让第二个 AI 充当严格的评判者以确保错误是正确类型的错,从而实现了这一目标。
技术摘要:将错误作为透镜:通过合成误解生成探测大语言模型的推理能力
问题陈述
教育技术应用程序(包括个性化辅导、教师培训和教育研究)依赖于获取有针对性的合成误解。然而,获取大规模、带标签的真实学生错误语料库受到隐私法规、机构审查委员会(IRB)限制以及存储可识别评估数据的伦理敏感性的严重制约。虽然大语言模型(LLM)提供了一条可扩展的路径来生成合成错误,但存在一个关键差距:现代 LLM 可以轻松生成任意错误答案,但它们难以生成与特定、指定的认知失败模式相一致的错误。核心挑战在于创建一个框架,以生成(i)真正错误、(ii)与特定认知失败模式一致而非任意错误、且(iii)在不同学科中表现稳定的错误答案。
方法论:GA/EA 框架
作者提出了一种双智能体框架,旨在生成针对分类学的合成错误。该系统将错误解决方案的起草与其类别一致性的验证解耦。
错误分类学:该框架利用基于修订版布鲁姆分类学(Anderson 等人,2001)调整的五类错误分类法。保留的类别包括:
- E1(心理笔误/粗心作业):在整体正确的轨迹中出现的算术或转录失误。
- E2(知识缺口):缺失定义、术语或公式。
- E3(误解):错误的心理模型或缺失的概念。
- E4(错误选择):错误的问题分类或选择了错误的解题过程。
- E5(结构性盲区):未能区分组件及其相互作用。
(注:描述次优但正确答案的类别已被排除,因为它们不代表错误的最终答案。)
智能体架构:
- 生成智能体(GA):一个预训练的 LLM,负责根据特定的目标错误类别起草候选错误解决方案。作者采用单个多类别 GA,而非五个专用智能体,以防止“漂移”到相关类别,因为专用智能体缺乏区分相邻失败模式的跨类别上下文。
- 审查智能体(EA):一个评估 GA 草案的裁判,基于两个维度:(a) 响应是否真正错误,以及 (b) 是否匹配目标错误类别。EA 在评估时不查看 GA 的上下文示例,以防止表面模式匹配。
流程配置:本研究评估了八种流程配置(P0–P8),这些配置在三个设计维度上有所不同:
- 答案基础:GA 是否接触正确答案。
- 条件设定:GA 是否接收扩展的少样本示例或外部教科书摘录。
- 反馈循环:EA 是否将拒绝信号(包括草案和理由)反馈给 GA 以进行迭代再生(最多五次尝试)。
- EA 实现:比较提示式 LLM 裁判与在 1,600 个人工标注示例上训练的微调 BERT-base-uncased 分类器(P8)。
实验设置
该框架在 TheoremQA 数据集上进行了评估,这是一个涵盖数学、物理、电气/计算机科学和财务的定理驱动问答数据集。
- 一级(验证基准):在所有 9 种流程和 3 个后端(OpenAI o3/GPT-4o 混合、GPT-5、GPT-5-mini)上对 20 个问题进行全面测试,允许无限次重试并进行最终人工验证。
- 二级(规模运行):在 GPT-5 上运行 200 个问题,限制为 5 次尝试,以评估大规模下的成本和延迟。
- 指标:主要指标是目标错误率,定义为既错误又符合请求错误类别的生成比例。正确答案或承认无知(认知拒绝)的响应被视为失败。
关键结果
- 目标生成的难度:目标错误生成比自由形式的错误答案生成要困难得多。朴素基线(P0)在所有后端上的表现均低于上限 23–39 个百分点。
- “结构性盲区”瓶颈:E5 类(结构性盲区)被证明是所有配置中最难的目标,尤其是对于较弱的后端。该类要求模型在保持表面连贯推理的同时,全局性地错误构建问题框架,这与简单的算术失误(E1)或公式替换(E2)截然不同。
- 设计维度的影响:
- 答案基础:向 GA 提供正确答案通常提高了较强后端(GPT-5)的性能,但降低了较弱后端(o3+GPT-4o)的性能,因为较弱模型难以抑制正确的轨迹,导致“部分正确”的推理未能通过类别一致性检查。
- 反馈循环:EA 反馈循环(P3)提供了最显著且一致的提升,特别是对于较弱后端。它允许 GA 偏离被拒绝的草案,这是简单的基于温度的采样无法可靠实现的。
- 脚手架:扩展示例和外部教科书摘录(P4–P7)在强后端上并未比更精简的 P1/P3 配置产生明显的改进,在某些情况下甚至稀释了类别信号。
- 后端差异:后端之间的差距巨大且不对称。GPT-5 实现了约 0.82 的平均目标错误率,而 GPT-5-mini 和 o3+GPT-4o 落后 12–14 个百分点。这一差距是由抑制正确答案并在反馈下多样化草案的能力驱动的,而非原始的问题解决准确率。
- 微调与提示式 EA:微调的 BERT 分类器(P8)提供了一种部署权衡。它实现了接近单次通过的接受率(高效率),并在最弱的后端上优于提示式 EA,但其适应性较差,且未能在 GPT-5 上缩小 E5 的差距。
意义与主张
本文提出了一项主要的方法论贡献和一项次要的经验观察:
方法论贡献:作者提出了一种可扩展、可重用的方案,用于在缺乏真实学生语料库的领域构建分层合成错误数据集。通过将起草与评判解耦,并将人工监督移至“裁判”端(或使用微调分类器),该框架允许任何预训练 LLM 充当“替代学生”,以生成受控的误解。
经验观察:目标错误生成本质上是一个可控性问题,而非知识获取问题。结果表明,答案基础和迭代反馈循环对于生成特定错误类型比提供扩展上下文或教科书内容更为关键。
局限性与范围
作者明确指出,该框架生成的是针对分类学的合成错误,而非经过实证验证的类学生错误。本研究未测量生成的表面形式是否与真实学生实际产生的内容相匹配。评估依赖于单一分类法和闭源模型,“目标错误率”作为基于正确性的基准的补充指标呈现,揭示了标准准确率指标所遗漏的行为(受控失败模式)。该工作将自己定位为构建下游教育应用的实用工具,但需附带说明:真实学生的验证仍是必要的未来步骤。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。