FoundationalASSIST: An Educational Dataset for Foundational Knowledge Tracing and Pedagogical Grounding of LLMs
本文介绍了 FoundationalASSIST,这是一个包含 170 万条详细的学生交互记录并与 K-12 标准对齐的综合教育数据集,该数据集揭示了当前的前沿大语言模型在实现个性化学习所需的可靠知识追踪和教学推理能力方面显著不足。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个才华横溢、博学多才的机器人如何成为一名人类导师。你给了它一个包含人类历史上所有数学题目的图书馆,并问它:“你能弄清楚一个学生是如何思考的吗?”
这篇名为 FoundationalASSIST 的论文是首次尝试用真实数据来回答这个问题的重大尝试。作者们为机器人构建了一本全新的“训练手册”,并将目前最智能的 AI 模型置于测试之中。以下是他们的发现,通过简单的语言进行了解释。
问题所在:机器人被蒙上了眼睛
多年来,研究人员一直试图利用旧的数据集来教授 AI 教育知识。但这些数据集就像是一本只有姓名和电话号码的电话簿。它们告诉 AI:“学生 47829 做对了第 99 题。”
AI 完全不知道第 99 题是在讲什么。它是关于分数吗?是一个陷阱题吗?学生做对是因为猜对了吗?AI 被蒙上了眼睛。它无法“阅读”问题,也看不见学生的实际错误,因此它无法学习学生是如何学习的。
解决方案:一个全新的、丰富的数据集
作者创建了 FoundationalASSIST。可以把这看作是从一本电话簿升级到了一间教室的全程录像。
与其只提供“正确/错误”,这个新数据集包含了:
- 实际的问题: 机器人可以像人类一样阅读数学题。
- 真实的答案: 如果学生把“12”写成了“27”,机器人能看到这个具体的错误。
- 错误的选项: 如果学生选择了选项 B 而不是 A,机器人能准确看到他们掉进了哪个“陷阱”。
- 课程地图: 它将每个问题与官方教学标准(如“六年级分数”)联系起来。
他们收集了来自 5,000 名学生的 170 万次交互。这是第一次英语 AI 能够接触到如此详尽的细节。
实验:让机器人接受测试
研究人员利用这些新数据,向四种世界上最智能的 AI 模型(如 GPT-OSS、Llama 和 Qwen)提出了系列挑战。他们提出了两种主要类型的问题:
- “水晶球”测试(知识追踪): “根据这位学生的历史记录,他们下一个问题会做对吗?他们具体会写下什么答案?”
- “教师直觉”测试(教学落地): “这两个问题中哪一个更难?哪一个更能区分出优秀学生和挣扎中的学生?哪些错误答案是学生最常选的?”
结果:机器人很聪明,但并不具备“人类般的聪明”
结果令人惊讶,也让 AI 导师的前景显得有些令人失望。
1. “水晶球”变得模糊不清。
当被问及预测学生是否会做对一个问题时,AI 模型的表现几乎仅比抛硬币好一点点。
- 类比: 想象一位气象预报员每天都预测“晴天”。由于在这个数据集中晴天的概率是 51%,所以他的准确率是 51%。而 AI 模型仅达到了大约 56% 的准确率。它们并没有真正“学习”学生,而只是在猜测“是的,他们会做对”。
- 偏差: 这些机器人存在乐观偏差。当学生实际做错时,AI 几乎总是预测他们会做对。这就像一位不愿相信孩子正在挣扎的家长,因为他们只想看到好成绩。
2. “教师直觉”表现不一。
- 难度: 机器人在这一点上表现得其实不错。它们能分辨出数字较大的题目比数字较小的题目更难。它们的准确率约为 68%。
- 区分度(重大失败): 这是机器人彻底失败的地方。“区分度”意味着:这个问题是否真的能把聪明的孩子和挣扎的孩子区分开来?
- 类比: 想象一个非常难的题目,以至于所有人都会失败。人类教师知道这是一个糟糕的问题,因为它无法告诉你谁聪明,谁不聪明。然而,AI 模型却认为这个糟糕的问题是一个好问题。在这一任务中,它们的表现甚至低于随机水平。它们根本不理解什么是“诊断性”的问题。
- 常见错误: 机器人在猜测学生最常选的错误答案(例如常见的数学错误)方面表现尚可,但在猜测学生“绝不会”选哪些错误答案方面表现极差。
为什么会失败?
作者利用简单的逻辑提出了几个可能的原因:
- 基于成功的训练: AI 模型是在教科书和解答手册上进行训练的。它们见过数百万个正确的答案,却很少见到挣扎中的学生那种混乱、困惑的思维过程。它们就像是只品尝过完美菜肴、却不知道烧焦的饭菜是什么味道的大厨。
- 缺乏“学生大脑”: 传统的数学模型拥有针对每个学生的特定“记忆”,并随着每个问题进行更新。而这些 AI 模型只是在阅读一份长长的过去问题列表。它们没有内置的机制来表达:“啊,这个学生总是忘记进位。”
总结
论文得出结论:虽然 AI 在创作诗歌或解决数学问题本身方面非常出色,但它尚未准备好成为一名个性化的导师。
它无法可靠地预测学生何时正在挣扎,也不理解设计一个能揭示学生知识水平的测试题所蕴含的微妙艺术。在我们信任 AI 来管理学校或辅导孩子之前,我们需要教会它如何理解人类的错误,而不只是人类的成功。
作者发布了这个新的数据集(FoundationalASSIST),以便其他研究人员可以尝试填补这些空白,正如最初的“ASSISTments”数据在过去十年里帮助研究人员那样。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。