Knowing When to Defer: Selective Prediction for Responsible Knowledge Tracing
本文提出了一种用于知识追踪模型的内在选择性预测框架,该框架利用蒙特卡洛 Dropout 量化认知不确定性,证明推迟最不确定预测可显著提升准确率与公平性,同时揭示标准心理测量因素仅能解释模型不确定性信号的四分之一以下。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位正在批改一叠测验卷的数学老师。你工作出色,但即使是最优秀的老师也会有怀疑的时刻。有时,学生的答案令人困惑,或者题目过于棘手,以至于你无法百分之百确定自己的判断是否正确。在这些时刻,一位负责任的老师可能会说:“这个我不太确定;让我问问同事,听听第二意见。”
本文探讨的是如何教导计算机模型(具体而言,是用于预测学生学习数学情况的“知识追踪”模型)去做完全相同的事情。
以下是研究人员所做工作的分解,使用了简单的类比:
1. 问题: “过度自信的机器人”
多年来,研究人员构建了人工智能模型来预测学生能否答对数学题。这些模型就像读遍了图书馆所有教科书的机器人。它们非常擅长猜测,但存在一个缺陷:它们不知道自己何时在猜测。
即使它们错了,也往往听起来非常自信。在真实的课堂中,如果一个机器人自信地告诉学生错误的答案,那将是一场灾难。研究人员希望赋予这些机器人一种“直觉”,让它们知道何时该说:“我不知道,请人类老师来处理。”
2. 解决方案: “置信度计”(MC-Dropout)
研究人员并没有从头开始构建一个全新的机器人。相反,他们选取了三种现有的、流行的机器人设计(称为 DKT、SAKT 和 AKT),并赋予它们一种特殊的技巧,称为MC-Dropout。
可以将 MC-Dropout 想象成向同一个机器人询问同一个问题 100 次,但每次询问时,你都会稍微“模糊”它的思维(通过随机关闭其内部的一些连接)。
- 如果机器人 100 次都给出相同的答案,它就是自信的。
- 如果机器人给出了 50 种不同的答案,它就是困惑的。
通过测量机器人答案的波动程度,研究人员创建了一个“置信度计”。如果该计显示高度波动(高不确定性),系统会自动停止,并说:“我要把这个交给人类老师处理。”
3. 结果: “安全网有效”
该团队在一个来自 Eedi 平台的真实数学数据集上测试了这种方法。他们让机器人预测学生的答案,但每当机器人表现出“波动”(不确定)时,他们就让它跳过该预测,并将其转交给人类。
以下是发生的情况:
- 更高的准确率:通过跳过机器人不确定的 20% 的问题,剩余预测的准确率显著提高(约提高了 2 到 3 个百分点)。这就像一名篮球运动员在疲惫时停止投篮,只在状态好时投篮,其投篮命中率因此上升。
- 针对性的安全:机器人并非随机跳过问题。它专门跳过那些它最可能出错的问题。它跳过的问题出错的可能性是它保留的问题的 1.5 倍。
- 公平性:机器人并非只为“差生”跳过问题。它为所有技能水平的学生、所有难度的问题都进行了跳过。它公平地对待了每个人。
4. 大惊喜: “这不仅仅是关于难度”
研究人员想知道机器人为什么会困惑。他们试图用简单的、老式的数学规则(例如“这道题很难”或“这个学生很吃力”)来解释机器人的困惑。
他们发现,这些简单的规则只能解释机器人困惑的不到 4%。即使当他们使用复杂的非线性计算器试图寻找规律时,也只能解释其中的约23%。
类比:想象机器人之所以困惑,是因为它试图理解学生独特而混乱的学习历史——他们上周如何遗忘了一个概念,如何靠运气猜对了答案,以及他们如何以奇怪的方式将两个概念联系起来。简单的数学规则(如“问题 X 很难”)无法看到这种混乱的历史。机器人自身的内部“思维模糊”(MC-Dropout)是唯一能看到这一点的东西。
5. 结论: “知道何时退后”
主要的启示是,为了让 AI 在课堂上负责任,它需要知道何时退后。
- 不要依赖简单的规则:你不能仅仅通过查看问题的难度来判断 AI 是否安全。
- 利用 AI 自身的感受:AI 需要利用其自身的内部不确定性信号(即“波动”)来决定何时寻求帮助。
- 这是一项团队工作:该系统并非要取代教师。它是一种工具,通过过滤掉需要人类关注的棘手案例来协助教师,同时让 AI 处理那些直截了当的案例。
简而言之,该论文证明,赋予 AI 模型一种说“我不确定”的能力,可以使它们变得更聪明、更安全、更公平,而无需重新训练它们或构建全新的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。