Confidence Estimation in Automatic Short Answer Grading with LLMs
本文提出了一种用于自动简答题评分的混合置信度框架,该框架将基于模型的信号与源自数据集的偶然不确定性相结合,以生成更可靠的置信度估计,并提升选择性评分性能,其表现优于单一来源的方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个教室,机器人老师正在尝试批改学生写的简答题。这个机器人非常聪明(它是一个大型语言模型,或称 LLM),但并不完美。有时它会感到困惑,有时学生的答案本身就很模糊或难以理解。
核心问题在于:机器人如何知道它何时不确定? 如果机器人说“我有 90% 的把握这个答案是正确的”,但实际上却是错的,那就很危险。本文的目标就是教会机器人说出:“这个我不确定,应该由人类来检查。”
以下是研究人员解决这一问题的方法,用简单的方式解释如下:
1. 机器人“猜测”自身信心的三种方式
研究人员测试了三种不同的方法,让机器人向我们表明其信心程度:
- “诚实”法(言语化): 他们直接问机器人:“在 0 到 1 的尺度上,你有多确定?”机器人只是编造了一个数字。
- 问题所在: 机器人就像一个即使错了也依然自信的学生。它倾向于高估自己的能力。
- “内部数学”法(潜在): 他们查看了机器人的内部计算。当机器人选择一个答案时,它会计算下一个可能说出的每个词的概率。他们利用这些数字来推测信心。
- 问题所在: 这实际上是最差的方法。机器人的内部计算与现实完全不符。
- “双重检查”法(一致性): 他们用略微不同的设置向机器人问了五次同样的问题。如果机器人每次都给出相同的答案,他们就假设它很确定;如果它改变了主意,他们就假设它不确定。
- 结果: 这还可以,但并不完美。
2. 缺失的一环:“令人困惑的问题”因素
研究人员意识到,机器人的信心并非唯一重要的因素。有时,问题本身或学生的答案本身就 inherently 令人困惑,无论机器人有多聪明。
- 类比: 想象一个学生写道:“天空是蓝色的,因为海洋。”这是一个奇怪且模棱两可的句子。即使是人类老师也可能争论是否应该给分。这被称为偶然不确定性(源于数据本身的不确定性)。
- 解决方案: 研究人员创建了一个系统来衡量学生答案的“混乱”程度。他们将外观相似的答案归为一组。如果一组相似的答案在人类评分中混合了“正确”和“错误”的评级,该组就被标记为“高度令人困惑”。
3. “混合”超级信心
研究人员将机器人自身的信心信号与这种新的“令人困惑的问题”测量相结合。
- 隐喻: 把机器人想象成一位天气预报员。
- 机器人的内部信心就像预报员说:“我的计算机模型预测会下雨。”
- 数据集的不确定性就像望向窗外,发现:“但天空实际上晴朗无云。”
- 如果你只听计算机模型,你可能会在不需要的情况下带上雨伞。但如果你将模型与实际天空状况结合起来,你就能获得更准确的预报。
通过将机器人的“我认为我知道这个”与“这个问题实际上很棘手”的数据混合,他们创建了一个混合信心分数。
4. 结果如何?(实验结果)
研究人员将这种新的混合分数与旧方法进行了对比测试:
- 更好的筛选: 当他们使用混合分数过滤掉“可疑”的答案并将其转交给人类时,机器人对剩余答案的批改准确率大大提高。这就像一位更擅长识别假身份证的夜店保安。
- 更加诚实: 旧方法经常撒谎(它们声称有 90% 的把握,实际上只有 60%)。混合分数要诚实得多。如果它说 80%,那么它实际上就有 80% 的时间是正确的。
5. 为什么这很重要
该论文的结论是,你不能仅依赖机器人的内部感受来判断它是否正确。你还需要观察学生的答案有多混乱或模棱两可。
通过使用这种混合信心,学校可以安全地利用 AI 自动批改大多数答案,而只将真正令人困惑或高风险的答案发送给人类教师。这既为教师节省了时间,又确保了学生获得公平的评分,因为 AI 确切地知道何时该说:“这个我需要帮助。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。