← 最新论文
💬 NLP

Confidence Estimation in Automatic Short Answer Grading with LLMs

本文提出了一种用于自动简答题评分的混合置信度框架,该框架将基于模型的信号与源自数据集的偶然不确定性相结合,以生成更可靠的置信度估计,并提升选择性评分性能,其表现优于单一来源的方法。

原作者: Longwei Cong, Sonja Hahn, Sebastian Gombert, Leon Camus, Hendrik Drachsler, Ulf Kroehne

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Longwei Cong, Sonja Hahn, Sebastian Gombert, Leon Camus, Hendrik Drachsler, Ulf Kroehne

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个教室,机器人老师正在尝试批改学生写的简答题。这个机器人非常聪明(它是一个大型语言模型,或称 LLM),但并不完美。有时它会感到困惑,有时学生的答案本身就很模糊或难以理解。

核心问题在于:机器人如何知道它何时不确定? 如果机器人说“我有 90% 的把握这个答案是正确的”,但实际上却是错的,那就很危险。本文的目标就是教会机器人说出:“这个我不确定,应该由人类来检查。”

以下是研究人员解决这一问题的方法,用简单的方式解释如下:

1. 机器人“猜测”自身信心的三种方式

研究人员测试了三种不同的方法,让机器人向我们表明其信心程度:

  • “诚实”法(言语化): 他们直接问机器人:“在 0 到 1 的尺度上,你有多确定?”机器人只是编造了一个数字。
    • 问题所在: 机器人就像一个即使错了也依然自信的学生。它倾向于高估自己的能力。
  • “内部数学”法(潜在): 他们查看了机器人的内部计算。当机器人选择一个答案时,它会计算下一个可能说出的每个词的概率。他们利用这些数字来推测信心。
    • 问题所在: 这实际上是最差的方法。机器人的内部计算与现实完全不符。
  • “双重检查”法(一致性): 他们用略微不同的设置向机器人问了五次同样的问题。如果机器人每次都给出相同的答案,他们就假设它很确定;如果它改变了主意,他们就假设它不确定。
    • 结果: 这还可以,但并不完美。

2. 缺失的一环:“令人困惑的问题”因素

研究人员意识到,机器人的信心并非唯一重要的因素。有时,问题本身学生的答案本身就 inherently 令人困惑,无论机器人有多聪明。

  • 类比: 想象一个学生写道:“天空是蓝色的,因为海洋。”这是一个奇怪且模棱两可的句子。即使是人类老师也可能争论是否应该给分。这被称为偶然不确定性(源于数据本身的不确定性)。
  • 解决方案: 研究人员创建了一个系统来衡量学生答案的“混乱”程度。他们将外观相似的答案归为一组。如果一组相似的答案在人类评分中混合了“正确”和“错误”的评级,该组就被标记为“高度令人困惑”。

3. “混合”超级信心

研究人员将机器人自身的信心信号与这种新的“令人困惑的问题”测量相结合。

  • 隐喻: 把机器人想象成一位天气预报员
    • 机器人的内部信心就像预报员说:“我的计算机模型预测会下雨。”
    • 数据集的不确定性就像望向窗外,发现:“但天空实际上晴朗无云。”
    • 如果你只听计算机模型,你可能会在不需要的情况下带上雨伞。但如果你将模型与实际天空状况结合起来,你就能获得更准确的预报。

通过将机器人的“我认为我知道这个”与“这个问题实际上很棘手”的数据混合,他们创建了一个混合信心分数

4. 结果如何?(实验结果)

研究人员将这种新的混合分数与旧方法进行了对比测试:

  • 更好的筛选: 当他们使用混合分数过滤掉“可疑”的答案并将其转交给人类时,机器人对剩余答案的批改准确率大大提高。这就像一位更擅长识别假身份证的夜店保安。
  • 更加诚实: 旧方法经常撒谎(它们声称有 90% 的把握,实际上只有 60%)。混合分数要诚实得多。如果它说 80%,那么它实际上就有 80% 的时间是正确的。

5. 为什么这很重要

该论文的结论是,你不能仅依赖机器人的内部感受来判断它是否正确。你还需要观察学生的答案有多混乱或模棱两可。

通过使用这种混合信心,学校可以安全地利用 AI 自动批改大多数答案,而只将真正令人困惑或高风险的答案发送给人类教师。这既为教师节省了时间,又确保了学生获得公平的评分,因为 AI 确切地知道何时该说:“这个我需要帮助。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →