← 最新论文
💬 NLP

Generalization of Fine-Tuned Uncertainty Communication and Metacognition in Large Language Models

本文表明,监督式微调可以提高大语言模型表达不确定性的能力,并使置信度与准确性保持一致,尽管这些元认知能力的提升在不同领域间的泛化效果优于在不同置信度评估格式间的泛化效果,而多任务训练则提供了最稳健的泛化能力。

原作者: Mark Steyvers, Catarina Belem, Padhraic Smyth

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Mark Steyvers, Catarina Belem, Padhraic Smyth

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、博学多才的机器人朋友,它可以回答你提出的几乎任何问题。问题在于,这个机器人有时会出错,但它从不承认。无论是在谈论法国的首都在还是在谈论关于外星人的虚构事实时,它都用同样响亮、自信的声音进行回答。这是很危险的,因为如果你信任它那自信的声音,你可能会做出错误的决策。

这篇论文在问:我们能否教会这个机器人说出“我不确定”或“我挺有把握的”,并且让这种表达方式与它的正确率真正相匹配?

研究人员尝试“训练”这个机器人(具体来说是两个流行的 AI 模型),让它变得更具自我意识。以下是他们的发现,通过简单易懂的方式进行了解释:

1. 测试“自我意识”的两种方式

为了观察机器人是否在学习,研究人员使用了两种不同的游戏:

  • “信心评分”游戏: 机器人回答一个问题,并给出一个 0 到 100% 的数字来表示它有多确定。
    • 目标: 如果机器人说“90% 确定”,那么它应该在 90% 的情况下是正确的。
  • “选哪一个?”游戏: 给机器人展示两个问题。它必须挑选出它认为自己能够正确回答的那一个。
    • 目标: 它应该挑选它知道答案的问题,并跳过那个它在瞎猜的问题。

2. 训练方法:“熟能生巧”

研究人员不仅仅是告诉机器人“要更诚实”。相反,他们给了它大量的练习题。

  • 他们把同一个问题问了机器人 10 遍。
  • 如果机器人在 10 次中给出了 9 次相同的答案,他们就会教它:“你的表现很一致,所以你应该非常有信心。”
  • 如果机器人在 10 次中给出了 10 个不同的答案,他们就会教它:“你很困惑,所以你应该信心不足。”
  • 然后,他们要求机器人根据这种模式来预测自己的信心水平。

3. 好消息:它学会了诚实(大部分情况下)

经过这种训练后,机器人在将信心与实际准确率匹配方面做得更好。

  • 训练前: 机器人就像一个过度自信的学生,每次考试都拿“A”,但实际上只掌握了一半的知识。即使在错误的情况下,它也会说“95% 确定”。
  • 训练后: 机器人变得更像是一个谨慎的专家。当它知道答案时,它会说“90% 确定”;当它在瞎猜时,它会说“40% 确定”。
  • 神奇之处: 这种技能不仅停留在它练习过的学科上(如数学或常识)。它还帮助机器人在面对新的、困难的主题时(如医疗建议法律问题),也能表现得更加诚实。这意义重大,因为这意味着即使机器人没有针对这些特定案例进行专门训练,它在严肃场合下也更值得信赖。

4. Bad News:技能并不总是可以迁移

这里变得棘手了。研究人员发现,擅长一种游戏并不意味着会自动擅长另一种游戏。

  • “评分” vs. “选择”: 如果他们训练机器人给出一个数字(例如“75%”),它会非常擅长给出数字。但当要求它玩**“选哪一个?”**游戏时,它并没有变得更好。
  • 反之亦然: 如果他们训练它玩**“选哪一个?”游戏,它会擅长挑选正确的问题,但在被要求给出具体的数字**时,它仍然做不好。

类比: 想象一名篮球运动员,他非常擅长罚球(给出数字)。你专门针对罚球对他进行训练,他在罚球方面变得极其出色。但如果你让他去打防守(挑选正确的对手进行防守),他并不会因此变得更好。这些技能是相关的,但它们属于不同的肌肉。

5. 解决方案:“全能型”训练

研究人员尝试了最后一件事:他们同时对机器人进行两种游戏的训练。

  • 结果: 这效果好得多。机器人学会了一种“通用的自我意识”,这有助于它在数字游戏和选择游戏中都能表现出色。它变成了一个在各方面都更加灵活、可靠的思考者。

核心结论

  • 我们可以教会 AI 知道自己在瞎猜吗? 可以。
  • 它在新的主题上有效吗? 有效。它能帮助 AI 在处理医疗和法律问题时更加诚实,即使它主要是在常识和数学方面接受的训练。
  • 它是完美的吗? 不完美。教 AI 给出一个信心评分,并不一定会教会它如何比较两个问题,反之亦然。
  • 解决方法: 要获得最好的结果,你必须同时对 AI 进行多种类型的“自我检查”任务的训练。

简而言之,这篇论文表明,AI 可以学会更好地判断自己的知识水平,但它需要多样化的训练“食谱”才能有效地做到这一点。这不仅仅是记忆事实,而是学习如何以人类可以真正信任的方式说出:“我知道这个”,或者“我不确定”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →