← 最新论文
🤖 AI

Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling

本文介绍了 C3RL,这是一种能够同时提高大语言模型准确性与校准度的强化学习算法,并利用这些经过良好校准的置信度分数来驱动 CAS(一种自适应测试时扩展策略),该策略在显著降低推理成本的同时,性能还优于现有方法。

原作者: Xuqing Yang, Yi Yuan, Shanzhe Lei, Xuhong Wang

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuqing Yang, Yi Yuan, Shanzhe Lei, Xuhong Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个才华横溢但过度自信的学生正在参加一场非常困难的考试。这个学生是一个人工智能(AI),他擅长解决问题,但他有一个坏习惯:当他不确定答案时,他还是会硬着头皮猜,并且面不改色地宣称:“我 100% 确定!”在 AI 的世界里,这被称为“幻觉”。这就像这个学生自信满满地写下“法国的首都是伦敦”,结果却答错了。

你分享的论文介绍了一个两步走的系统,旨在纠正这个学生的行为,并让他们的学习时间变得更高效。

第一步:“诚实教练”(C3RL)

解决方案的第一部分是一种新的训练方法,称为 C3RL(正确性与置信度校准强化学习)。你可以把它想象成一位严厉但公正的教练,同时教给学生两件事:

  1. 把答案答对。(不要只是瞎猜。)
  2. 对自己的确定程度保持诚实。(如果你在瞎猜,请承认。)

通常,当我们训练 AI 时,我们只奖励他们答对答案的行为。这使得他们迫切地想要答对,因此会对自己的信心进行“撒谎”。C3RL 改变了规则。如果学生答对了且表示自己很有把握,你会给他们一颗“小金星”。如果他们答错了但承认自己不确定,你也会给他们一颗“小金星”。

然而,如果他们答错了却声称自己 100% 确定,你会给他们一个“大大的红叉”。如果他们答对了却声称自己完全没头绪,你同样会给他们一个“大大的红叉”。

结果是:AI 学会了在实际是在瞎猜时说“这个我不确定”,并在确实知道答案时说“我非常有信心”。它停止了这种“自信的谎言”。

第二步:“聪明预算管理者”(CAS)

一旦学生学会了诚实,系统的第二部分就会介入。这被称为 CAS(基于置信度的自适应测试时缩放)。

想象一下你就是那个正在批改考试的老师,但你的时间和精力是有限的。你不能在每个问题上都花费 10 个小时。

  • 旧方法(多数投票法): 你要求学生把每个问题回答 64 遍,然后取出现次数最多的答案。这种方法很准确,但极其浪费。这就像要求一个学生为了确保答案正确而把一道数学题做 64 遍。
  • 新方法(CAS): 你要求学生回答一次问题。
    • 如果学生说:“我有 90% 的把握是 A”,你就立即相信他们,写下答案,然后继续下一个。你节省了时间!
    • 如果学生说:“我只有 40% 的把握”,你就知道他们在挣扎。于是,你让他们再试一次,再试一次,直到他们有信心为止,或者直到你尝试了足够多次。

因为在第一步中,学生(AI)已经学会了对其置信度保持诚实,所以你可以信任他们的“我确定”信号。这使得你可以停止在简单问题上浪费时间,并将精力集中在那些真正困难的问题上。

最终结果

论文表明,这种组合效果显著:

  1. 更好的诚实度: AI 在不降低实际解题能力的前提下,变得更擅长识别自己何时不知道答案。
  2. 巨大的节省: 通过使用“聪明预算管理者”,该系统节省了大量的计算资源。在某些测试中,它使用的计算资源比旧方法少了 12 倍,同时获得了相同(甚至更好)的结果。

简而言之,这篇论文教会了 AI 停止在自己所知领域进行虚张声势,并利用这种诚实,通过仅在真正需要时才努力工作,从而节省了时间和金钱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →