Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling
本文介绍了 C3RL,这是一种能够同时提高大语言模型准确性与校准度的强化学习算法,并利用这些经过良好校准的置信度分数来驱动 CAS(一种自适应测试时扩展策略),该策略在显著降低推理成本的同时,性能还优于现有方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个才华横溢但过度自信的学生正在参加一场非常困难的考试。这个学生是一个人工智能(AI),他擅长解决问题,但他有一个坏习惯:当他不确定答案时,他还是会硬着头皮猜,并且面不改色地宣称:“我 100% 确定!”在 AI 的世界里,这被称为“幻觉”。这就像这个学生自信满满地写下“法国的首都是伦敦”,结果却答错了。
你分享的论文介绍了一个两步走的系统,旨在纠正这个学生的行为,并让他们的学习时间变得更高效。
第一步:“诚实教练”(C3RL)
解决方案的第一部分是一种新的训练方法,称为 C3RL(正确性与置信度校准强化学习)。你可以把它想象成一位严厉但公正的教练,同时教给学生两件事:
- 把答案答对。(不要只是瞎猜。)
- 对自己的确定程度保持诚实。(如果你在瞎猜,请承认。)
通常,当我们训练 AI 时,我们只奖励他们答对答案的行为。这使得他们迫切地想要答对,因此会对自己的信心进行“撒谎”。C3RL 改变了规则。如果学生答对了且表示自己很有把握,你会给他们一颗“小金星”。如果他们答错了但承认自己不确定,你也会给他们一颗“小金星”。
然而,如果他们答错了却声称自己 100% 确定,你会给他们一个“大大的红叉”。如果他们答对了却声称自己完全没头绪,你同样会给他们一个“大大的红叉”。
结果是:AI 学会了在实际是在瞎猜时说“这个我不确定”,并在确实知道答案时说“我非常有信心”。它停止了这种“自信的谎言”。
第二步:“聪明预算管理者”(CAS)
一旦学生学会了诚实,系统的第二部分就会介入。这被称为 CAS(基于置信度的自适应测试时缩放)。
想象一下你就是那个正在批改考试的老师,但你的时间和精力是有限的。你不能在每个问题上都花费 10 个小时。
- 旧方法(多数投票法): 你要求学生把每个问题回答 64 遍,然后取出现次数最多的答案。这种方法很准确,但极其浪费。这就像要求一个学生为了确保答案正确而把一道数学题做 64 遍。
- 新方法(CAS): 你要求学生回答一次问题。
- 如果学生说:“我有 90% 的把握是 A”,你就立即相信他们,写下答案,然后继续下一个。你节省了时间!
- 如果学生说:“我只有 40% 的把握”,你就知道他们在挣扎。于是,你让他们再试一次,再试一次,直到他们有信心为止,或者直到你尝试了足够多次。
因为在第一步中,学生(AI)已经学会了对其置信度保持诚实,所以你可以信任他们的“我确定”信号。这使得你可以停止在简单问题上浪费时间,并将精力集中在那些真正困难的问题上。
最终结果
论文表明,这种组合效果显著:
- 更好的诚实度: AI 在不降低实际解题能力的前提下,变得更擅长识别自己何时不知道答案。
- 巨大的节省: 通过使用“聪明预算管理者”,该系统节省了大量的计算资源。在某些测试中,它使用的计算资源比旧方法少了 12 倍,同时获得了相同(甚至更好)的结果。
简而言之,这篇论文教会了 AI 停止在自己所知领域进行虚张声势,并利用这种诚实,通过仅在真正需要时才努力工作,从而节省了时间和金钱。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。