CALIBER: Calibrating Confidence Before and After Reasoning in Language Models
本文介绍了 CALIBER,这是一种通过区分推理前和推理后的置信度状态,并针对每种状态使用与其特定信息上下文相匹配的目标进行监督,从而改进推理语言模型校准的方法,该方法显著降低了各种基准测试和模型规模下的校准误差。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在参加一场非常困难的数学考试。在两个时刻,你可能会想问自己:“我有多少把握能答对?”
- 在开始思考之前: 你看着题目,猜测道:“嗯,这看起来很难。我可能会做对,也可能做不对。”
- 在解题之后: 你已经写下了答案并检查了你的过程。现在你问自己:“好吧,看着我刚刚写的这个具体答案,它真的正确吗?”
论文 CALIBER 指出,大多数当前的 AI 模型犯了一个错误:它们将这两个时刻视为同一件事。它们试图给出一个单一的“置信度分数”来同时完成这两项工作。作者说,这就像是要求气象预报员使用同一个数字来既预测“今天会下雨吗?”(在看天空之前),又预测“今天下午是否下过雨?”(在暴风雨过后)。这会造成混乱并导致错误的判断。
问题所在:混淆了“之前”与“之后”
把 AI 模型想象成一个正在侦破谜案的侦探。
- “之前”的置信度: 这是侦探观察犯罪现场后说:“基于现场的混乱程度,我有 60% 的把握能破解此案。”这是关于谜题的难度。
- “之后”的置信度: 这是侦探看着自己的最终结论和收集到的证据后说:“基于我发现的这些具体线索,我有 95% 的把握我的结论是正确的。”这是关于特定答案的质量。
现有的方法通常强迫 AI 只给出一个数字。如果 AI 说“我有 80% 的把握”,那是因为谜题很简单,还是因为 AI 找到了极好的线索?论文认为你无法得知,这也是为什么 AI 的置信度经常是“失准的”(即它在错误时表现得很有信心,或者在正确时表现得不确定)。
解决方案:CALIBER(推理前后的校准)
作者创建了一个名为 CALIBER 的新系统。与其要求 AI 给出一个猜测,不如在不同时间要求它给出两个猜测:
- “思考前”的猜测: 在 AI 开始其“思考”过程之前,它先给出一个置信度分数。这个分数被训练用来预测:“解决这类问题成功的概率是多少?”
- “思考后”的猜测: 在 AI 完成思考并写出答案后,它给出第二个置信度分数。这个分数被训练用来预测:“我刚刚写的这个特定答案真的正确吗?”
秘诀所在: 论文发现,这两个猜测需要以不同的方式进行“教导”。
- **“思考前”**的猜测是通过观察一组尝试来教导的。如果 AI 在类似问题上每 10 次中有 7 次答对,那么在开始之前,它应该学会说“70%”。
- **“思考后”*的猜测是通过观察特定的答案来教导的。如果 AI 答对了这个特定*的答案,它应该学会说“100% 确定”;如果答错了,它应该说“0% 确定”。
通过将这两个任务分开,并用正确的“作业”(数据)来教导它们,AI 变得更擅长了解自己的知识边界。
测试结果如何?
研究人员在数学题和常识问题(如百科知识)上测试了它。他们将 CALIBER 与其他仅要求单一置信度分数的方法进行了对比。
- 结果: CALIBER 在保持诚实方面表现得更好。
- 当 CALIBER 说它有“90% 的把握”时,它实际上在 90% 的情况下是正确的。
- 其他方法经常说自己有“90% 的把握”,但实际正确率只有 60%(过度自信),或者在实际正确率达 90% 时却说只有“50% 的把握”(置信不足)。
- “分布外”测试: 他们还在 AI 从未见过的题目上测试了它(例如从数学谜题切换到百科知识)。即使在这些全新的、棘手的任务中,CALIBER 也比其他方法更能诚实地反映其置信度。
“差距”是有用的
论文中提到的一件很酷的事情是这两个数字之间的差距。
- 如果 AI 最初的置信度较低(例如:“我不确定能否解决这个问题”),但最后置信度很高(例如:“但现在我已经解出来了,我很确定!”),那么这个差距说明思考过程确实起到了作用。
- 如果 AI 最初置信度很高,但最后变低了,这意味着思考过程揭示了一个错误。
总结
简单来说,CALIBER 通过意识到“猜测问题是否可解”和“猜测特定答案是否正确”是两种不同的技能,从而修复了 AI 的置信度问题。通过将这两件事分开并分别正确地教导 AI,AI 变成了一个更加可靠的伙伴,它知道何时可以信任自己,以及何时需要保持谨慎。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。