← 最新论文
💬 NLP

How Uncertainty Estimation Scales with Sampling in Reasoning Models

该研究通过跨三个推理模型和 17 项任务的实验发现,虽然自洽性和语言化置信度在推理模型中均随采样规模提升,但两者结合形成的混合估计器仅需少量采样即可显著超越单一信号,且这种互补效应在数学领域表现最为突出。

原作者: Maksym Del, Markus Kängsepp, Marharyta Domnich, Ardi Tampuu, Lisa Yankovskaya, Meelis Kull, Mark Fishel

发布于 2026-03-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Maksym Del, Markus Kängsepp, Marharyta Domnich, Ardi Tampuu, Lisa Yankovskaya, Meelis Kull, Mark Fishel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个非常实际的问题:当我们让 AI 像人类一样“深思熟虑”(进行长链条推理)时,我们该如何判断它对自己答案的把握有多大?

想象一下,你正在和一个超级聪明的顾问(AI 模型)讨论一个难题。

  • 普通 AI:像是一个反应很快但有时草率的助手,你问它,它马上回答,并告诉你“我有 80% 的把握”。
  • 推理型 AI(RLM):像是一个喜欢写满整张草稿纸、反复推演、自我纠错的专家。它会花很长时间在脑子里“想”很多步,最后才给出答案。

这篇论文就是研究:在这个“深思熟虑”的过程中,我们怎么知道这位专家是真的懂了,还是在瞎猜?

核心比喻:三个“测谎仪”

为了判断 AI 是否靠谱,研究人员测试了三种方法(信号),就像给 AI 装上了三个不同的“测谎仪”:

  1. 口头自信(Verbalized Confidence, VC)

    • 比喻:直接问 AI:“你觉得自己答对了吗?打个分(0-100)。”
    • 发现:这招很管用!哪怕只让它想一次,它自己报出来的分数通常就能很好地反映它是否真的懂。就像那个专家虽然没写草稿纸,但他心里清楚自己有没有底。
  2. 自我一致性(Self-Consistency, SC)

    • 比喻:让 AI 把同一个问题重复做 10 遍(每次稍微有点随机性),然后看这 10 次答案有多少次是一样的。如果 10 次里有 9 次都选 A,那它大概率是对的;如果答案五花八门,那它就在瞎蒙。
    • 发现:在普通 AI 里这招很灵,但在“深思熟虑”的 AI 里,这招起步很慢。因为让 AI 想一遍就要花很多时间(算力成本),让它想 10 遍太贵了。而且,即使让它多想了几次,它的表现提升也不如直接问它“你有多自信”来得快。
  3. 混合双打(Hybrid Estimator)

    • 比喻:这是论文的最大亮点。不要只问它一次,也不要让它做十次。
    • 做法:让 AI 做两次(只多花一点点成本),然后结合“它自己报的分数”和“这两次答案是否一致”来综合判断。
    • 效果神技! 仅仅多做一次(总共两次),这种“混合判断法”的效果就远远超过了单独让 AI 做 8 次或者只问它一次。
    • 通俗解释:就像你问专家:“你觉得自己几分?”(口头自信),然后你让他再快速想一遍,看看两次想法是否冲突(一致性)。只要结合这两点,哪怕只花双倍的时间,你得到的“靠谱程度”评估,比让他独自苦思冥想 8 次还要准!

关键发现:领域不同,效果不同

论文还发现了一个有趣的现象,就像不同学科对“深思熟虑”的依赖程度不同:

  • 数学领域(Math):这是 AI 的“主场”。在这里,AI 的推理能力最强,上述的“混合双打”策略效果最好,提升最明显。就像让一个数学天才做数学题,他稍微多想一下,再结合他的自信度,你几乎能 100% 确定他是对的。
  • 科学(STEM)和人文学科(Humanities):在这些领域,AI 的表现提升得比较慢,而且很快就“触顶”了(再让它多想几次也没多大用)。这可能是因为这些领域的问题更模糊,或者 AI 在这些领域的训练不如数学领域充分。

总结:给开发者的“省钱秘籍”

这篇论文给那些想在实际中应用 AI 的人(比如开发医疗诊断、法律咨询系统)提供了一个简单、省钱且高效的建议

  1. 别只问一次:只问一次虽然快,但不够稳。
  2. 别盲目重复:让 AI 重复做 10 次太贵了,而且收益递减,不划算。
  3. 最佳策略是“做两次,结合看”
    • 让 AI 生成两个答案。
    • 看看这两个答案是否一样(一致性)。
    • 问问 AI 自己觉得这两个答案有多大的把握(口头自信)。
    • 把这两个信息加起来,你就能得到最准确的不确定性评估。

一句话总结
在让 AI“深思熟虑”时,“问它两次,再结合它自己的感觉”,是性价比最高、最聪明的判断它是否靠谱的方法,尤其是在处理数学难题时,这一招简直完美。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →