← 最新论文
💬 NLP

GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models

本文提出了 GrACE,一种通过微调使大语言模型利用特殊 Token 嵌入与隐藏状态相似度来实时生成可靠置信度的生成式方法,该方法在无需额外采样或辅助模型的情况下实现了卓越的校准性能,并支持基于置信度的测试时扩展策略以提升决策准确率并降低采样成本。

原作者: Zhaohan Zhang, Ziquan Liu, Ioannis Patras

发布于 2026-04-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhaohan Zhang, Ziquan Liu, Ioannis Patras

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 GrACE 的新方法,旨在让大型语言模型(LLM,比如现在的各种 AI 聊天机器人)变得更“诚实”、更“靠谱”。

为了让你轻松理解,我们可以把 AI 想象成一个才华横溢但有点自负的学生,而 GrACE 就是他的**“自我反思教练”**。

1. 核心问题:AI 太爱“装”了

现在的 AI 很聪明,能回答各种问题。但在医疗、金融等高风险领域,我们不仅想知道答案,更想知道**“你有多确定这个答案是对的?”**

  • 现状的尴尬:
    • 方法一(事后诸葛亮): 让 AI 先回答问题,然后再专门花时间去评估“我刚才答得对不对”。这就像考完试后,老师还要专门花半天时间给每个学生打分,太慢了,而且需要额外的老师(辅助模型),太贵了
    • 方法二(口头表达): 让 AI 自己说“我很确定”或“我不太确定”。但这就像让那个学生用“大概”、“可能”、“绝对”这些词来描述分数。这些词太模糊了,而且 AI 往往过度自信,明明不会还嘴硬说“我确定”。

2. GrACE 的解决方案:给 AI 装个“诚实传感器”

GrACE 的核心思想是:让 AI 在回答问题的同时,直接“感觉”到它的自信程度,而不是靠嘴说。

  • 创意比喻:特殊的“诚实令牌” ()
    想象一下,我们在 AI 的词汇表里增加了一个特殊的、只有它懂的**“诚实令牌”**(就像试卷末尾的一个特殊符号 <CNF>)。
    • 以前,AI 回答完问题就结束了。
    • 现在,GrACE 训练 AI 在回答完问题后,必须生成这个特殊符号。
    • 关键点: 这个符号生成的概率,直接代表了 AI 的自信程度。
      • 如果 AI 心里很有底,它生成这个符号的概率就很高(比如 95%)。
      • 如果 AI 心里没底,它生成这个符号的概率就很低(比如 10%)。
    • 这就像给 AI 装了一个内置的测谎仪。它不需要说话,它的“潜意识”(隐藏状态)直接通过生成这个符号的概率告诉了我们真相。

3. 如何训练?(让 AI 学会“自知之明”)

怎么让这个 AI 真的学会诚实呢?

  • 分组训练法: 研究人员把 AI 做过的题目按“它觉得自己有多对”分成几组。
    • 如果一组题目里,AI 实际上对了 80%,那就告诉它:“当你觉得自己在这一组水平时,你的真实准确率应该是 80%。”
    • 通过这种**“校准”**,AI 学会了把“内心的感觉”和“实际的准确率”对应起来。
  • 结果: 经过训练,AI 不再瞎吹牛。它知道什么时候该自信,什么时候该谨慎。

4. GrACE 带来的两大好处

好处一:瞬间知道答案靠不靠谱(实时性)

  • 比喻: 就像开车时,以前的系统要等你开完全程,再派个无人机飞回来检查路况;现在 GrACE 就像仪表盘上的实时警示灯
  • 效果: AI 在生成答案的同一瞬间,就能告诉你这个答案的可信度。不需要额外的步骤,速度极快,成本极低。

好处二:聪明地“省钱”(测试时扩展)

在解决难题时,我们通常会让 AI 多试几次(采样),然后选个最好的。

  • 以前的做法: 不管题目难易,都让 AI 试 10 次,浪费算力。
  • GrACE 的做法:
    • 如果 AI 试了第一次,自信度就高达 99%,系统立刻说:“停!不用试了,这个答案很稳,直接通过!”(省下了 9 次尝试)。
    • 如果 AI 试了几次,自信度还是很低,系统就会说:“继续试,多试几次,直到找到高自信的答案。”
  • 比喻: 这就像**“智能点菜”。如果你点了一道你非常熟悉的菜(高自信),厨师直接做给你吃;如果你点了一道复杂的菜(低自信),厨师会多试几种做法直到满意。这样既省时间**,又保证质量

总结

GrACE 就像给 AI 装上了一套**“实时诚实反馈系统”**。

  1. 不靠嘴说,靠“感觉”: 用特殊的符号概率来量化自信,避免了语言描述的模糊和 AI 的过度自信。
  2. 又快又准: 不需要额外的计算步骤,回答的同时就知道答案靠不靠谱。
  3. 省钱省力: 能自动判断什么时候该停止尝试,大大减少了计算资源的浪费。

这项技术让 AI 在医疗、法律等需要高度可靠的领域变得更加安全、可信且高效

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →