← 最新论文
💬 NLP

Beyond Self-Knowledge: Propagating Uncertainty Across Reasoning and Retrieval in LLMs

本文介绍了 BeyondUncertainty,这是一种利用语言模型口语化置信度来有选择性地将查询路由至检索的检索增强生成方法,与始终检索或从不检索的基准方案相比,该方法在提高准确性的同时减少了 Token 使用量,尽管其引入了来自初始置信度探测的适度开销。

原作者: Chandan Kumar Sah, Xiaoli Lian, Li Zhang

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Chandan Kumar Sah, Xiaoli Lian, Li Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一个超级聪明的机器人图书管理员,读遍了宇宙中几乎所有的书。你可以瞬间回答问题,因为你已经把它们全部记住了。但有时,世界会发生变化,或者你可能遗忘了一个微小的细节,或者你只是需要核实一个关于特定人物或地点的事实。如果你猜错了,你可能会表现得很自信,但实际上却完全错误。这就是“检索增强生成”(Retrieval-Augmented Generation,简称 RAG)发挥作用的地方。把 RAG 想象成一条规则,它说:“如果你不是 100% 确定,在回答之前先去图书馆查一下。”

然而,这里有一个陷阱。跑去图书馆需要时间和精力。如果你为每一个问题(即使是那些你已经知道的简单问题)都跑去图书馆,你会浪费大量的时间和燃料。另一方面,如果你从不去图书馆,你可能会在难题上给出错误的答案。科学家们正在尝试解决的大问题是:机器人如何知道自己确切地在什么时候需要停下来查阅资料,而不是在简单的任务上浪费能量?这篇论文探讨了机器人是否可以仅仅通过“说出”它对一个答案的自信程度,并利用这种感觉来决定是否去图书馆查阅资料。


“置信度检查”实验

在这项研究中,来自北航大学的研究员 Chandan Kumar Sah、Xiaoli Lian 和 Li Zhang 试图构建一个更聪明的图书管理员,他们称之为 BeyondUncertainty 系统。他们想看看一个“黑盒”AI(即你只能看到其答案,而看不到其内部齿轮运作方式的模型)是否可以使用其口头表达的置信度来决定何时获取额外信息。

以下是他们的实验步骤:

  1. 探测(The Probe): 首先,他们向 AI 提问,并要求它给出一个快速的、结构化的答案,同时附带一个“置信度分数”(一个 0 到 1 之间的数字,表示它有多确定)。他们并没有要求 AI 展示解题过程或进行思考,只是要求它给出一个快速的猜测和置信度评分。
  2. 决策(The Decision): 他们为每个 AI 模型设置了一个“阈值”(一个特定的置信度界限)。
    • 如果 AI 说:“我超级自信(高于界限)”,系统就直接接受该答案。无需前往图书馆!
    • 如果 AI 说:“我不太确定(低于界限)”,系统就会将问题发送到搜索引擎(使用一种称为 TF-IDF 的方法)以找到前 5 个相关的段落。然后,AI 阅读这些段落并给出最终的、更好的答案。
  3. 测试(The Test): 他们在六个不同的百科知识数据集上的 27,000 个不同问题上进行了这项测试,并使用了三种流行的 AI 模型。

他们的发现:好的、坏的以及昂贵的代价

结果既有成功之处,也存在令人惊讶的权衡。

好消息:更聪明的搜索
该系统在判断哪些问题需要帮助方面表现得非常出色。当 AI 感到不确定时,它通常是对的,即它确实需要查阅资料。

  • 更好的答案: “置信度路由”(Confidence Routing)系统实现了平均 0.483 的得分(一种衡量答案质量的指标,称为 F1)。这比不查阅任何资料直接猜测(0.401)要好,甚至略好于“总是查阅每一个问题”(0.467)的方法。
  • 节省图书馆之旅: 由于该系统跳过了简单问题的图书馆查询,它检索到的文本段落比“总是查阅”的方法减少了 20.4%。它变得更加具有选择性。
  • 击败随机猜测: 即使他们强迫该系统查阅与随机程序程序完全相同数量的问题,置信度系统在 18 种情况中的 17 种里都获得了更好的答案。这证明了 AI 对不确定性的“感觉”在挑选研究问题时确实是有用的。

坏消息:“探测”的成本
这里有一个转折。虽然系统在搜索方面节省了时间(减少了图书馆之旅),但它实际上使用了更多的总计算能力。

  • 为了获得那个置信度分数,AI 必须首先运行一个额外的“探测”步骤。这个额外的步骤增加了总计 28.2% 的“Token”(AI 处理文本的基本单位)消耗。
  • 因此,虽然该系统是检索节省型的(它没有获取那么多文档),但它并不是Token 节省型的(它使用了更多的总计算能量)。这就像雇佣一名侦探来检查你在旅行前是否需要地图;侦探让你免于买错地图,但你仍然需要支付侦探的费用。

“不太确定”的现实
研究人员还发现,AI 的置信度并不完美。

  • 校准偏差: AI 给出的置信度数字在数学上并不是完美的概率。如果一个 AI 说“90% 确定”,它并不意味着它实际上有 90% 的概率是正确的。
  • 模型差异: 该系统的表现高度取决于所使用的 AI 模型。其中一个模型(OpenAI)过于自信,以至于它几乎总是想要查阅资料,这使得“智能路由”变得没那么有用。另一个模型(Gemini)则要精简得多。
  • 并非万能药: 改进并不算巨大或完美。在某些特定情况下,“总是查阅”的方法实际上比智能路由更好。该系统是一种平均水平的提升,而非通用的解决方案。

总结

这篇论文表明,询问 AI“你有多确定?”是决定何时进行额外研究的一种聪明方法。它有助于 AI 避免在已知信息上浪费时间,并能带来略微更好的答案。然而,询问这个问题本身的成本很高。该系统节省了获取过多文档的时间,但询问置信度这一额外步骤使得整个过程在总计算能力方面变得更加昂贵。

这是一个迈向更智能、更高效 AI 助手的有前景的一步,但也表明了“天下没有免费的午餐”:你可以对查阅的内容进行更具选择性的操作,但你可能仍需为做出这个决定而付出代价。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →