← 最新论文
📊 statistics

Don't Throw Away Your Beams: Improving Consistency-based Uncertainties in LLMs via Beam Search

本文提出在大型语言模型中采用束搜索而非多项式采样来生成用于基于一致性的不确定性量化的候选项,证明该方法降低了方差,并在短格式问答任务上实现了最先进的性能。

原作者: Ekaterina Fadeeva, Maiya Goloburda, Aleksandr Rubashevskii, Roman Vashurin, Artem Shelmanov, Preslav Nakov, Mrinmaya Sachan, Maxim Panov

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Ekaterina Fadeeva, Maiya Goloburda, Aleksandr Rubashevskii, Roman Vashurin, Artem Shelmanov, Preslav Nakov, Mrinmaya Sachan, Maxim Panov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《不要扔掉你的光束》的通俗解释,采用简洁语言和创意类比。

核心问题:AI 回答的“回声室”效应

想象一下,你向一个大语言模型(LLM)提出一个简单问题,例如:“谁演唱了《Thriller》?”

为了评估 AI 对其回答的置信度,研究人员通常会让 AI 多次(比如 10 次)回答同一个问题,并观察回答之间的一致性程度。这被称为基于一致性的不确定性

  • 旧方法(多项式采样): 想象这就像掷一个灌了铅的骰子。如果 AI 有 90% 的把握认为答案是“迈克尔·杰克逊”,那么每次掷骰子,结果都会是“迈克尔·杰克逊”。你得到 10 个回答,其中 9 个或 10 个完全相同。
    • 缺陷: 因为 AI 不断给出完全相同的回答,你可能会想:“哇,它超级自信!”但实际上,AI 只是陷入了死循环。它没有探索其他可能性。如果正确答案其实是“王子”(一个错误的假设),AI 仍可能被困住,连续 10 次说“王子”,从而误导你,让你误以为它很自信,尽管它是错的。此外,获取 10 个完全相同的回答是对算力的浪费。

新方案:侦探式“束搜索”

作者提出了一种获取这 10 个回答的新方法。与其掷骰子,不如采用一种称为**束搜索(Beam Search)**的策略。

  • 类比: 想象你是一名侦探,正在城市中寻找嫌疑人。
    • 多项式采样相当于随机派 10 个人去随机询问街上的路人。如果大众主要说“迈克尔·杰克逊”,那么这 10 个人都会回来报告“迈克尔·杰克逊”。
    • 束搜索则是同时派遣 10 名侦探前往10 条最可能的街道。即使“迈克尔·杰克逊”是最流行的答案,束搜索也会迫使侦探们去检查第二、第三和第四条最可能的街道。
    • 结果: 你得到了一份包含 10 个不同回答的列表(例如:“迈克尔·杰克逊”、“杰克逊先生”、“王子”、“布鲁诺·马尔斯”)。

为何更好:“多样性”红利

论文指出,使用束搜索能带来两大主要优势:

  1. 杜绝重复: 你不再浪费时间获取 10 次相同的回答。你能获得 AI 想法的真正多样性。
  2. 诚实的置信度评分:
    • 如果 AI 给出了 10 个不同的回答(有些正确,有些错误),系统会意识到:“嘿,AI 并不确定!”并赋予较低的置信度评分。
    • 如果 AI 给出了 10 个非常相似的回答(即使只是同一想法的细微变体),系统会意识到:“好吧,AI 相当确定”,并赋予较高的置信度评分。

秘密武器:对回答进行加权

论文还引入了一项巧妙的技巧。束搜索找到 10 条不同路径,并不意味着它们具有同等的概率。

  • 类比: 想象 AI 是一名天气预报员。
    • 路径 A(光束 1):“会下雨”(90% 的概率)。
    • 路径 B(光束 10):“会下雨”(0.01% 的概率)。
    • 如果我们把这两条路径视为同等重要,就会扭曲数学计算。
    • 解决方案: 作者建议:“将路径 A 中‘会下雨’的回答计为 90 票,而将路径 B 中‘会下雨’的回答计为 0.01 票。”他们使用概率加权估计器。这确保了 AI 的置信度评分反映的是回答的真实概率,而不仅仅是它们是否不同。

证据:它有效吗?

研究人员在六个不同的问答数据集(如测验、科学常识和一般知识)上,使用三个不同的 AI 模型测试了这种方法。

  • 结果: “束搜索”方法系统地击败了旧的“掷骰子”方法。
  • 指标: 他们使用了一个名为**PRR(预测 - 拒绝比)**的评分。这就像是一个测试,用来判断:“如果我们根据置信度评分剔除 AI 最差的回答,剩余的回答是否会变得更好?”
  • 最终结果: 束搜索方法在识别错误回答并保留正确回答方面表现更佳。它取得了**最先进(State-of-the-Art)**的成果,这意味着它是目前针对简短事实性问题可用的最佳方法。

结论

论文指出:不要扔掉你的光束。

在 AI 领域,“光束”是指模型为寻找答案而探索的多种路径。作者表明,与其随机采样回答(这往往导致乏味的重复),我们应当利用束搜索的结构化路径。通过这样做,并仔细计算每条路径的概率,我们可以为 AI 获得更精确的“置信度计数器”。这有助于我们判断何时信任 AI,何时保持怀疑,特别是针对简短的事实性问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →