← 最新论文
💬 NLP

Evaluating LLM Uncertainty in Long-Form Generation Using Deterministic Ground Truth

本文介绍了 SALT,这是一个具有确定性标准答案的基准测试,用于评估长文本大语言模型生成,研究表明,虽然推理能力的提升提高了准确性,但会降低置信度排序,且误差传播是由损坏的前缀和不断增加的答案上下文长度共同驱动的。

原作者: Ido Amit, Ido Galil, Ran El-Yaniv

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Ido Amit, Ido Galil, Ran El-Yaniv

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在要求一个非常聪明但有时过于自信的机器人写一个长篇故事或解决一个复杂的谜题。有时,机器人能把故事的前半部分写得完美无缺,但到了中间就开始编造事实,或者把结尾写错。

问题的核心是:我们如何确切地知道机器人在哪里出了错,以及机器人对自己犯下的错误有多大的把握?

这篇论文介绍了一种测试机器人(大语言模型,简称 LLM)的新方法,称为 SALT。以下是他们所做的工作及其发现的简单拆解,使用了日常类比。

1. 问题所在:“模糊的照片”式错误

想象你要在一本 100 页的书里找一个错别字。

  • 旧方法: 你让一个人(或另一个 AI)读完整本书,然后说:“这本书有 80% 是好的。”这就像是在看一张整本书的模糊照片。你知道有错误,但你不知道哪些词是错的。
  • 问题在于: 如果机器人在数学题中仅仅算错了一个数字,旧方法可能会判定整个答案都是错的。但如果机器人对了 99 个数字,只错了一个,那其实表现已经很不错了!我们需要一种能够“放大”并逐一检查每一个单词(或“原子”)的方法。

2. 解决方案:SALT 基准测试

作者创建了一个名为 SALT(单答案原子级长文本目标)的新型测试场。

  • 类比: 把 SALT 想象成一个游戏关卡,其中的答案在数学上是保证正确的。
    • 他们不是要求机器人“写一首关于猫的诗”(这类任务有许多种正确答案),而是要求它“计算这些矩阵的乘积”或“翻译这段 DNA 代码”。
    • 在这些任务中,只有一个正确答案。计算机预先知道答案,因此不存在猜测或对“正确性”的争论。
    • 这使得研究人员能够以 100% 的确定性,逐个原子(逐词或逐数)地检查机器人的工作。

3. 他们的发现(“惊喜”)

通过这个精确、零误差的测试场,他们测试了 50 多种不同的机器人,并发现了一些令人惊讶的事实:

A. “滚雪球”效应(错误会蔓延)

  • 发现: 如果机器人在长回答的早期犯了一个错误,它在后面极有可能犯更多的错误。
  • 类比: 想象机器人正在搭建一座积木塔。如果它放下的第一块积木稍微歪了一点,整座塔就会变得摇摇欲坠。机器人并不仅仅是“忘记”了这个错误;它是在那个错误的根基之上构建未来的答案,从而导致错误的滚雪球效应
  • 关键洞察: 回答的质量取决于开头的质量。

B. “自信陷阱”(推理 vs. 排序)

  • 发现: 当机器人被告知要“一步步思考”(一种被称为“思维链”的技术)或经过专门的推理训练时,它们的准确率提高了,但意识到自己出错的能力却变差了
  • 类比: 想象一个努力学习并取得好成绩的学生(准确率上升)。然而,他们对自己的逻辑变得过于自信,以至于不再检查自己的作业。他们可能会说:“我 100% 确定这个答案是对的,”即便那是错的。
  • 权衡: 让机器人变得更“聪明”于推理,似乎会让它们在感知自身不确定性方面变得更“笨”。它们变得更有说服力,但在发出错误信号方面却变得不再可靠。

C. “缩放层级”问题

  • 发现: 机器人能够判断整个段落是对还是错,但在判断段落中的单个词是对还是错时,表现得很糟糕。
  • 类比: 机器人可能可以说:“整个句子听起来很正确”,但如果你问:“这个句子里的第 5 个词正确吗?”机器人的信心度量衡基本上是失效的。当观察如此微小的细节时,它无法区分一个词是正确的还是错误的。

4. 为什么这很重要

该论文认为,对于高风险工作(如医疗建议或编程),我们不能只看“大局”。我们需要知道答案的具体哪一部分是不稳固的。

  • 目前的机器人: 它们生成长篇复杂文本的能力正在提高,但它们表达“我对这个特定部分不确定”的能力却在下降,尤其是在它们试图进行深度“思考”时。
  • 未来: 我们需要构建不仅能给出正确答案,而且能精确知道自己在哪里可能出错(甚至精确到最小细节)的机器人。

简而言之: 这篇论文构建了一个完美的、无误差的测试,用以观察机器人如何处理长篇回答。他们发现,虽然机器人变得越来越聪明,但它们也变得越来越过度自信,并且难以察觉自己细微的错误,尤其是在那些错误发生在长逻辑链条的早期阶段时。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →