← 最新论文
💬 NLP

SpanUQ: Span-Level Uncertainty Quantification for Large Language Model Generation

本文介绍了 SPANUQ,这是一个轻量级框架,它通过采用 DETR 式解码器来同时检测语义连贯的文本跨度并利用 Beta 混合分布对其不确定性进行量化,从而解决了 Token 级和序列级不确定性估计的局限性,并在多种大语言模型中实现了卓越的误差定位能力和效率。

原作者: Yimeng Zhang, Yingying Zhuang, Ziyi Wang, Yuxuan Lu, Pei Chen, Aman Gupta, Zhe Su, Ming Tan, Zhilin Zhang, Qun Liu, Manikandarajan Ramanathan, Rajashekar Maragoud, Edward Vul, Jing Huang, Dakuo Wang

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Yimeng Zhang, Yingying Zhuang, Ziyi Wang, Yuxuan Lu, Pei Chen, Aman Gupta, Zhe Su, Ming Tan, Zhilin Zhang, Qun Liu, Manikandarajan Ramanathan, Rajashekar Maragoud, Edward Vul, Jing Huang, Dakuo Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你向一个非常聪明但偶尔会产生幻觉的 AI 提问,比如“玛丽·居里是谁?”AI 给出了一个长篇且听起来很自信的回答。但在那个回答的某个地方,它犯了一个错误(例如,说她在 1901 年获得了诺贝尔奖,而不是 1903 年)。

目前 AI 安全工具的问题在于,它们很难精准地找到错误究竟在哪里。这篇论文介绍了一种名为 SPANUQ 的新工具,它就像是一个针对 AI 回答的高科技“事实检查荧光笔”。

以下是它的工作原理以及它有何不同之处的简单拆解:

1. 问题:要么太模糊,要么太嘈杂

把检查 AI 的回答想象成给学生的作文评分。

  • 旧方法(词元级/Token-Level): 想象一位老师在句子的每一个单词下面都画上红线。他们给“的”、“是”、“一个”这样的词也打分。这太嘈杂了,因为它无法告诉你哪个具体的“观点”出了问题。
  • 另一种旧方法(序列级/Sequence-Level): 想象一位老师看完全篇作文后,只给出一个总分,比如“C”。这能告诉你作文有问题,但它没法告诉你到底是哪一段或哪一句话出了问题。如果你不知道错在哪里,你就无法修复它。

2. 解决方案:“荧光笔”法(跨度级/Span-Level)

作者们意识到,意义的自然单位既不是单个词,也不是整个段落,而是**“跨度”(Span)**。

  • 跨度(Span) 是指承载一个完整观点的文本块(例如“波兰物理学家”或“在 1901 年获得了诺贝尔奖”)。
  • SPANUQ 旨在寻找这些特定的文本块,并为每一个块赋予自己的“置信度分数”。
  • 结果: 它不再是对整篇作文给出一个单一的分数,而是会高亮显示“波兰物理学家”(绿色/有信心)、“获得了诺贝尔奖”(绿色/有信心)以及“1901”(红色/极度不确定)。这能明确告诉你该去哪里查看。

3. 工作原理:“轻量级侦探”

通常,为了寻找错误,你必须对同一个问题询问 AI 20 次,并对比所有答案以观察它们在哪里产生分歧。这既慢又贵(就像为了破一个案子而雇佣 20 名侦探一样)。

SPANUQ 则不同:

  • 侦探: 它是一个微小的、轻量级的插件(只有大约 2500 万个参数,相对于它所辅助的庞大 AI 模型来说非常小)。
  • 窍门: 它在 AI 思考时观察 AI 的“脑电波”(隐藏状态)。它已经被训练出能够识别出表示不确定性的微妙模式,有效地将那些缓慢的 20 次检查所获得的知识“蒸馏”到一次瞬间的扫视中。
  • 速度: 它比旧方法快 10 到 20 倍,因为它只需要运行一次 AI 模型。

4. “培训学校”(SPANUQ-BENCH)

为了教导这位侦探,作者建立了一个庞大的培训学校,名为 SPANUQ-BENCH

  • 他们生成了 20,000 个问题和答案。
  • 他们使用了一种“金标准”方法(询问 AI 20 次并对照维基百科)来创建“答案解析”,这些解析能准确告诉他们哪些文本部分是错误的,以及错得有多严重。
  • 他们在 293,000 个这样的特定文本块上训练了这个侦探。

5. 结果:为什么它能胜出

当他们将 SPANUQ 与其他方法进行测试时:

  • 准确性: 它在识别精确错误块方面表现出色(达到了约 0.94/1.0 的得分)。
  • 定位能力: 它发现错误的能力比最好的“启发式”(基于经验法则)方法高出 39%。
  • 通用性: 它在不同规模的 AI 模型(从小型模型到大型模型)上都能很好地工作。

核心总结

论文声称,SPANUQ 是第一个能够瞬间观察 AI 回答、将其分解为有意义的观点,并告诉你哪些观点不稳固以及有多不稳固的工具。它无需多次运行 AI 模型,因此其速度足以用于需要实时信任 AI 输出的应用场景。

重要提示: 作者警告说,虽然这个工具在识别“不确定性”方面非常出色,但它并不保证 AI 说的是事实。它只是在告诉你:“嘿,这个特定的部分看起来有风险,所以你应该复核一下。”它是一个帮助人类的工具,而不是人类判断力的替代品。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →