← 最新论文
💻 computer science

Beyond Document Grounding: Span-Level Hallucination Detection over Code, Tool Output, and Documents

本文介绍了一个针对代码和工具输出等多种结构化输入中跨跨度级幻觉检测的统一基准测试,证明了经过微调的 Qwen3.5-2B 模型在这些复杂领域显著优于现有的检测器和零样本评判器,同时在自然语言 RAG 基准测试中保持了竞争力。

原作者: Ádám Kovács, Bowei He, Xue Liu, István Boros, Szilveszter Tóth, Gábor Recski

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Ádám Kovács, Bowei He, Xue Liu, István Boros, Szilveszter Tóth, Gábor Recski

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一位非常聪明、语速极快的助手来为你撰写报告。你给了他们一叠参考书(即“上下文”)和一个特定的问题。他们迅速打出了答案。

问题在于?有时候,即使是最聪明的助手也会有些“天马行空”。他们可能会捏造一个事实、弄混一个数字,或者引用一个书中并不存在的页码。这被称为幻觉(Hallucination)

长期以来,研究人员一直在构建“事实检查器”来捕捉这些错误,但这些工具主要只能在助手编写关于历史或科学等普通话题并使用纯文本时发挥作用。

本文介绍了一种全新的、更强大的事实检查器,旨在应对现代世界的挑战——在现代世界中,助手不仅在写文字,还在编写计算机代码、总结软件工具日志以及阅读像表格和手册之类的结构化文档

以下是他们所做工作的拆解,使用了日常类比:

1. 问题所在:“代码”与“日志”的盲区

想象一下你的助手是一名机械师。

  • 旧有的事实检查器: 擅长检查机械师是否在车是蓝色时错误地说成了“车是红色的”。
  • 新的现实: 这名机械师现在正在编写一份复杂的维修手册(代码)或阅读数字诊断屏幕(工具输出)。如果机械师写错了一个指令,比如把 turn_on_engine(启动引擎)写成了 turn_off_engine(关闭引擎),整辆车可能会报废。或者如果他们列出了一个不存在的零件编号,订单就会失败。
  • 差距: 现有的事实检查器就像是在读小说的人;它们不知道如何识别计算机程序中的单行错误或软件日志中的特定错误。它们无法区分一个真实的专业术语和一个虚构的术语。

2. 解决方案:“找不同”游戏

作者构建了一个庞大的新训练场(基准测试),旨在教计算机如何成为这些专业的事实检查器。

  • 如何制作数据: 他们从完美的、正确的答案开始(就像一份完美的维修手册)。然后,他们使用了一个“幻觉注入器”(可以想象成一个调皮的编辑)来偷偷植入微小的、局部的谎言。
    • 示例: 他们将一个真实的函数名 set_device 改为了一个虚假的 set_active_device
    • 他们不仅仅是说“这个答案是错的”。他们还标记了发生谎言的具体字符位置
  • 多样性: 他们创建了超过 74,000 个示例,涵盖了:
    • 代码: 真实的 GitHub 软件修复程序。
    • 工具输出: 来自软件工具的日志(如错误信息或搜索结果)。
    • 结构化文档: 带有表格和列表的研究论文、README 文件和维基百科页面。
    • 普通文本: 标准的问题与回答(以确保他们不会忘记如何检查普通文本)。

3. 新的侦探:“LettuceDetect”

他们训练了一个新的 AI 模型(一个基于 Qwen 模型 20 亿参数版本的模型)来充当侦探。

  • 任务: 侦探观察“请求”、“参考书”和“助手的答案”。它必须指着那个特定的谎言说:“这个特定的词是编造的,”或者“这个数字是错误的。”
  • 结果:
    • 在代码和工具方面: 这个新侦探是一个超级英雄。它抓住了代码和工具日志中 60% 的谎言。
    • 竞争对手: 旧有的“现成”事实检查器(如 LettuceDetect-large)甚至连强大的智能 AI 裁判(Zero-shot LLMs)在代码方面的检出率仅为 17% 到 22% 左右。它们在技术错误面前基本上是“盲目”的。
    • 在普通文本方面: 这个新侦探在检查普通文本方面仍然表现出色(得分与现有最佳系统相似),证明了他们在学习阅读代码时并没有丢失通用的语言知识。

4. 为什么“粒度级(Span-Level)”很重要

论文强调,他们不仅仅是说“拒绝这个答案”。他们进行的是 粒度级检测(Span-Level Detection)

  • 类比: 想象一名学生写了一篇 10 页的论文。其中一句话是谎言。
    • 旧方法: “整篇论文不及格。”(这太严厉了,其他 9 页可能非常完美)。
    • 新方法: “高亮显示那句谎言所在的句子。”(精准且有帮助)。
  • 在代码中,这至关重要。如果一个程序有 100 行,其中只有一行是错的,你并不想丢弃整个程序;你只想修复那一行。

总结

本文提出了一种全新的、统一的“真相检测器”,能够处理现代 AI 助手所面临的复杂且具有技术性的现实情况。它超越了仅仅检查简单文本的范畴,能够识别代码软件日志结构化文档中细微且危险的错误。

他们的模型 LettuceDetect-Qwen-2B 在发现这些技术性谎言方面明显优于之前的工具,尤其是在助手编写代码或阅读软件日志时,同时在处理普通语言时仍保持着顶尖水平。他们已经发布了所有的相关数据和模型,以便他人可以使用这个“找不同”游戏来构建更可靠的 AI 系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →