← 最新论文
💬 NLP

Detecting and Correcting Reference Hallucinations in Commercial LLMs and Deep Research Agents

该研究通过大规模评估发现商业大模型和深度研究代理存在显著的引用链接幻觉问题,并发布了开源工具"urlhealth",使模型能够通过自我修正将无效引用率降低至 1% 以下。

原作者: Delip Rao, Eric Wong, Chris Callison-Burch

发布于 2026-04-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Delip Rao, Eric Wong, Chris Callison-Burch

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一次对AI 科学家“做笔记”能力的突击检查

想象一下,你请了一位超级聪明的 AI 助手(比如现在的各种大模型或“深度研究”机器人)帮你写一份关于“宇宙起源”或“最新医疗突破”的研究报告。AI 写得很漂亮,还在每个观点后面都贴心地附上了参考文献链接(就像老师让你写论文要标注出处一样)。

大家通常认为:“既然 AI 给了链接,那肯定是有据可查的,对吧?”

但这篇论文告诉我们:大错特错。

作者们像侦探一样,检查了 10 种不同的 AI 模型和“深度研究”助手生成的5 万多个链接,结果发现了一个惊人的秘密:AI 经常“编造”链接,或者引用了那些早已死去的网页。

为了让你更直观地理解,我们可以用几个生活中的比喻来拆解这篇论文的核心发现:

1. 核心问题:AI 在“指鹿为马”还是“指旧为今”?

论文把坏掉的链接分成了两类,这就像是在检查一本假书:

  • 幻觉链接(Hallucinated URLs)—— 纯粹的“瞎编”

    • 比喻:就像你让 AI 去图书馆找一本书,它告诉你:“书在第三排,书名是《时间旅行指南》。”你跑过去一看,那里根本没有这本书,甚至图书馆里从来就没有过这本书
    • 真相:AI 为了显得自己博学,凭空捏造了一个网址。这个网址在人类互联网的历史上(通过 Wayback Machine 互联网档案馆检查)从未存在过
    • 数据:研究发现,3% 到 13% 的链接属于这种“无中生有”。
  • 陈旧链接(Stale URLs)—— “指旧为今”

    • 比喻:AI 说:“书在第三排。”你跑过去,发现那里确实曾经有一本书,但书被借走了,或者书架被拆了,现在只剩下一面空墙。
    • 真相:这个网址以前是存在的,但因为时间流逝(链接失效/Link Rot),现在打不开了。
    • 数据:大约 5% 到 18% 的链接属于这种情况。

总结:如果你看到 AI 给的链接打不开,它可能是“死胡同”(链接失效),也可能是“鬼打墙”(根本就没这地方)。

2. 谁最容易“撒谎”?深度研究 vs. 普通搜索

论文对比了两种类型的 AI:

  • 普通搜索型 AI:像是一个查字典的人,问一个问题,查一次资料,给一个答案。
  • 深度研究 Agent:像是一个疯狂的调查记者,为了写长篇大论,会进行多轮搜索、阅读、综合,最后生成几十页的报告。

发现

  • 深度研究 Agent 虽然产出更多,但“造假”更严重。
    • 比喻:那个“调查记者”为了写出宏大的报告,写得太快太急,为了填满脚注,开始批量编造不存在的网址。它生成的链接数量是普通 AI 的几十倍,但其中“瞎编”的比例也更高。
    • 数据:深度研究 Agent 的幻觉率高达 13.3%,而普通搜索型 AI 通常在 3% - 5% 左右。

3. 不同领域的“谎言”程度不同

AI 在不同学科的表现也不一样,这很有趣:

  • 神学(Theology):链接失效率最高(11.4%)。可能是因为神学内容比较古老或分散,网页容易消失。
  • 商业(Business):链接最靠谱(5.4%)。因为商业网站通常维护得很好,不容易“死掉”。
  • 医疗(Healthcare/Medicine):这是一个高危领域。虽然有些模型表现不错,但有些模型在医疗领域的链接失效率高达 17.4%
    • 比喻:这就好比医生给你开药方,结果药方上的药店地址是编的,或者药店早就倒闭了。这在医疗领域是非常危险的。

4. 数量多不代表质量好

很多用户觉得:"AI 给我 100 个链接,总该有几个是真的吧?”
论文打脸:完全不是。

  • 比喻:就像一个人给你 100 个电话号码,其中 90 个是空号,10 个是打不通的旧号。你得到的有效信息量并没有因为数量多而增加,反而因为噪音太大更难分辨。
  • 结论:AI 生成的链接越多,每一个链接出错的概率并没有降低,甚至可能因为为了凑数而增加了编造。

5. 解决方案:给 AI 配个“验真器”

既然 AI 会犯错,作者们没有止步于批评,而是开发了一个叫 urlhealth 的开源工具。

  • 比喻:这就好比给 AI 配了一个**“事实核查员”**。
    • 当 AI 写完报告,把链接列出来时,这个核查员会立刻去检查:“这个网址还在吗?如果不在,它以前存在过吗?”
    • 如果网址是编的(从未存在过),核查员会直接标记为“幻觉”。
    • 如果网址是旧的(曾经存在但死了),核查员会标记为“陈旧”。

效果惊人

  • 当 AI 被要求使用这个工具进行自我修正时,它的“坏链接”数量减少了 6 到 79 倍,最终只剩下不到 1% 的错误。
  • 但是,这取决于 AI 听不听话。有些聪明的模型(如 GPT-5.1, Claude)能很好地利用这个工具;而有些小模型虽然也会调用工具,但听不懂工具的话,依然坚持用坏链接。

总结:我们该怎么办?

这篇论文给所有使用 AI 写报告、做研究的人敲响了警钟:

  1. 不要盲目信任 AI 的脚注:AI 给的链接,尤其是那些看起来很高深、很具体的,很有可能是它“编”出来的,或者是过期的。
  2. 深度研究模式要更小心:虽然它们能写出长篇大论,但为了追求“看起来像那么回事”,它们更容易编造证据。
  3. 工具是救星:未来的 AI 应用必须内置这种“链接健康检查”功能。就像我们买东西要看保质期一样,用 AI 查资料前,先让工具检查一下链接的“保质期”。

一句话总结:AI 是个才华横溢但有点“爱吹牛”的作家,它写的故事很精彩,但如果你不拿着放大镜去核实它引用的“出处”,你可能会被它带进沟里。好在,现在有了“验真器”,我们可以让这位作家学会诚实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →