Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents
本文介绍了一种新颖的评估框架,该框架利用抽象语法树(AST)解析器,从链接有效性、相关性和事实准确性三个维度评估大语言模型生成的研究报告,揭示了一个关键脱节现象:即便是前沿模型在保持高引用可访问性和相关性方面表现良好,却在事实一致性上存在困难,且随着检索深度的增加,这一问题愈发严重。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一支由超级聪明的研究助理(AI 模型)组成的团队,来撰写一份关于复杂主题的报告。你告诉他们:“去互联网上寻找真相,撰写一份报告,并确保列出你找到每一个事实的确切来源。”
你分享的这篇论文就像一位质量控制检查员,决定检查这些 AI 助理提交的作业。这位检查员没有只是阅读报告并点头附和,而是构建了一个特殊的机器人,来逐一核查 AI 写下的每一个脚注。
以下是他们发现的简要说明:
三步检查法
研究人员构建了一个系统,通过三种具体方式来核查 AI 的引用,就像三道安全检查:
- “门是否开着?”检查(链接有效):链接是否真的能打开?点击它,是带你进入一个网页,还是显示一个无效的 404 错误?
- “这是关于同一件事吗?”检查(内容相关):如果链接有效,该网页是否真的讨论了 AI 所声称的主题?(例如:AI 说“这个链接证明猫是狗”,但链接实际上是一份千层面食谱)。
- “这是真的吗?”检查(事实核查):这是最难的部分。该网页是否真的包含了 AI 所说的具体事实、数字或日期?
大惊喜:“闪亮包装”问题
最惊人的发现是,AI 助理在前两项检查中表现优异,但在第三项中却表现糟糕。
- 类比:想象一名学生写了一篇论文并附上了参考文献。
- 94% 的情况下,参考文献中的书籍确实存在于图书馆的书架上(链接有效)。
- 80% 的情况下,这些书籍确实与学生所写的主题相关(内容相关)。
- 但是,当你真正打开书籍并阅读学生所引用的具体页面时,只有约 40% 到 77% 的情况下,书中的内容才是学生所声称的那样。
结论:AI 非常擅长找到指向相关网站的有效链接,但它经常就“该网站说了什么”撒谎。这就像一位导游总是带你去正确的博物馆,却会告诉你关于馆内展品的错误故事。
“越多越少”悖论
研究人员还测试了,如果他们告诉 AI 搜索得更深入、查看更多网站,会发生什么。你可能会想:“如果我让 AI 阅读 150 个网站而不是仅仅 2 个,它的准确性会更高,对吧?”
错了。
- 类比:想象试图拼凑一幅拼图。如果你只有 2 块拼图,你可以轻松看到全貌。如果有人把 150 块拼图倒在你面前,你会感到不知所措。你可能会开始强行拼凑那些根本不匹配的碎片,只是为了完成拼图。
- 结果:随着 AI 被迫查看越来越多的来源(从 2 个增加到 150 个),它说真话的能力实际上下降了约 42%。链接仍然有效,主题仍然相关,但具体事实却变得一团糟。AI 陷入了“信息过载”,并开始编造细节。
谁表现得好?谁表现差?
- “前沿”模型(大型科技公司的 AI):这些模型(如来自 OpenAI、Anthropic 和 Google 的模型)非常擅长生成看起来完美的报告。它们几乎总能找到有效的链接和相关主题。然而,即使是最聪明的模型,其事实准确率也仅为 39% 到 77%。
- 开源模型:这些模型的表现甚至更差。许多模型甚至无法完成撰写带引用的报告的任务。当它们尝试时,在找到有效链接和确保事实准确方面要糟糕得多。
核心结论
该论文得出结论,我们不能仅仅因为 AI 报告底部有一串链接就信任其研究。一长串有效的链接会制造一种“虚假的信任感”。仅仅因为门是开着的,房间也是对的,并不意味着 AI 告诉你的关于房间内部的故事就是真实的。
研究人员构建了这个“检查机器人”,是为了帮助我们看清“看起来不错的引用”与“真正真实的引用”之间的差距。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。