← 最新论文
💻 computer science

Can Large Language Models Detect Contradicted Biomedical Evidence? A Dual-Annotator Benchmark Audit

本研究表明,当前的大型语言模型和检索增强生成系统在检测生成的生物医学答案与检索到的证据之间的矛盾方面存在显著失败,经常将其误分类为证据不足,从而凸显了此类自动化验证器尚未准备好用于临床自主筛查。

原作者: xinzheng Chen

发布于 2026-07-06
📖 1 分钟阅读☕ 轻松阅读

原作者: xinzheng Chen

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位医学期刊的严厉编辑。你有一支由 AI 作家(大语言模型)组成的团队,正试图回答复杂的医学问题。为了确保他们的回答值得信赖,你会先给他们一叠医学研究论文(证据)来阅读。这被称为检索增强生成(RAG)

核心问题是:如果一名 AI 作家给出的答案实际上与其刚刚阅读的研究论文相矛盾,那么第二个 AI“检查员”能发现这个谎言吗?

以下是研究人员发现的详细内容,使用了简单的类比。

1. 设定:“事实检查员”实验

研究人员设置了一个包含 150 个医学问题的测试。对于每个问题,他们都有:

  • 问题: 一个医学查询。
  • 证据: 一段医学摘要。
  • 答案: 由 AI 生成的一个答案。
  • 真相: 由人类专家将该答案标记为支持(论文支持该说法)、不足(论文表述模糊)或矛盾(论文表达了相反的意思!)。

随后,他们要求各种 AI“检查员”(包括 GPT-5.5、DeepSeek 等顶尖模型以及专门的分类器)查看证据和答案,并询问:“它们匹配吗?”

2. 主要发现:“盲点”

结果令人惊讶,甚至有些令人担忧。AI 检查员非常不擅长发现矛盾。

  • 类比: 想象一名保安,其职责是抓住试图将违禁品带入建筑的人。在这项测试中,有 23 个人试图携带违禁品进入。最优秀的保安(顶尖 AI 模型)只抓住了 5 个,其他的都直接溜进去了。
  • 错误之处: 当 AI 检查员错过一个矛盾时,它们通常不会说“这是错的”,而是说“这不足”(意味着:“我无法判断它是对还是错,所以我采取稳妥的做法”)。它们将一个明显的谎言仅仅视为一个“模糊”的陈述。
  • 规模: 即便是最聪明的模型,也只能检测到大约 17% 到 22% 的实际矛盾。其余的都被漏掉了。

3. “人类”因素:人类会更擅长吗?

研究人员还让第二位人类编辑检查了工作。

  • 盲测: 当人类编辑在不知道哪些问题带有陷阱的情况下查看随机的一批问题时,他们错过了个矛盾。他们和 AI 一样“盲目”。
  • 针对性测试: 然而,当人类编辑被告知:“嘿,专门看这 23 个问题;我知道其中包含谎言”时,他们发现了 13 个中的 23 个
  • 教训: 检测矛盾不仅仅关乎聪明程度,更关乎你如何观察。如果你不是在专门搜寻谎言,你往往会错过它们。人类和 AI 都存在一种“保守偏见”——他们宁愿说“我不知道”,也不愿冒险说“那是谎言”。

4. “知识图谱”实验

研究人员还尝试了一种高级技巧。他们构建了一个“知识图谱”(一个连接医学术语的巨大地图,类似于地铁图),以帮助 AI 找到最佳的研究论文进行阅读。他们希望这能让答案更加准确。

  • 结果: 这并没奏效。使用这种高级地图并没有让答案比使用标准搜索方法更好。这就像是给司机一个 GPS,但它和司机自己的方向感一样好,并没有更优。

5. 底线结论

  • 目前的 AI 检查员尚未准备好投入实战。 如果你在医院环境中依赖这些 AI 系统来自动捕捉医学谎言,它们会漏掉大部分。
  • 它们擅长寻找“支持”,但不擅长寻找“谎言”。 它们很擅长说“是的,这篇论文支持那个答案”,但非常不擅长说“不,这篇论文实际表达的是相反的意思”。
  • “不足”陷阱: 最大的问题是,AI 会将“矛盾”与“信息不足”混淆。对 AI 来说,说“我不确定”比冒着说“那是错的”的风险要安全得多,但在医学背景下,错过一个矛盾是危险的。

简而言之: 该论文的结论是,虽然这些 AI 工具在组织信息方面很有用,但它们尚未可靠到足以充当捕捉医学矛盾的自主警察。它们需要人类的监督来捕捉目前仍在漏掉的错误。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →