When Retrieval Helps and Distracts: Evaluating Evidence-Generating LLMs for Biomedical Claim Verification
本文评估了在 CARE-XAI 基准测试上用于生物医学声明验证的各种大语言模型配置,发现虽然微调模型在生成证据方面表现出色,但检索增强的效果因来源而异,并引入了 Bio-GRACE 作为一种新的诊断工具,旨在比简单的召回率指标更好地衡量检索效用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名正在试图破解健康声明谜题的侦探,比如“喝咖啡是否能预防心脏病?”在人工智能的世界里,有两种主要的方法可以帮助计算机解决这个问题。第一种方法是让计算机直接猜答案:“是”、“否”或“不知道”。第二种更难的方法是要求计算机不仅要猜出答案,还要写出一份报告来解释为什么,并使用医学书籍中的真实事实。这被称为“证据生成”(evidence generation)。
问题在于,计算机可能会表现得非常自信,但却完全错误,尤其是在它们编造那些听起来流畅且具有科学感、但实际上并不真实的事实时。为了解决这个问题,研究人员通常会给计算机一个“搜索引擎”(称为检索增强生成,或 RAG),让它在撰写报告之前,先在巨大的医学研究图书馆中查找答案。核心问题在于:给计算机一个搜索引擎是否真的能帮助它写出更好的、更真实的报告,还是说这会让计算机处理的信息过多,导致它分心并犯错?这篇论文深入探讨了这个问题,旨在观察我们是否可以构建出像可靠医疗事实核查员一样的 AI。
大图书馆劫案:何时搜索有益,何时掩盖真相
这项研究中的研究人员通过一个名为 CARE-XAI 的新型统一基准测试搭建了一个大规模测试。你可以把它想象成一个巨大的、混合在一起的拼图盒,里面装有 17,803 个不同的健康声明。其中一些声明是关于严格的科学研究(例如“这种特定药物能否降低小鼠的血压?”),而另一些则是关于更广泛的公共卫生新闻甚至互联网传闻(例如“那个关于新饮食法的病毒式视频是真的吗?”)。目标是观察不同类型的 AI 如何处理这些声明,特别是侧重于它们是否能产生一个结论(支持、反驳或未提及)以及一段忠实的证据来支持该结论。
他们测试了五个不同的“侦探”团队:
- 基础 LLM(Base LLMs): 聪明、通用的 AI,尝试根据自身的记忆来猜测答案。
- PubMed RAG LLM: 同一个 AI,但配备了一个只在 PubMed(一个庞大的科学医学摘要数据库)中进行搜索的搜索引擎。
- 微调后的 LLM(Fine-tuned LLMs): 经过专门训练(就像为了特定考试而苦读的学生)的 AI,学习如何精确地格式化其答案,使用的是 CARE-XAI 数据集。
- 仅标签 LLM(Label-only LLMs): 只猜测结论而不编写任何证据的团队。
- 生物医学分类器(Biomedical Classifiers): 专门设计的较小型 AI 模型,旨在仅仅挑选正确的标签,而不是编写故事。
判决:谁赢得了比赛?
结果有点像剧情反转。当涉及到仅仅猜测结论(说“是”或“否”)时,专门的生物医学分类器是明显的赢家。它们在挑选正确标签方面最为准确。然而,它们无法编写报告,因此不是完整的实事核查员。
在那些确实编写报告的团队(即证据生成系统)中,微调后的 LLM 是冠军。它们的表现优于基础模型和搜索引擎模型。研究人员发现,仅仅通过特定风格和规则对 AI 进行训练,就比单纯给它一个搜索引擎要可靠得多。
“搜索引擎”之谜:是有益还是有害?
这里是故事变得有趣的地方。研究人员原本预期给 AI 一个搜索引擎(PubMed RAG)总会有所帮助。但他们发现,这其实是好坏参半的。
- 当它起作用时: 对于那些已经以科学摘要形式呈现的声明(例如来自 PubMedQA 和 SciFact 的声明),搜索引擎就像是一个超能力。它帮助 AI 找到了正确的实事,并提高了准确性。
- 当它造成干扰时: 对于更广泛的公共卫生声明或误导性信息(例如来自 PUBHEALTH 和 HealthFC 的声明),搜索引擎往往会让情况变得更糟。AI 会找到一篇听起来相关但实际上并不能回答特定问题的科学文章。这就像侦探在寻找关于“心脏病”的书籍,而问题实际上是关于“交通事故”的。AI 被额外的词汇分散了注意力,从而导致了错误的答案。
为了衡量这一点,团队发明了一个新工具叫做 Bio-GRACE。想象一下你有一个你已知是完美的“金标准”答案库。Bio-GRACE 衡量的是当 AI 使用搜索引擎时,它能恢复多少比例的那个完美答案。他们发现,对于公共卫生声明,搜索引擎经常会降低 AI 获取正确答案的能力,将它从真相拉向错误而非引向真相。
“来源不匹配”问题
论文解释说,问题不在于 PubMed 是一个糟糕的图书馆,而在于这个图书馆没有适合每种谜题的正确书籍。
- 如果声明是关于一项科学研究,PubMed 就是完美的图书馆。
- 如果声明是关于公共卫生政策、新闻或传闻,PubMed 可能并没有答案。在这种情况下,AI 需要查看新闻报道或政府指南。当 AI 被迫只能查看 PubMed 时,它会试图把方榫头塞进圆卯头里,从而创造出“听起来很有道理”但却是错误的信息。
启示:不要总是搜索
这项研究的主要教训是,微调(教会 AI 游戏规则)是目前获得优秀的证据生成型 AI 最可靠的方法。始终依赖搜索引擎是有风险的。
研究人员建议,未来的系统应该更聪明地决定何时进行搜索。与其为每一个问题都使用搜索引擎,不如让 AI 表现得像一名经验丰富的侦探:如果声明看起来像是一项科学研究,那就打开医学图书馆;如果它看起来像是一个新闻传闻,也许应该跳过医学图书馆,或者直接承认:“我没有足够的证据。”
最后,这篇论文表明,虽然 AI 可以变得更好,但我们不能只是把一个搜索引擎扔给问题并寄希望于好运。我们需要谨慎对待 AI 在哪里寻找,因为有时,最权威的来源反而会成为干扰它的因素。研究结论指出,对于生物医学事实核查而言,证据生成是一项高风险的任务,因为一个没有证据的正确标签是没用的,而一个带有华丽、虚假证据的错误标签则是危险的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。