← 最新论文
💬 NLP

Healthier LLMs: Retrieval-Augmented Generation for Public Health Question Answering

本文将 PubHealthBench 基准测试扩展到了检索增强设置中,证明了混合检索和精细的上下文选择通过使较小的模型能够超越较大的模型,显著提高了公共卫生问答的准确性和可靠性,同时引入了一个用于评估自由形式回答的经过验证的 LLM-as-a-judge 框架。

原作者: Felix Feldman, Joshua Harris, Timothy Laurence, Leo Loman, Ollie Higgins, Fan Grayson, Poonam Soma, Bethany Pace-Bonello, Michael Borowitz, Toby Nonnenmacher

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Felix Feldman, Joshua Harris, Timothy Laurence, Leo Loman, Ollie Higgins, Fan Grayson, Poonam Soma, Bethany Pace-Bonello, Michael Borowitz, Toby Nonnenmacher

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位才华横溢但有点健忘的图书管理员,名叫“LLM”。这位图书管理员读过数百万本书,几乎可以回答任何问题。然而,有两个大问题:

  1. “幻觉”问题: 当管理员不知道答案时,他们有时会自信地胡编乱造。
  2. “过时”问题: 管理员的记忆是时间静止的。如果今天出台了一项新的健康规定,在经过数年重新训练之前,管理员都不会知道。

这篇论文是关于给这位管理员一个神奇的索引卡系统(称为检索增强生成,或 RAG),这样他们就可以在回答问题前查阅到确切的最新规则。作者使用大量的英国政府公共卫生指南测试了这个系统。

以下是他们的研究结果,使用了简单的类比:

1. 搜索策略:如何找到正确的一页

研究人员测试了管理员寻找图书馆正确页面的不同方法。

  • “关键词”搜索(稀疏搜索): 就像通过搜索特定单词(例如“流感”、“口罩”)来找书。这很有效,但如果你使用的词汇不同,有时会错过重点。
  • “语义”搜索(稠密搜索): 就像向管理员说:“我需要关于如何保护自己免受病毒侵害的信息,”而他们能理解这些词背后的含义。这通常效果更好。
  • “混合”搜索: 这是获胜者。这就像拥有一个超级聪明的管理员,他们同时检查特定关键词和您问题的含义。
    • 结果: 将这两种方法结合起来,比只使用其中一种方法能更有效地找到正确信息。这种混合搜索非常有效,以至于一个使用这种混合搜索的较小、较便宜的管理员(较小的 AI 模型),其表现甚至超过了一个没有查阅资料、只能靠猜测的庞大且昂贵的管理员(巨大的 AI 模型)。

2. “块”的大小:每一页应该有多大?

图书馆的书被切成了较小的碎片(块),以便于搜索。研究人员发现,大小很重要

  • 太小: 你可能会丢失上下文。
  • 太大: 如果一个块是一整章的内容,那就好比在干草堆里找一根针。管理员会被过多的额外文本搞糊涂。
  • 黄金分割点: 他们发现中等大小的块效果最好。有趣的是,他们尝试将长块总结成短笔记以辅助搜索。虽然这有一点帮助,但并不能完全解决问题。最好的方法是保持块的大小适中,并使用“混合”搜索方法。

3. 多选题测试 vs. 真正的对话

研究人员用两种方式测试了管理员:

  • 多选题 (MCQA): 就像一场测验,管理员从选项 A、B、C 或 D 中选择一个。
    • 结果: 当管理员可以先查阅资料再回答时,即使是较小的、廉价的模型也能获得接近完美的得分(约 99%)。他们击败了那些不允许查阅任何资料的巨型模型。
  • 自由回答: 就像一场真正的对话,管理员必须写出完整的段落。
    • 结果: 这更难了。虽然管理员可以找到正确的信息,但他们有时会变得“话多”。他们会加入一些并非严格必要的建议,或者混入来自书本其他部分的细节。
    • “忠实度”问题: 最大的问题不在于找到了错误的信息,而在于管理员添加了太多信息。如果正确答案在第 50 页,但管理员同时也读了第 1 到 49 页,他们可能会不小心把第 10 页并不适用的建议也混进来。正确答案在列表中的位置越靠后,管理员就越容易变得“困惑”,并加入额外的、可能具有误导性的细节。

4. “裁判”问题:谁来给答案评分?

为了观察管理员做得好不好,研究人员使用了一个“裁判”(另一个 AI)来给答案评分。他们还让专家进行人工评分,以检查 AI 裁判是否公正。

  • 裁判做得好的地方: AI 裁判非常擅长识别管理员是否紧扣主题(忠实度)以及是否涵盖了所有要点(完整性)。
  • 裁判挣扎的地方: AI 裁判不太擅长识别管理员是否表达清晰(清晰度)以及事实是否完全准确(事实一致性)。甚至人类专家在这些点上也存在分歧。
  • 教训: 你可以信任 AI 裁判告诉你管理员是否紧扣主题,但你不能完全信任它来告诉你答案是否完美清晰或在事实层面无懈可击。

核心结论

论文得出结论,对于公共卫生问题,你如何搜索信息比 AI 模型有多大更重要。

  • 小模型 + 聪明搜索 > 大模型 + 无搜索: 一个拥有优秀“混合”搜索系统的轻量级、经济型 AI 模型,比一个仅依靠记忆的庞大、昂贵 AI 模型更安全、更准确。
  • 保持专注: 为了获得最佳结果,你需要喂给 AI 恰到好处的信息量(不要太少,也不要太多),并确保最相关的信息位于列表的最顶端。
  • 安全第一: 通过将 AI 建立在官方、最新的政府文件中,我们可以防止它编造内容或提供过时的建议,这对于公共卫生至关重要。

简而言之:不要仅仅让管理员变得更聪明;给他们一个更好、更有组织的索引卡系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →