When Cases Get Rare: A Retrieval Benchmark for Off-Guideline Clinical Question Answering
本文介绍了 OGCaReBench,这是一个专注于检索的基准测试,旨在评估大型语言模型在处理罕见且偏离指南的临床问题方面的表现,结果表明,尽管记忆性知识不足,但通过检索医学证据来增强模型,可显著提升其提供可靠、基于证据的答案的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名医生。大多数时候,你治疗的是流感或骨折等常见病症。对于这些情况,你有一本“规则手册”(临床指南),明确告诉你该怎么做。这就像按照食谱制作经典巧克力蛋糕:你知道步骤,通常结果都很完美。
但当一名患者带着一种前所未见的罕见、怪异病症走进诊室时会发生什么?规则手册里没有这一页。这就像试图用舒芙蕾的食谱来烤蛋糕,但所有食材都不对劲。在现实世界中,当医生面对这些“偏离指南”的病例时,他们不会凭空猜测。他们会去图书馆(或数字数据库)查找其他医生处理类似怪异病例的案例,看看什么方法奏效。
问题所在:“聪明”却不愿阅读的医生
本文作者构建了一项测试,以评估当前人工智能“医生”(大型语言模型)在处理这些罕见、打破规则手册的病例时的表现。
他们发现了一个大问题:最先进的人工智能模型就像那些背熟了整本教科书却从未真正见过病人的学生。当被问及常见疾病时,它们能轻松通过测试,因为它们只是复述记忆内容。但当被问及罕见、怪异的病例时,它们开始胡编乱造或给出泛泛的建议。它们依赖自身的“记忆”(参数),而不是查阅所需的具体事实。
该论文将这一基准测试命名为OGCAREBENCH。可以将其视为人工智能医生的“期末考试”,但它不是多项选择题(例如“答案是 A、B 还是 C?”),而是开放式问题,例如:“这里有一位怪异的患者,你接下来确切应该采取什么步骤?”这些问题基于真实发表的罕见医学病例故事,并经过真实人类医生的核查以确保准确性。
测试结果:记忆与研究
当人工智能模型在没有辅助的情况下参加这项考试时,表现不佳。即使是最好的模型,正确答案率也仅为 56% 左右。专门的“医疗”人工智能模型表现更差(约 42%)。这证明,仅仅死记硬背医学事实不足以应对现实世界。
解决方案:赋予人工智能搜索引擎
随后,研究人员尝试了一种不同的方法。他们为人工智能模型配备了一个“搜索引擎”(检索增强生成,RAG)。人工智能不再仅仅依赖记忆,而是被允许查阅包含 53,000 个真实医学病例故事的图书馆,以找到与当前患者怪异情况相匹配的案例。
结果令人瞩目:
- 配备搜索引擎后:最佳人工智能模型的正确率从 56% 跃升至82%。
- 启示:关键在于人工智能头脑中记住了多少知识,而在于它在需要时能否从外部世界有效查找并利用正确的信息。
人工智能仍会犯错之处
即使配备了搜索引擎,人工智能也并非完美无缺。论文发现,即使人工智能面前有正确的文档,它仍会在以下具体方面失败:
- “过度热心”的错误:人工智能找到了正确答案,但随后添加了故事中不存在额外步骤,试图表现得过于 helpful。
- “翻译失真”的错误:人工智能找到了正确的文档,但遗漏了一个微小却至关重要的细节(例如患者特有的某种状况),从而给出了略有偏差的答案。
- “步骤错误”的错误:人工智能看到了故事中的一系列步骤,却选择了第二步,而非紧接着的下一步。
核心结论
本文主张,若要构建能够真正帮助医生处理罕见、疑难病例的人工智能,我们不能仅仅训练它们死记硬背教科书。我们必须构建这样的系统:迫使它们在每次面对新的棘手情况时,都要通过搜索现实世界的证据来“完成作业”。它们创建的基准测试(OGCAREBENCH)是一项工具,用于在我们将真实患者托付给人工智能之前,衡量其完成这项“作业”的能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。