Retrieval, not hallucinations, will be the limiting factor for LLM-based clinical AI tools
本文认为,对于基于大语言模型的临床人工智能工具而言,其主要局限性不在于幻觉,而在于无法准确检索必要的患者层面数据,并敦促将重点转向提高召回率和检索评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图破解一个谜团,但你的助手不是侦探,而是一个超级聪明的机器人。这个机器人读过几乎所有被写下的书籍,并且能像人类一样交谈。在医学领域,这些机器人被称为大语言模型(LLMs)。它们正被教导通过阅读病历来帮助医生,总结病情并建议治疗方案。但问题在于:机器人无法一次性读取整个医院的数据库,因为那实在太庞大了。所以,在回答问题之前,它必须派出“搜寻队”去寻找患者病史中相关的特定页面。这个过程被称为检索(Retrieval)。
把这个机器人想象成一位才华横溢的大厨,而患者的病史就是一间巨大且混乱的储藏室。大厨(AI)非常擅长烹饪,但如果搜寻队(检索系统)忘了带回鸡蛋,无论大厨多么有才华,也做不出煎蛋卷。长期以来,人们一直担心大厨可能会凭空捏造不存在的食材——比如声称自己用了“独角兽蛋”,而实际上并没有。这被称为幻觉(Hallucination)。但本文指出,虽然凭空捏造很糟糕,但真正的、无声的危险是,由于搜寻队没能找到正确的食材,导致大厨漏掉了关键信息。如果机器人因为搜寻队没能在巨大的储藏室里找到那张便条,而没能告诉医生患者对青霉素过敏,其后果可能比一个荒诞的编造事实要严重得多。
论文的核心观点:储藏室里的隐形杀手
本文认为,医疗 AI 最大的瓶颈并不是机器人在编造谎言(幻)——而是机器人最初未能找到正确信息(召回错误)。作者们是一群来自大学和诊所的专家,他们希望将讨论的重心从“AI 是否在撒谎?”转向“AI 是否遗漏了关键信息?”
两种类型的错误
为了阐明观点,作者将 AI 的错误与两种经典的错误类型进行了对比:
- “虚假警报”(精确度错误/Precision Error): 这是指 AI 说某件事是真的,但实际上是错的。在医学界,这就是著名的幻觉。例如,AI 可能会说:“患者患有一种罕见的热带疾病”,但实际上患者并没有这种病。这很可怕,但通常很容易识别。如果 AI 说了一些离谱的话,医生可以通过查看原始记录并说:“等等,记录里根本没有这一条。” 这就像大厨声称使用了某种秘密香料,但储藏室里其实并没有;你只需要检查一下储藏室,就能发现它缺失了。
- “沉默的遗漏”(召回错误/Recall Error): 这是指 AI 漏掉了记录中确实存在的某些重要信息。也许患者有过敏反应,或者昨天有一个关键的化验结果,但 AI 却完全没有提及。这就是“隐形杀手”。为什么?因为如果 AI 什么都不说,医生可能会认为该信息并不存在。这就像大厨忘了提到鸡蛋缺席了,导致医生以为煎蛋卷没问题,结果后来才发现患者对隐藏的成分产生了反应。
论文指出,虽然我们有很好的方法来捕捉“虚假警报”(通过检查原始记录),但对于“沉默的遗漏”,我们几乎没有任何手段来捕捉。如果搜寻队没能找到特定的便条,AI 就永远看不见它,医生也就永远不会知道它被遗漏了。这是一个无声的失败。
为什么搜寻队是薄弱环节
作者解释说,虽然“大厨”(LLM)每天都在变得更聪明、更快速,但“搜寻队”(检索系统)的进步速度却远不及后者。
- 大厨的成长: AI 模型正在迅速进化,在理解语言和语境方面变得越来越好。
- 搜寻队的停滞: 用于在数百万条医疗笔记中进行搜索的工具仍然依赖于较旧、较慢的方法。尽管我们使用了各种高科技来辅助它们,但它们寻找文档的核心方式并没有发生太大变化。
论文指出,由于搜索工具相对滞后,它们正在成为薄弱环节。随着患者记录变得越来越长、越来越复杂(得益于连接不同医院的技术进步),搜寻队的工作也变得更加艰巨。如果他们在海量文件中漏掉了一个关键便条,整个 AI 系统就会失效,而且在事态恶化之前,没人会察觉到这一点。
评估陷阱
论文中最有趣的环节之一是测试这些系统有多难。
- 测试大厨: 测试大厨是否捏造了食材相对容易。你可以让他们写一份食谱,然后检查食材是否存在。
- 测试搜寻队: 测试搜寻队是否漏掉了东西是非常困难的。要判断他们是否漏掉了某条笔记,你必须亲自阅读患者病史中的每一条笔记,以确认那里原本有什么。由于患者记录可能长达数千页,没有人有时间为每一次 AI 测试都这样做。
作者指出,目前的测试方法往往只检查 AI 是否找到了一些好的信息,而不是是否找到了所有好的信息。这意味着我们可能认为一个 AI 运行完美,而实际上它正遗漏着关键细节。
作者的立场(以及未言之意)
论文非常谨慎,并未表示幻觉问题已得到解决或我们应该停止担忧幻觉。他们承认幻觉是一个“令人不安的问题”。然而,他们认为我们目前过于痴迷于幻觉,却忽略了那个更大、更难察觉的问题——信息的遗漏。
他们并不声称已经有了完美的解决方案。事实上,他们表示目前还没有解决召回错误的完美方法。要 100% 确定 AI 没有遗漏任何信息,唯一的办法是让人类阅读整份病历,但这违背了使用 AI 来节省时间的初衷。论文建议,我们需要新的测试方法,或许是将人工检查与智能自动化工具相结合,以确保我们不会让“沉默的遗漏”溜走。
总结
核心结论是一个警告:不要仅仅防范 AI 对你撒谎;还要防范 AI 忘记告诉你真相。
随着医疗 AI 变得越来越普遍,作者认为最大的障碍将不再是让机器人变得更聪明,而是确保机器人的搜寻队足够彻底,能够找到拼图中的每一块。如果我们不解决检索问题,即使是世界上最先进的 AI,也可能错过救命的关键细节,而我们甚至可能永远不知道这件事发生过。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。