Inhibitory Attention for Clinical Long-Context Reasoning: Characterizing and Mitigating Lost-in-the-Middle Effects in EHR Processing
本文识别并表征了大语言模型在处理长电子健康记录时存在的“临床迷失中间”(clinical lost-in-the-middle)问题,并证明了一种轻量级的查询条件选择门(QCCS)通过优先考虑上下文相关性而非仅仅是召回率,显著优于传统的检索方法,从而提高了指令遵循的准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代医学为每位患者生成了惊人的信息量。一个人的电子健康档案不仅仅是几页笔记;它是一个庞大的、按时间顺序排列的档案,如果包含了每一次就诊记录、化验结果、用药史和社交细节,其篇幅可以长达 10 万字以上。多年来,旨在阅读和理解语言的计算机程序在处理此类长文档时一直表现挣扎,它们往往会遗忘中间部分,而只记得开头和结尾。这种被称为“迷失在中间”(lost-in-the-middle)效应的盲点意味着,如果一段关键的病史被埋在患者档案的中心位置,人工智能可能会完全忽略它。在临床环境中,这并非一个小故障。遗漏两年前停止使用的药物、档案中间的一个化验值,或是一个与当前治疗方案相矛盾的旧诊断,都可能导致危险的错误。研究人员面临的问题是:这种缺陷是这些“计算机大脑”工作方式中一种不可避免的特性,还是可以通过修复来使医疗人工智能变得更安全、更可靠。
加州大学旧金山分校的一位研究人员致力于精确测量这一问题的严重程度,并寻找解决办法。他们测试了六种不同的语言大模型(即能够阅读并回答问题的先进计算机程序),使用了数千份真实的患者记录和临床问题。他们发现,这个问题既严重又普遍。当医学问题的答案位于患者档案的第一部分或最后一部分时,计算机的正确率约为 60%。然而,当同一个答案隐藏在档案中间 70% 的部分时,准确率下降到了大约 38%。这近 22 个百分点的差距意味着,如果真相位于数据的中心位置,计算机找到它的可能性会显著降低。研究人员发现,这些医学记录中近 70% 的重要事实恰好落在这一危险的中间地带,将最关键的信息置于计算机最容易忽视的地方。
为了解决这个问题,研究人员尝试了几种不同的方法,包括在大型数据库中搜索信息的标准方法。他们测试了仅寻找匹配词汇的系统、尝试理解句子含义的系统,以及通过重新排序文本以使其更易于阅读的系统。令人惊讶的是,当计算机需要实际回答复杂的医学问题时,这些传统的搜索方法都表现不佳。即使搜索系统成功找到了包含答案的正确句子,计算机仍然无法正确利用该信息来形成回答。计算机会找到正确的词汇,但随后会被文件中的其他无关细节分散注意力,从而给出一个听起来看似合理但医学上错误的答案。
随后,研究人员开发了一种名为“查询条件临床抑制”(Query-Conditioned Clinical Suppression)的新型轻量级方法。该方法并不试图阅读整个庞大的文件或仅仅搜索匹配的词汇,而是像一个过滤器一样,根据正在提出的特定问题,仅选择与该问题真正相关的句子。它忽略了文件的其余部分,有效地抑制了噪声。当他们使用这种新方法进行测试时,其表现比所有其他方法都出色得多。对于答案位于记录中间的问题,这种新方法使计算机回答正确率达到了约 17%,而其他搜索方法的正确率为零。总体而言,新方法的成功率约为 25%,而表现最好的其他方法成功率不足 4%。
或许最具有启发性的发现是,这种新方法的成功并非仅仅来自于找到了包含答案的“金标准”句子。事实上,新方法通常甚至没有选中那个持有答案的精确句子,却依然产生了正确的回答。这表明,解决问题的关键不仅在于检索出正确的文本片段,而在于策划一个有助于计算机在不被无关细节干扰的情况下进行推理的语境。研究人员证实,仅仅拥有正确的句子是不够的;计算机需要一个专注且相关的语境才能清晰地思考。虽然这种新方法尚未完美到可以取代人类医生,但它证明了医学记录中的“迷失在中间”问题是一个真实存在且可以解决的工程挑战,为开发能够可靠应对患者复杂且庞大护理史的 AI 系统指明了道路。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。