← 最新论文
🤖 AI

Generated Context versus Governed State: Functional Conditions for Accountable Longitudinal Clinical Reasoning

本文认为,负责任的纵向临床推理需要从瞬态的、生成的文本语境转向受控的、持久的患者状态表示,并提出了一个区分了五种被混淆的临床对象并定义了四项信息要求的概念框架,旨在将“负责任的人工智能”从一个口号转变为一个可审计的系统。

原作者: Augusto Bernardo Pissarra, Victor Lorena de Farias Souza

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Augusto Bernardo Pissarra, Victor Lorena de Farias Souza

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

几十年来,我们的数字健康记录仅仅是数字化的档案柜。当医生记录关于患者血压的笔记,或护士记录药物变化时,这些信息是以文档形式存储的,就像抽屉里的信件一样。为了理解患者当前的状况,人类必须阅读这些信件,拼凑出故事的脉络,并将完整的图景保存在脑海中。这向来是临床医生的工作:从零散的纸质资料中重建一个人的健康真相。近年来,被称为大语言模型的强大计算机系统已经到来,它们能够以惊人的速度和流畅度阅读这些文档。它们可以在几秒钟内总结患者的历史,回答那些曾经需要人类研究数小时的问题。然而,尽管这些系统非常擅长阅读文本,但它们本质上并不会为患者在任何给定时刻的真实情况维护一份独立的、有组织的记录。它们将患者的历史视为一段待处理的文字流,而非一个需要追踪的动态状态。

这种“流畅阅读”与“准确认知”之间的差距,正是 MyndwareMed 研究人员发表的一篇新论文所解决的核心问题。作者认为,将患者的病史视为简单的文本集合,是试图构建能够被长期护理信任的人工智能时的一个根本性缺陷。他们提出,临床推理不是一项阅读理解测试,而是一个追踪变化现实的问题。正如导航房间的机器人必须不断更新其关于墙壁和门的地图一样,医疗系统必须维护一个持续的、受控的患者状态记录。研究人员区分了两种截然不同的处理信息的方式。第一种是“生成式上下文”,即计算机为单个问题收集相关文档,并在给出答案后便将其遗忘。第二种是“受控状态”,即系统维护一个持久的、版本化的、可审计的记录,用于说明其认为真实的状况,且该记录仅通过严格的规则进行更新,这些规则将“观察到的事实”与“推断出的结论”区分开来。

该论文并未声称这些新的计算机模型不擅长阅读。事实上,它们在寻找文本模式方面往往比人类更出色。问题在于,阅读记录并不等于了解患者。研究人员指出,目前的系统经常混淆书面笔记与医学事实,或者将缺失的文档误认为缺失的病情。例如,如果一名患者在十年前有肾脏问题,但在过去一年中没有进行过任何检查,标准的系统可能会自信地陈述该患者的肾脏功能良好,因为最近的记录中并未提及异常。然而,拥有“受控状态”的系统会识别出最后一次测量数据已过时,且当前状态未知。它会明确标记信息的缺口,而不是用一个自信的猜测来填补它。这种区别至关重要,因为在医学领域,“我们知道这是真的”与“我们尚未看到证据表明其存在”之间的差异,可能决定了一项治疗方案是安全还是危险。

为了解决这个问题,作者将混乱的医疗推理过程分解为五个绝不能混淆的独立对象。首先是患者的“真实状态”,即其身体的实际物理状况;没有任何系统能直接掌握这一点,只能进行估计。其次是“观察结果”,即护理团队进行的具体测量或记录。第三是“证据”,即系统摄入的原始数据,并附带其编写时间、接收时间和编写者的记录。第四是“信念”,即系统基于目前所见所有证据对患者状况做出的最佳推测。最后是“模拟”,即用于测试“假设性场景”的假设情境,例如如果患者服用另一种药物会发生什么。论文指出,大多数当前的 AI 系统将这五种不同的事物合并为一,将累积的笔记视为当前的真相。这导致了错误,例如将旧的信息视为新的,或将猜测误认为事实。

研究人员提出了一种关于如何构建这些系统的新标准,该标准被组织为一个分层框架,用于衡量系统对患者状态的管控能力。在最低层级,系统可能仅仅存储文本。在更高层级,它开始将文本组织成具有清晰来源和时间戳的结构化事实。最先进的层级要求系统维护一个独立的“信念”对象,该对象必须区别于原始证据。这个“信念”对象必须能够展示不确定性,例如承认某项测量值缺失,或指出两位医生给出了相互矛盾的报告。至关重要的是,该系统必须能够回放其自身的历史。如果医生问:“关于这个患者的心脏状况,你在三个月前是怎么想的?”,系统必须能够根据当时可获得的证据,重构出当时知识的精确状态,而不是基于今天的证据。这种回顾并观察系统理解如何随时间变化的能力,即作者所说的“问责制”。

该论文还引入了一种处理缺失信息的特定方法。在标准系统中,如果记录中未提及过敏症,系统可能会假设患者没有过敏症。而在受控系统中,信息的缺失被视为一种特定类型的数据点。系统学会了区分“未记录过敏史”(意味着从未询问过该问题)、“患者自述无过敏史”(报告的阴性结果)以及“过敏测试结果为阴性”(观察到的阴性结果)。每种情况都带有不同的确定程度,并需要不同的临床应对措施。通过正确分类这些缺失情况,系统避免了“沉默即安全”的危险习惯。作者通过一个关于患者六年来肾脏问题的详细案例展示了这一点。一个仅查看最近笔记的标准系统,可能会推荐一项风险较高的医疗程序。而一个追踪测量时间线及其间隙的受控系统,则会正确识别出患者当前的肾功能状态未知,并建议在进行下一步操作前先进行重新检测。

这项工作被呈现为一份概念蓝图,而非一个成熟的产品。作者明确表示,他们尚未证明这种新架构能在现实世界的试验中带来更好的患者预后。相反,他们定义了这样一个系统存在的必要条件,并提供了一种审计未来系统是否符合这些条件的方法。他们认为,目前专注于让语言模型变得更聪明、更快速的做法忽略了重点。真正的挑战不在于“阅读者”的智能,而在于其所“阅读的状态”的治理。他们指出,要让人工智能在医院环境中实现真正的问责,它必须超越单纯的文本生成,转而开始维护一份持久的、版本化的、可审计的记录,用以说明其已知及未知的知识。论文最后概述了一个构建这些系统的研究计划,从追踪证据的基础设施开始,逐步迈向建立一个关于患者随时间变化的完整模型。其目标是将模糊的“可问责 AI”承诺转化为一套可以被检查、被测试并被信任的具体工程需求。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →