Right Diagnoses, Decorative Reasoning:A Perturbation Audit of Medical Chain-of-Thought
本文引入了一种医学扰动审计框架,该框架揭示了 14 个大语言模型中普遍存在的高“思维链脱节率”,表明它们的思维链推理过程往往仅作为装饰性的文档,而非驱动医学诊断的实际推理过程的忠实证据。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在医疗护理的高风险领域,医生依靠一种特定的思维过程来得出诊断。他们收集症状、权衡证据,并沿着逻辑路径走向结论。当人工智能系统开始回答医学问题时,它们也采用了类似的方法,称为“思维链”(chain-of-thought)。这些计算机程序不再直接跳到答案,而是先生成一个逐步的解释,模仿人类医生进行推理的方式。这一特性至关重要,因为它允许医疗专业人员检查机器建议背后的逻辑,确保一个自信的答案背后没有隐藏着危险的错误。人们一直希望,如果计算机写出其推理过程,那么这段文本就是其如何得出决策的真实记录,成为观察其思维的透明窗口。
然而,来自埃因霍芬理工大学和达纳-法伯癌症研究所研究人员的一项新研究挑战了这一假设。他们提出了一个根本性的问题:书面解释究竟是驱动了答案,还是仅仅是机器事后对自己讲述的一个故事?为了找出答案,研究团队将推理过程视作一项科学实验。他们选取了十四种不同的医学人工智能模型,并对其进行了严格的审计。研究人员有系统地改变了要求模型回答的问题——将一种病情从“急性”改为“慢性”,更换患者的年龄,或者将否定陈述改为肯定陈述。这些改变旨在具有临床意义,即现实中的医生会立即注意到的细节。如果人工智能的推理确实是忠实的,那么书面解释应该反映出新的信息,且最终答案也应在医学事实要求的情况下发生转变。
研究人员发现了一个令人震惊的脱节。在所有情况下,这些模型的表现都仿佛是在忽略它们被告知要做的改变。当问题在应当改变诊断的情况下被修改时,书面推理往往保持完全一致,重复着原始的事实,仿佛什么都没有发生过一样。在近 73% 的案例中,模型的解释并未察觉到编辑,最终答案也没有发生翻转,尽管输入内容已发生了根本性的变化。这就像是机器已经决定了一个答案,然后只是在编写一个与之匹配的剧本,而不论实际呈现的证据如何。研究通过破坏推理文本本身(删除步骤或重新排列句子)测试了这一点,发现模型的准确率几乎没有变化。最终答案之所以正确,并不是因为推理严密,而是因为推理实际上并没有发挥作用。
研究人员证实,这并非简单的阅读错误。他们请来了两名获得执业资格的临床医生来审查修改后的问题及模型的响应。医生们一致认为,在 98.5% 的案例中,对问题的修改足够清晰且显著,以至于一个忠实的推理过程理应对此做出反应。然而,模型在很大程度上未能做到这一点。在某些情况下,模型甚至在问题改变时将其答案转向了错误的选项,但书面解释并未反映出这种转变,这表明推理并不是决策的原因。该研究还观察了那些经过专门训练以提升推理能力的模型(包括来自大型科技公司的模型),并发现了同样的模式:可见的思维链在很大程度上是装饰性的。它充当了一个文档表面,即模型想要表达的内容记录,而不是解决问题的因果记录。
这一发现表明,目前将这些解释作为安全、逻辑推理证明的依赖可能是不恰当的。这项研究并不声称这些模型无法给出正确答案,也不说解释总是错误的。相反,它揭示了解释往往并不是驱动汽车的引擎。对于使用这些工具辅助决策的医疗专业人员而言,这意味着他们不能假设一个清晰、听起来有逻辑的解释就保证了机器确实使用了所提供的证据。研究表明,在推理过程真正与最终决策挂钩之前,这些人工智能系统仍然是一个黑匣子,其中的可见文本是一个叙述,而非地图。未来的道路需要构建出一种让解释不仅是故事,而且是答案实际机制的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。