Verifiable by Construction: Claim-Level Evaluation of Verbatim Citation in Clinical Question Answering
本文评估了十二个大语言模型通过将逐字引文附加至事实性陈述来生成可验证临床答案的能力,结果显示,尽管大多数模型能够成功地为超过 90% 的陈述附加引文,但这些引文往往无法充分证实其所伴随的陈述细节。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代医学的高风险世界中,时间往往是最稀缺的资源。当医生面临复杂的病例时,他们需要的答案不仅要准确,还要具有即时的可信度。多年来,人工智能一直承诺提供帮助,通过将海量的医学文献转化为清晰、易读的建议。然而,一个持久的问题始终笼罩着这些工具:即“幻觉”现象,也就是捏造事实的倾向。在一个哪怕一个错误都可能伤害患者的领域,医生不能仅仅凭计算机的一面之词就去信任它。他们必须能够验证每一项陈述的来源。传统上,当人工智能提供带有引用的答案时,该引用通常指向一份广泛的文件,例如整篇医学指南或研究论文。这迫使忙碌的临床医生必须在数百页的内容中搜寻支持该主张的具体句子,这一过程违背了拥有高效助手的初衷。因此,目标是构建这样的系统:它们不仅要指向来源,还要通过在答案旁边展示来自该来源的精确原话来证明其工作的正确性。
约翰斯·霍普金斯大学的研究人员开展了一项研究,旨在测试当前的人工智能模型是否真的能做到这一点。他们构建了一个专门的系统,用于回答关于心脏病、血压、胆固醇和糖尿病的四大主要医学指南中的临床问题。研究人员并没有让模型仅仅对信息进行总结,而是指示它们逐句构建答案,并为它们提出的每一个事实性主张都附上一段来自原始指南的直接、逐字逐句的引用。为了测试这是否奏效,他们创建了一个严谨的测试框架,充当数字审计员的角色。该系统将每个答案分解为组成部分,并根据三个特定标准对其进行检查:首先,模型是否为该主张附上了引用?第二,所附引用的内容是否是原始指南文本的精确、逐字副本,没有任何改动或转述?第三,该特定引用是否包含足够的信息来证明该主张是真实的,而无需读者再去查看其他地方?
研究人员使用了 222 个源自这些指南的合成临床问题,测试了十二种不同的语言大模型,涵盖了从功能强大、复杂的系统到较小、较快的系统。结果显示,这些模型的能力与实现真正可靠性之间存在显著差距。大多数先进的模型在执行前两个步骤方面表现得相当出色。它们成功地为超过 90% 的主张附上了引用,并且在许多情况下,它们提供的引用与源文本完全匹配。然而,系统在最后一步——也是最关键的一步——即“证明主张”时,表现得极其糟糕。虽然模型可能会提供一个完美的引用,但该引用往往无法支撑模型所做出的完整陈述。例如,一个模型可能会引用一个表示某种药物对特定人群是“首选”的句子,但随后却利用这个引用来支持该药物对所有人都是“必须”的更广泛主张。在一个显著的案例中,一个名为 Claude Opus 5 的顶级模型成功为其 98% 的主张附上了逐字引用,但其中只有 37.1% 的主张仅凭这些引用就能得到充分证实。引用确实存在,也十分准确,但它们不足以证明论点。
研究还强调了模型的大小和类型至关重要。较小的轻量化模型往往根本无法为其主张附上引用,或者提供的引用不是源文本的精确副本,导致其验证率大幅下降。在测试的模型中,规模最小的模型之一 Claude Haiku 仅能完全支持约 25% 的主张。相比之下,最大的模型表现要好得多,最好的系统能用精确且充分的证据支持约 75% 的主张。研究人员发现,失败的主要原因并不是模型在撒谎或编造事实,而是它们在选择正确的证据方面遇到了困难。它们经常抓取一个与主题相关但并不包含支持整个句子所需具体细节的引用。为了测试证据是否确实存在,研究人员要求另一个 AI 搜索原始文档,寻找那些能够完全支持这些主张的引用。他们发现,对于许多模型来说,缺失的证据就在它们已经阅读过的文本中;模型只是未能提取并附上正确的片段。
最终,这项工作表明,尽管人工智能在检索和格式化医学信息方面变得越来越强大,但在临床环境中,若没有人工监督,它尚不足以获得完全信任。生成流畅答案的能力与构建可验证答案的能力是截然不同的。研究表明,目前的模型通常可以提供用于验证的原材料,但它们经常无法将这些材料组装成一个完整的、自洽的证明。未来的路径在于构建这样的系统:它们不仅要引用来源,还要确保其建议中的每一个字都有来自原始指南的特定、充分且未经篡改的证据支持。在模型能够稳定地弥合“拥有引用”与“证明观点”之间的差距之前,验证的责任仍将牢牢掌握在人类临床医生手中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。