✨ 要点🔬 技术摘要
在癌症治疗这一高风险领域,医生必须不断应对不断变化的治疗手段、演进中的临床指南以及复杂的分子数据。为了给患者做出正确的选择,他们往往需要快速查找并理解最新的医学研究。近年来,人工智能工具应运而生,协助完成这项任务,它们充当数字助手,能够搜索海量的医学文献并将研究结果以通俗易懂的语言进行总结。然而,一个关键问题仍然存在:仅仅因为人工智能能找到正确的事实,它是否能以一种让疲惫的医生能够信任并使用的形式来呈现这些事实?挑战不仅在于计算机是否正确,还在于信息的“着装”与交付方式。如果一份报告难以阅读、令人困惑或显得隐瞒了其来源,医生可能会忽略一个完全准确的答案。这种原始数据与人类信任之间的鸿沟,正是临床人工智能真正发挥作用之处。
斯坦福大学及其他机构的一个研究小组致力于通过让34名肿瘤学家评审由不同人工智能系统生成的报告,来探索这一差距。他们并没有简单地询问医生哪种人工智能最聪明;相反,他们测试了报告的设计如何影响医生的信心。该研究涉及五种不同的患者情景,涵盖从放射肿瘤学到小儿血液学的多种领域,并覆盖了从住院医生到资深教授的不同培训水平。针对每种情景,医生都要评审四份针对同一医学问题的不同AI生成摘要。这些摘要来自三个不同的来源:一种名为OpenEvidence的专业医学AI工具、一种名为ChatGPT的通用型聊天机器人,以及一个由研究人员手动调整过的OpenEvidence版本。研究人员对这个调整后的版本有一个特定的假设:他们认为,如果他们重新组织报告以强调证据强度——将最可靠、大规模的临床试验放在顶部,并将较弱的研究置于底部——医生会发现它更有用且更值得信赖。
实验结果令研究人员感到惊讶。尽管使用了完全相同的底层事实和引用,但研究团队精心制作的、旨在强调证据强度的修改版报告,在整体有用性评分上显著低于标准的、未经修改的OpenEvidence报告。事实上,这个定制版本是四种选项中最不受欢迎的一种。医生并不认为重新排序后的布局更清晰或更符合逻辑;相反,他们觉得它缺乏组织且难以快速浏览。这一发现表明,仅仅通过重新排列信息的顺序来使“证据等级”更加直观,并未达到预期效果。医生并不希望人工智能充当判断哪些研究更好的“法官”;他们希望人工智能以一种让他们能够快速自行验证的方式来呈现信息。
通过一系列访谈和详细评分,研究人员揭示了医生真正的需求。他们看重的特征并非复杂的排名系统,而是清晰度与速度。医生更倾向于简洁、能在数秒内完成浏览的报告,并在最顶部设有清晰的摘要。他们希望看到临床试验中的具体数字,例如生存率或副作用百分比,而非模糊的描述。至关重要的是,他们要求每一项主张都必须直接链接到其来源,并带有可点击的引用,以便他们能立即验证信息。他们还希望在原始证据与AI可能给出的任何建议之间有明确的分隔,更倾向于让AI总结数据,而不是表现得过于自信或具有指令性。当人工智能隐藏其来源、语气过于啰嗦,或者在没有区分的情况下混合呈现高质量与低质量的研究时,信任便会消失。
研究还显示,OpenEvidence标准工具在整体效用方面与通用型的ChatGPT表现相当,但在引用质量方面评分更高。这表明,对于医疗专业人士而言,能够将主张追溯到原始来源的能力与答案本身同样重要。研究人员发现,信息的呈现方式可以改变医生对其价值的感知,即使内容完全相同。一份看起来杂乱无章或感觉在隐瞒工作过程的报告会被拒绝,而一份整洁、结构良好、尊重医生时间并满足其验证需求的报告则会被接受。研究结论指出,为了让人工智能在医院中真正发挥作用,其设计不能仅针对准确性,还必须针对人类的工作流程。最好的工具不一定是知道最多的那个,而是那个能以安全、透明且易于使用的方式呈现其知识的工具。
技术摘要:一项随机混合方法研究中驱动肿瘤学家对 AI 生成文献综述偏好的因素
问题陈述 尽管大型语言模型(LLMs)正越来越多地被医生用于临床推理和行政任务,但使 AI 生成的文献综述具有实用性和可信度的具体设计特征仍不明确。先前的评估表明,模型的准确性本身并不能保证临床效用;在某些情况下,医生与 AI 的协作表现甚至不如单纯使用 AI。在证据演进迅速且决策风险极高的肿瘤学领域,理解临床医生如何评估、验证并整合 AI 生成的报告存在关键的研究空白。具体而言,目前尚不清楚通过修改报告结构以显式突出证据等级(例如,按证据强度对研究进行排序)是否能提高感知效用,或者此类设计变更是否会无意中降低信任度或破坏工作流适配性。
研究方法 作者开展了一项远程、受试者内、随机混合方法研究,涉及来自多个机构(主要是斯坦福大学和加州大学洛杉拉勒斯分校)的 34 名肿瘤科医生(包括专科医生、住院医生和主治医生)。
研究设计: 参与者回顾了五个肿瘤学临床病例。对于每个病例,他们评估了四份盲测的 AI 生成文献综述报告:
标准版 OpenEvidence: 一种广泛使用的临床 AI 工具。
修改版 OpenEvidence: 通过重新提示模型(GPT-5.2 Thinking)来重组现有的 OpenEvidence 输出内容 (不补充外部信息)生成的报告,旨在按证据强度(指南和大型试验)优先排序并显式对证据进行分级。
ChatGPT: 通用型 LLM(GPT-5.2 Thinking)。
DoximityGPT: 通用型 LLM(DoxGPT)。
数据收集:
定量数据: 参与者在 7 点李克特量表上对每份报告的整体效用及六个子维度(清晰度、行动信心、引用质量、顺序/流向、不确定性沟通和长度)进行评分。此外,他们还选择了“最佳”和“最差”的报告,并指明了偏好的报告长度。
定性数据: 进行了一次包含 20 场半结构化访谈(部分参与者进行了多次访谈),总计近 6 小时的音频。这些访谈通过预设的、由 LLM 辅助的定性分析流程进行处理。转录文本被处理成结构化的 JSON 文件,以提取主题、喜好/厌恶以及设计需求,随后将其合成到一个跨访谈的知识库中。
分析: 定量数据通过线性混合效应模型进行分析,并引入了针对参与者和病例的随机截距,以处理聚类问题。定性数据通过合成识别出反复出现的重复设计需求和信任驱动因素。
主要结果
定量发现: 与“证据分级、重组后的报告将提高效用”这一假设相反,修改版 OpenEvidence 报告的整体效用评分显著低于 标准版 OpenEvidence 报告(平均差值:−0.96;95% CI,−1.26 至 −0.66;P < .001)。修改版报告在所有六个子维度上的得分也较低,其中在不确定性沟通、顺序/流向和清晰度方面的缺陷最为明显。
标准版 OpenEvidence 在整体效用上与 ChatGPT 和 DoximityGPT 表现相似,但在引用质量方面显著优于两者。
ChatGPT 的引用质量评分显著低于 OpenEvidence。
DoximityGPT 在长度方面的评分有所提高,但引用质量评分较低。
定性发现: 对 20 场访谈的分析识别出六个核心主题和七个具体的设计需求。肿瘤学家优先考虑的是:
快速定位: 简洁、置顶的摘要,适用于时间受限的工作流。
可验证性: 直接、可点击的引用,指向特定的指南章节或试验数据;可识别的指南来源(如 NCCN、ASCO)至关重要。
证据透明度: 显式沟通不确定性,并将证据呈现与 AI 建议分离。
格式化: 易于扫描的布局,配合选择性的表格和加粗的指南;避免使用密集的段落或带有“AI 味”的编辑语气。
信任侵蚀: 当出现引用不匹配、来源信息埋没、证据分类错误以及过度自信的建议时,信任度会迅速下降。
主要贡献
设计重于准确性: 本研究提供了经验性证据,证明报告的设计和呈现方式会显著影响感知的临床效用,且这种影响独立于底层模型的客观事实准确性。一份拥有相同源数据但结构不同的报告(证据分级版)被认为效用较低,这表明“正确”本身不足以推动应用。
具体的设计需求: 论文详细阐述了临床 AI 的具体设计要求,包括对“可追溯文本”(直接链接到源段落)的需求、显式的确定性量化,以及文献综述与 AI 生成建议的分离。
方法论创新: 作者展示了一种预设的、由 LLM 辅助的定性分析工作流。通过将访谈转录文本转换为结构化 JSON 并合成到机器可读的知识库中,他们提供了一种可重复的方法,用于聚合大量定性的医生反馈,同时保持审计性。
意义与主张 作者主张,为了使临床 AI 有效,必须将其设计为快速定位、证据检索和验证 的工具,而非自主决策引擎。研究认为,临床 AI 中的“形式暗示功能”;输出的布局和层级决定了临床医生将其视为信任的助手还是有风险的建议引擎。
论文提出,信任是一种设计特征 。诸如可见的指南锚定、加粗的证据来源和直接超链接等功能不仅是装饰性的,更是临床有用性的核心组成部分。修改版报告的失败(该报告试图突出证据强度)表明,当前尝试可视化证据层级的方法可能会在破坏可用性的同时,无意中损害易用性。
最终,作者得出结论,临床 AI 的评估必须超越基准测试模型的准确性,转向对报告设计和医生-AI 交互 的实证评估。他们强调,有效的协作取决于 AI 如何融入人类的工作流,并指出“呈现线索可以影响感知的专业性”,这类似于医学中的“白大褂效应”。该研究呼吁未来的工作应隔离特定的界面元素,以确定它们对临床验证行为和决策质量的因果影响。
每周获取最佳 health informatics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。