← 最新论文
📄 health informatics

Drivers of Oncologist Preference of AI-Generated Literature Review in a Randomized Mixed-Methods Study

这项随机混合方法研究表明,肿瘤学家对人工智能生成的文献综述的信任度和偏好更多地取决于报告的设计特征——例如简洁性、可验证的引用以及明确的不确定性——而非仅仅取决于准确性,这一点从证据分级报告的效用评分显著低于标准格式(尽管两者参考文献质量相似)中得到了证实。

原作者: Bunning, B. J., Weng, Y., Wu, D. J., Hui, G., Hope, J. E., Pandurangan, V., Lopez, I., Everett, S., Chen, J. H., Desai, M.

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Bunning, B. J., Weng, Y., Wu, D. J., Hui, G., Hope, J. E., Pandurangan, V., Lopez, I., Everett, S., Chen, J. H., Desai, M.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在癌症治疗这一高风险领域,医生必须不断应对不断变化的治疗手段、演进中的临床指南以及复杂的分子数据。为了给患者做出正确的选择,他们往往需要快速查找并理解最新的医学研究。近年来,人工智能工具应运而生,协助完成这项任务,它们充当数字助手,能够搜索海量的医学文献并将研究结果以通俗易懂的语言进行总结。然而,一个关键问题仍然存在:仅仅因为人工智能能找到正确的事实,它是否能以一种让疲惫的医生能够信任并使用的形式来呈现这些事实?挑战不仅在于计算机是否正确,还在于信息的“着装”与交付方式。如果一份报告难以阅读、令人困惑或显得隐瞒了其来源,医生可能会忽略一个完全准确的答案。这种原始数据与人类信任之间的鸿沟,正是临床人工智能真正发挥作用之处。

斯坦福大学及其他机构的一个研究小组致力于通过让34名肿瘤学家评审由不同人工智能系统生成的报告,来探索这一差距。他们并没有简单地询问医生哪种人工智能最聪明;相反,他们测试了报告的设计如何影响医生的信心。该研究涉及五种不同的患者情景,涵盖从放射肿瘤学到小儿血液学的多种领域,并覆盖了从住院医生到资深教授的不同培训水平。针对每种情景,医生都要评审四份针对同一医学问题的不同AI生成摘要。这些摘要来自三个不同的来源:一种名为OpenEvidence的专业医学AI工具、一种名为ChatGPT的通用型聊天机器人,以及一个由研究人员手动调整过的OpenEvidence版本。研究人员对这个调整后的版本有一个特定的假设:他们认为,如果他们重新组织报告以强调证据强度——将最可靠、大规模的临床试验放在顶部,并将较弱的研究置于底部——医生会发现它更有用且更值得信赖。

实验结果令研究人员感到惊讶。尽管使用了完全相同的底层事实和引用,但研究团队精心制作的、旨在强调证据强度的修改版报告,在整体有用性评分上显著低于标准的、未经修改的OpenEvidence报告。事实上,这个定制版本是四种选项中最不受欢迎的一种。医生并不认为重新排序后的布局更清晰或更符合逻辑;相反,他们觉得它缺乏组织且难以快速浏览。这一发现表明,仅仅通过重新排列信息的顺序来使“证据等级”更加直观,并未达到预期效果。医生并不希望人工智能充当判断哪些研究更好的“法官”;他们希望人工智能以一种让他们能够快速自行验证的方式来呈现信息。

通过一系列访谈和详细评分,研究人员揭示了医生真正的需求。他们看重的特征并非复杂的排名系统,而是清晰度与速度。医生更倾向于简洁、能在数秒内完成浏览的报告,并在最顶部设有清晰的摘要。他们希望看到临床试验中的具体数字,例如生存率或副作用百分比,而非模糊的描述。至关重要的是,他们要求每一项主张都必须直接链接到其来源,并带有可点击的引用,以便他们能立即验证信息。他们还希望在原始证据与AI可能给出的任何建议之间有明确的分隔,更倾向于让AI总结数据,而不是表现得过于自信或具有指令性。当人工智能隐藏其来源、语气过于啰嗦,或者在没有区分的情况下混合呈现高质量与低质量的研究时,信任便会消失。

研究还显示,OpenEvidence标准工具在整体效用方面与通用型的ChatGPT表现相当,但在引用质量方面评分更高。这表明,对于医疗专业人士而言,能够将主张追溯到原始来源的能力与答案本身同样重要。研究人员发现,信息的呈现方式可以改变医生对其价值的感知,即使内容完全相同。一份看起来杂乱无章或感觉在隐瞒工作过程的报告会被拒绝,而一份整洁、结构良好、尊重医生时间并满足其验证需求的报告则会被接受。研究结论指出,为了让人工智能在医院中真正发挥作用,其设计不能仅针对准确性,还必须针对人类的工作流程。最好的工具不一定是知道最多的那个,而是那个能以安全、透明且易于使用的方式呈现其知识的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →