← 最新论文
📄 health informatics

Citation reliability of frontier large language models in medical writing and its automated verification

这项研究表明,尽管前沿大语言模型生成了比例显著的不可靠医学引用——其主要表现为误传而非捏造——但自动化的验证链(Chain-of-Verification)系统能够以专家级的准确度检测出这些错误,从而为确保人工智能辅助医学写作中的引用完整性提供了一种可行的解决方案。

原作者: Shin, R., Lee, J.-M., Park, J., Kwun, J.-S., Cho, H.-W., Kang, S.-H., Jeon, K.-H.

发布于 2026-09-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Shin, R., Lee, J.-M., Park, J., Kwun, J.-S., Cho, H.-W., Kang, S.-H., Jeon, K.-H.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在现代医学实践中,撰写研究论文或综述文章是一个严谨的过程,要求绝对的精确。作者不仅要综合复杂的医学知识,还必须将每一项主张锚定在特定的、现有的证据来源之上。这些来源即为引文,它们是科学发现的足迹,引导读者回到支持新观点的原始研究。几十年来,这一过程一直是人类的职责,需要仔细核对姓名、日期和期刊名称,以确保参考文献确实存在,并且正如作者所言。然而,一种新的工具已经进入了实验室和图书馆:大型语言模型。这些是经过海量文本训练的强大计算机程序,可以在数秒内起草文章、总结研究结果并生成参考文献列表。虽然它们承诺了速度和效率,但一个关键问题出现了:这些机器能否被信任去寻找正确的足迹,还是它们有时会凭空捏造足迹?

这个问题不仅仅是学术性的;它触及了医学诚信的核心。如果一台计算机编写了一篇医学综述,其中包含了一个看起来真实但指向错误研究的引文,或者更糟的是,指向了一个从未存在的研究,那么整个论证都可能崩塌。这种现象被称为“幻觉”,是早期计算机模型的已知弱点。但随着这些工具的进化,变得更快并具备了实时搜索互联网的能力,目前尚不清楚它们是否终于学会了正确地引用。医学界需要知道,这些新的、先进的模型是否足够可靠,可以用于严肃的研究;如果不够可靠,是否存在一种切实可行的方法,能在其发表前捕捉到错误。

一组研究人员为了回答这些问题,对三款最先进的计算机模型进行了严格测试。他们要求每个模型就心脏病学(研究心脏和血管的领域)内的九个不同主题撰写一系列短篇医学综述。这些主题涵盖了从常见疾病到罕见手术的范围,确保了既有大量已发表研究的主题,也有极少研究的主题。每个模型都被指示撰写一篇约600至900字的文章,并为每篇文章提供恰好三十个参考文献,总计270篇综述和超过8,000条引文。至关重要的是,研究人员允许模型使用其内置的网络搜索工具,以模拟用户在现实场景中的实际应用方式。目标是观察这数千条引文中究竟有多少是真正正确的。

结果揭示了一个存在显著差异且错误持续存在的局面。当研究人员根据官方医学数据库逐一核对每一条引文时,他们发现这些模型并不完美。其中一个模型 GPT-5.5 表现最好,其产生问题引文的情况约为 11.5%。然而,另外两个模型 Claude Opus 4.8 和 Gemini 3.5 Flash 在引文中的错误率接近 30%。这意味着对于生成的每十条参考文献,其中大约有三条存在缺陷。研究人员还调查了模型是否在研究文献较少的课题上表现得更为吃力,担心可用信息的匮乏会令计算机感到困惑。他们发现,虽然在文献较多的主题上错误率略低,但这种差异并不显著,不足以被视为一条确定的规则。无论主题拥有的信息量多少,模型都会犯错。

或许最令人警醒的发现是这些错误的性质。研究人员原以为会发现许多计算机直接编造虚假文章的情况——这是典型的幻觉形式。然而,他们发现绝大多数错误要微妙得多。约 7 7% 的问题引文属于“误归因”案例。在这种情况下,计算机提供了一个真实、有效的标识符,指向了一篇真实的医学文章,但该文章并非模型声称的那篇。这就像计算机在图书馆里找到了一本真实的图书,却把它放错了书架,并贴上了另一本书的标签。这种类型的错误尤其危险,因为它乍看之下是正确的;人类读者可能会看到一个有效的编号并认为该参考文献值得信赖,却在稍后才发现该来源并不支持正在论述的观点。真正的“伪造”——即计算机发明了一篇根本不存在的文章——则出奇地罕见,仅占错误总数的不到 1%。

意识到这些微妙的错误很难通过人工进行系统性检查,研究人员测试了一种名为“验证链”(Chain-of-Verification)的新型验证方法。这种方法使用计算机模型本身,但采用了不同的方式。该系统不再仅仅要求模型列出参考文献,而是将任务分解为一系列独立的微小问题。它要求模型根据标题和作者查找文章,然后检查期刊和年份是否匹配,最后确认标识符是否指向正确的文档。通过强制模型针对数据库分别验证每一项信息,而不是依赖其记忆,该系统可以捕捉到自身的错误。当研究人员使用这套自动化系统针对一组经过人类专家仔细核对过的参考文献进行测试时,该系统表现出了卓越的效能。它正确识别了 96.8% 的问题引文,包括所有的误归因和伪造案例,同时极少将正确的引文误标为错误。

研究结论指出,尽管最新一代的医学写作工具功能强大,但若没有监督,它们尚不足以被信任。最常见的失败并非发明虚假事实,而是对真实事实的错误标注,这种错误需要特定类型的检查才能检测出来。研究人员发现,自动化验证过程执行此类检查的准确度可以与人类专家相媲美。这表明,未来人工智能辅助医学写作的趋势不会是在人类与机器之间做选择,而是一种伙伴关系:由机器起草内容,而专门的验证系统则确保每一条引文都指向真相。在这样的验证成为标准做法之前,由这些模型生成的引文应谨慎对待,因为它们可能会引导读者走向错误的真相源头。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →