Artificial Intelligence Can Match Domain Experts in Evidence Extraction and Critical Appraisal of Microbial Oncogenesis Research Publications
本研究表明,先进的大型语言模型,特别是 GPT-5 和 GPT-5 Nano,在提取和评估微生物致癌研究证据方面可以媲美领域专家,支持其在方法学评价和矛盾识别仍存在持续挑战的情况下,用于可扩展的系统性证据合成。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,医学研究的世界就像一座永不停歇、不断扩张的巨大且混乱的图书馆。每天都有成千上万本新书——即科学论文——被撰写出来,讲述微小的病原体(微生物)以及它们如何可能导致癌症等疾病。长期以来,要判断某种特定的病原体是否为“反派”,唯一的办法是让一支由超级聪明的人类侦探(领域专家)组成的团队阅读每一页,交叉比对事实,并判断证据是否足够充分。但随着每年发表超过一百万篇新文章,这种“仅靠人类”的侦探工作已变得不再可能。这就像试图从消防水柱中饮水一样;专家们根本跟不上进度。这就是人工智能(AI),特别是被称为“大语言模型”(LLMs)的一种类型,介入的地方。把这些 AI 想象成超级快速、超级擅长阅读的读者,它们可以在几秒钟内扫描整个图书馆。但这里有一个核心问题:机器人真的能像人类专家那样思考吗?它能发现证明病毒致癌的细微线索吗,还是会仅仅在编造故事(这种问题被称为“幻觉”)并弄错事实?科学家们需要知道,在让这些数字侦探接手整理世界医学证据的工作之前,他们是否可以信任它们。
这篇论文设定了一场高风险的对决,让人类专家与 AI 进行较量,看谁更擅长调查一个特定的谜团:一种名为小鼠乳腺肿瘤病毒样病毒(MMTV-LV)的病毒是否会导致人类患乳腺癌。研究人员收集了 24 篇关于这种病毒的真实科学论文,并创建了一个包含 77 个问题的巨型测试,来测试这些侦探。他们要求四种不同的 AI 模型(两种来自谷歌的 Gemini,以及两种来自 OpenAI 的 GPT-5)阅读这些论文并回答测验,同时让一组人类专家也进行同样的测试。目标不仅是看谁答对的题目更多,而是看 AI 是否能像人类一样思考并判断证据。
结果既让人“惊叹”,又让人“唏嘘”。研究发现,其中两种 AI 模型——GPT-5 和 GPT-5 Nano——的表现几乎与人类专家完全一致。当研究人员将 AI 的答案与人类的答案混合在一起时,整体的一致性并没有发生任何变化。就好像 AI 加入了专家团队,成为了另一位才华横溢的同事。这些 AI 非常擅长阅读文本、理解复杂的医学语言以及总结论文内容。它们很少编造事实(幻觉),即便出现幻觉,也通常发生在规模较小、功能较弱的模型中。
然而,AI 并非完美无缺。研究表明,AI 模型(尤其是谷歌的 Gemini 模型)往往表现得过于“宽容”。它们很“仁慈”,这意味着它们比人类更容易判定一篇论文提供了病毒致癌的有力证据。它们有时会在人类认为没有联系的地方看到联系,比如在没有足够证据的情况下,假设小鼠研究与人类疾病之间存在关联。AI 在这项工作的最难部分也表现挣扎:发现论文内部的矛盾(例如图表中的数字与正文不符)以及评判研究方法。这就像一个学生能够完美地总结一个故事,却忽略了主角的时间线逻辑不通的事实。
最后,这篇论文表明,我们可以信任先进的 AI 来帮助我们筛选海量的医学研究。它们速度极快,基本准确,并且在提取关键事实方面可以媲美人类专家。但它们目前还没有准备好完全取代人类。作者建议,最好的方法是将 AI 作为一名强大的助手,承担起阅读和总结的大量繁重工作,同时让保持人类专家在回路之中,以复核复杂的逻辑并捕捉细微的错误。这是一种伙伴关系:机器人负责阅读,而人类负责批判性思考。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。