← 最新论文
📊 statistics

Errors in AI-Assisted Retrieval of Medical Literature: A Comparative Study

该研究通过评估 5 种主流大语言模型在检索 40 篇顶级医学期刊文章参考文献时的表现,发现其完全检索失败率高达 47.8%,且准确率在不同模型和期刊间存在显著差异,提示在使用 AI 辅助医学文献检索时必须仔细核查书目数据。

原作者: Jenny Gao (College of Arts and Science, New York University, New York, NY), Yongfeng Zhang (Department of Computer Sciences, School of Arts & Sciences, Rutgers University, Piscataway, NJ), Mary L Disi
发布于 2026-03-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Jenny Gao (College of Arts and Science, New York University, New York, NY), Yongfeng Zhang (Department of Computer Sciences, School of Arts & Sciences, Rutgers University, Piscataway, NJ), Mary L Disis (UW Medicine Cancer Vaccine Institute University of Washington, Seattle, WA), Lanjing Zhang (Department of Chemical Biology, Ernest Mario School of Pharmacy, Rutgers University, Piscataway, NJ, Department of Pathology, Princeton Medical Center, Plainsboro, NJ, Rutgers Cancer Institute, New Brunswick, NJ)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的"AI 助手”们做了一场严格的“期末考试”,主题是:当医生或研究人员让 AI 帮忙找医学文献时,AI 到底靠不靠谱?

为了让你更容易理解,我们可以把这项研究想象成**“让五个不同的图书管理员去图书馆找书”**的故事。

1. 故事背景:五个图书管理员(AI 模型)

研究人员找了 5 个目前最流行的免费 AI 助手(就像 5 个不同性格的图书管理员):

  • Grok (Grok-2)
  • ChatGPT (GPT-4.1)
  • Google Gemini (Flash 2.5)
  • Perplexity AI
  • DeepSeek (GPT-4)

2. 考试题目:找 40 篇医学文章

研究人员从 4 本世界顶级的医学期刊(就像 4 个最难的图书馆)里,随机挑了 40 篇最新的医学文章。

  • 任务:让这 5 个 AI 根据这 40 篇文章的摘要,去找出 10 篇相关的参考文献。
  • 要求:不仅要找到书,还要把书的“身份证号”(DOI)、“图书馆编号”(PubMed ID)和“链接”都写对。
  • 总量:一共测试了 2000 条参考文献。

3. 阅卷标准:不仅看“找没找到”,还要看“对不对”

研究人员像严厉的考官一样,人工检查了 AI 找到的每一条信息:

  • 真书还是假书? 书是真的存在吗?
  • 信息对吗? 书的 ISBN 号、作者、年份是不是 AI 瞎编的?
  • 相关性: 这本书真的和题目有关吗?

4. 考试成绩:惨不忍睹,差异巨大

这次考试的平均分非常低,AI 的表现让人大跌眼镜:

  • 总体表现:不及格
    平均来说,AI 找到的参考文献里,有 47.8% 是完全错误的(就像图书管理员给你一本不存在的书,或者把书名、作者全搞错了)。

    • 比喻:如果你让 AI 找 10 本书,平均有 5 本是你根本查不到的“幻影书”。
  • 谁考得最好?谁考得最差?

    • 冠军Grok。它的准确率最高,但也只拿到了 0.57 分(满分 1 分),相当于勉强及格。
    • 垫底Google Gemini。它的表现最糟糕,准确率只有 0.11,而且它找到的书里有 78.5% 是完全错误的(几乎全是幻觉)。
    • 比喻:Grok 像个偶尔会犯错的老实学生,而 Gemini 像个喜欢编故事的“撒谎精”。
  • 不同图书馆的难度不同
    研究发现,AI 在找《新英格兰医学杂志》(NEJM) 的文章时,错误率最高;而在找《英国医学杂志》(BMJ) 的文章时,表现稍好。

    • 原因猜测:可能是因为 NEJM 的文章摘要写得太短,AI 抓不住重点,就像给 AI 的线索太少,它更容易“瞎蒙”。

5. 核心发现:AI 很会“装模作样”

这是论文最让人警惕的地方:

  • AI 很擅长“看起来像真的”:AI 找到的书名、主题往往是对的,甚至很相关。
  • 但细节全是错的:一旦涉及到具体的“身份证号”(DOI)或“链接”,AI 就开始胡编乱造。
  • 比喻:这就像 AI 给你指了一条路,说“前面有一家很好的餐厅”,你走过去一看,餐厅确实存在(主题相关),但门牌号是错的,或者那家店根本不存在(信息幻觉)。如果你信了,就会白跑一趟。

6. 给普通人的建议(结论)

这篇论文告诉我们:

  1. 不要完全信任 AI:在医学、科研这种严肃领域,AI 目前只能当“助手”,不能当“权威”。
  2. 必须人工复核:如果你用 AI 找资料,一定要自己去核实每一个链接、每一个编号。不能直接复制粘贴。
  3. 多问几个“人”:既然不同的 AI 表现差异很大,最好同时用几个不同的 AI 查一下,互相“对对答案”,能发现更多错误。
  4. 提示词没用:研究人员特意让 AI“请确认一下信息”,结果发现这招不管用,AI 还是会自信地编造错误信息。

一句话总结:
现在的 AI 在找医学文献时,就像是一个**“记忆力超群但喜欢瞎编细节的图书管理员”**。它能告诉你大概去哪找书,但如果你不亲自去核对书号,它可能会把你带到错误的书架,甚至一本不存在的书面前。所以,用 AI 可以,但一定要自己再检查一遍!

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →