Errors in AI-Assisted Retrieval of Medical Literature: A Comparative Study
该研究通过评估 5 种主流大语言模型在检索 40 篇顶级医学期刊文章参考文献时的表现,发现其完全检索失败率高达 47.8%,且准确率在不同模型和期刊间存在显著差异,提示在使用 AI 辅助医学文献检索时必须仔细核查书目数据。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是在给现在的"AI 助手”们做了一场严格的“期末考试”,主题是:当医生或研究人员让 AI 帮忙找医学文献时,AI 到底靠不靠谱?
为了让你更容易理解,我们可以把这项研究想象成**“让五个不同的图书管理员去图书馆找书”**的故事。
1. 故事背景:五个图书管理员(AI 模型)
研究人员找了 5 个目前最流行的免费 AI 助手(就像 5 个不同性格的图书管理员):
- Grok (Grok-2)
- ChatGPT (GPT-4.1)
- Google Gemini (Flash 2.5)
- Perplexity AI
- DeepSeek (GPT-4)
2. 考试题目:找 40 篇医学文章
研究人员从 4 本世界顶级的医学期刊(就像 4 个最难的图书馆)里,随机挑了 40 篇最新的医学文章。
- 任务:让这 5 个 AI 根据这 40 篇文章的摘要,去找出 10 篇相关的参考文献。
- 要求:不仅要找到书,还要把书的“身份证号”(DOI)、“图书馆编号”(PubMed ID)和“链接”都写对。
- 总量:一共测试了 2000 条参考文献。
3. 阅卷标准:不仅看“找没找到”,还要看“对不对”
研究人员像严厉的考官一样,人工检查了 AI 找到的每一条信息:
- 真书还是假书? 书是真的存在吗?
- 信息对吗? 书的 ISBN 号、作者、年份是不是 AI 瞎编的?
- 相关性: 这本书真的和题目有关吗?
4. 考试成绩:惨不忍睹,差异巨大
这次考试的平均分非常低,AI 的表现让人大跌眼镜:
总体表现:不及格
平均来说,AI 找到的参考文献里,有 47.8% 是完全错误的(就像图书管理员给你一本不存在的书,或者把书名、作者全搞错了)。- 比喻:如果你让 AI 找 10 本书,平均有 5 本是你根本查不到的“幻影书”。
谁考得最好?谁考得最差?
- 冠军:Grok。它的准确率最高,但也只拿到了 0.57 分(满分 1 分),相当于勉强及格。
- 垫底:Google Gemini。它的表现最糟糕,准确率只有 0.11,而且它找到的书里有 78.5% 是完全错误的(几乎全是幻觉)。
- 比喻:Grok 像个偶尔会犯错的老实学生,而 Gemini 像个喜欢编故事的“撒谎精”。
不同图书馆的难度不同
研究发现,AI 在找《新英格兰医学杂志》(NEJM) 的文章时,错误率最高;而在找《英国医学杂志》(BMJ) 的文章时,表现稍好。- 原因猜测:可能是因为 NEJM 的文章摘要写得太短,AI 抓不住重点,就像给 AI 的线索太少,它更容易“瞎蒙”。
5. 核心发现:AI 很会“装模作样”
这是论文最让人警惕的地方:
- AI 很擅长“看起来像真的”:AI 找到的书名、主题往往是对的,甚至很相关。
- 但细节全是错的:一旦涉及到具体的“身份证号”(DOI)或“链接”,AI 就开始胡编乱造。
- 比喻:这就像 AI 给你指了一条路,说“前面有一家很好的餐厅”,你走过去一看,餐厅确实存在(主题相关),但门牌号是错的,或者那家店根本不存在(信息幻觉)。如果你信了,就会白跑一趟。
6. 给普通人的建议(结论)
这篇论文告诉我们:
- 不要完全信任 AI:在医学、科研这种严肃领域,AI 目前只能当“助手”,不能当“权威”。
- 必须人工复核:如果你用 AI 找资料,一定要自己去核实每一个链接、每一个编号。不能直接复制粘贴。
- 多问几个“人”:既然不同的 AI 表现差异很大,最好同时用几个不同的 AI 查一下,互相“对对答案”,能发现更多错误。
- 提示词没用:研究人员特意让 AI“请确认一下信息”,结果发现这招不管用,AI 还是会自信地编造错误信息。
一句话总结:
现在的 AI 在找医学文献时,就像是一个**“记忆力超群但喜欢瞎编细节的图书管理员”**。它能告诉你大概去哪找书,但如果你不亲自去核对书号,它可能会把你带到错误的书架,甚至一本不存在的书面前。所以,用 AI 可以,但一定要自己再检查一遍!
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。