Do AI chatbots find what experts would? Effects of model, user role, and sample size on study retrieval for medical questions
本研究评估了三种大语言模型聊天机器人进行医学问答的表现,发现检索性能因模型和用户角色而异,其中 ChatGPT 的表现优于其他模型,且所有模型都表现出倾向于引用大型临床试验的偏好。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图为一道特定的菜肴寻找最佳食谱,但你不是去请教厨师,而是向一个读过几乎所有烹饪书籍的超级聪明机器人求助。这个机器人是一个“大语言模型”(LLM),一种通过预测句子中下一个词来聊天、写作和回答问题的 AI 聊天机器人。在医学领域,这些机器人正变得越来越受欢迎,因为它们可以快速总结复杂的健康问题,并为你提供支持其建议的研究文献。但问题在于:这些机器人有时会编造事实,或者产生“幻觉”,引用并不存在的研究。更糟糕的是,它们可能会完全遗漏最重要的研究。这篇论文提出了一个简单但至关重要的问题:如果一位人类专家(如医学研究人员)已经完成了为特定医学问题寻找“完美”研究清单的艰苦工作,那么这些 AI 机器人能否找到同样的清单?它们的表现更像是一个好奇的患者、一位忙碌的医生,还是一位严肃的研究员?此外,研究规模的大小会对机器人产生影响吗?
研究作者决定对三种最新、最强大的 AI 聊天机器人进行测试。他们将这些聊天机器人视为正在参加一项非常特定考试的学生。“测试题目”是取自 2026 年 Cochrane 系统评价数据库(这就像是一个由专家团队已经收集并审核了针对特定健康问题的最佳证据的金标准图书馆)的 20 个真实医学主题。对于这 20 个主题中的每一个,研究人员都要求聊天机器人找到支持答案的原始研究(即“初级来源”)。为了观察机器人的“个性”是否起作用,他们用三种不同的方式提出了同样的问题:一次像是患者在提问,一次像是临床医生(医生)在提问,另一次则是像是证据合成研究员(专门从事寻找数据的科学家)在提问。他们对每种组合都进行了四次完整的实验,以确保结果并非偶然,最终得到了 720 个总答案进行分析。
结果既有“还不错”的一面,也有“令人惊讶的偏见”。平均而言,单个聊天机器人的回答仅能找到人类专家已经确定的“正确”清单中约 39.2% 的研究。这意味着,如果专家找到了 10 项完美的的研究,机器人通常只能找到大约 4 项。然而,机器人的类型差异很大。ChatGPT 是明显的赢家,它找到了专家研究中的 63.1%。Claude 位居中间,找到了 37.0%,而 Gemini 则表现最差,仅找到了 17.3%。有趣的是,“用户身份”也起到了微小的作用:当提示词是以研究员的角度编写时,机器人找到的研究更多(42.8%),而以患者(36.1%)或临床医生(38.6%)的角度编写时,找到的研究则较少。
但最引人注目的发现是关于机器人选择了哪些研究。研究人员观察了机器人成功检索到的研究与它们遗漏的研究之间的特征。他们发现,机器人对具有大样本量(即测试更多受试者的研究)的研究有着巨大的偏好。即使在控制了研究的新颖程度、被他人引用的频率或是否免费阅读之后,样本量仍然是唯一能可靠预测机器人是否会找到该研究的因素。样本量对数每增加一个单位,机器人找到该研究的概率就会跃升 1.80 倍。这就像聊天机器人内置了一种偏见,认为:“如果一项研究有庞大的参与人群,那它一定是其中最重要的。”从而忽略了虽然规模较小但同样有效的研究。
该研究还检查了机器人是否在编造虚假研究或出错。它们并没有发明很多虚假研究(这得益于它们先进的推理能力,是一个好迹象),但大约有 3% 的时间会出现“元数据错误”。这意味着它们可能会引用一项真实的研究,但弄错了作者姓名、年份或期刊名称。Claude 出现此类错误的频率最高(5.9%),而 Gemini 最为准确(0.2%)。
最后,论文指出,尽管这些 AI 聊天机器人在寻找医学证据方面正在变得更好,但它们目前还不能完全替代人类专家。它们是不完整的,会根据你扮演的角色而改变答案,并且对大型、著名的研究有着强烈的偏好。如果你使用聊天机器人来寻找医学研究,你可能会得到一份“热门作品”清单,但很可能会错过那些专家认为同样重要的、规模较小但更安静的研究。作者得出结论,这些工具应被视为能够为你指明方向的有益助手,而非关于医学证据实际情况的最终权威。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。