✨ 要点🔬 技术摘要
在医学研究领域,系统综述被视为真理的基石。这是一个严谨的过程,科学家们收集针对特定问题的所有可用研究,极其仔细地筛选它们,并将研究结果结合起来,以确定关于某一健康问题的已知真相。这种方法对于做出治疗决策的医生和制定健康指南的政策制定者至关重要,但其过程也以艰辛著称。这一过程缓慢、昂贵,且需要巨大的体力投入,研究团队往往需要花费数年时间阅读数千篇标题和摘要,以决定哪些论文属于最终分析的一部分。随着每天发表的科学文献量不断增加,紧跟新文献的庞大任务已变得令人难以承受,这使得许多人开始思考人工智能是否可以承担这一沉重负担。
来自多伦多成瘾与精神健康中心(Centre for Addiction and Mental Health)的一个团队最近开展了一项研究,通过测试一款名为 Elicit 的特定人工智能工具,探索了这种可能性。研究人员想知道,这款软件是否能够复制人类团队进行系统综述的工作。为了找出答案,他们选取了一项由他们小组已经手动完成的综述——一项关于青少年早期轻微精神症状是否能预测后期精神健康诊断的研究——并要求 Elicit 完成完全相同的工作。他们将 AI 的结果与人类团队的工作在每一个阶段都进行了对比,从最初的论文检索到最终的数据提取,衡量了 AI 找到了多少正确研究、遗漏了多少,以及节省了多少时间。
结果显示,该工具功能强大,但尚未准备好独立工作。在初始检索阶段,Elicit 表现得非常吃力。当人类团队使用传统检索方法找到 5,000 多篇相关研究时,Elicit 的搜索引擎仅发现了其中 158 篇。这意味着 AI 遗漏了人类识别出的绝大部分研究,这表明其目前的搜索能力还不够广泛,无法取代人类研究人员进行的细致、结构化搜索。然而,一旦研究论文呈现在它面前,AI 就展现出了更多的潜力。在筛选阶段,即研究人员决定一篇论文是否具有足够的关联性以进行全文阅读时,Elicit 的表现尚可。它成功识别了大多数重要的研究,但也犯了一种特定的错误:它倾向于包含那些本应被排除的论文。它过于谨慎,将会议海报和摘要也纳入其中,而这些并非完整的研究论文,并且有时会误判一项研究是否具备正确的医疗诊断数据。
最令人鼓舞的发现出现在数据提取阶段,即 AI 尝试从选定的论文中提取特定的数字和事实。Elicit 被证明是一个得力的助手,在几乎所有情况下都能成功找到基本细节(如作者姓名、出版年份和研究国家)的精确匹配。即使它没有找到完美的数字,它也经常提供一段来自原文的句子,引导人类读者找到正确的信息,这极大地节省了时间。对于更复杂的细节,例如参与者的确切年龄或特定的统计结果,AI 的精确度较低,有时会从研究中的错误组别中提取数据,或者遗漏最终计算所需的特定数值。尽管存在这些缺陷,但速度上的差异却是惊人的。人类团队完成了整个综述过程耗费了近 445 个工时,涉及多名研究人员对每一步进行复核。而 AI 完成相同任务仅用了三个多小时。
最终,研究结论认为 Elicit 是一个有价值的伙伴,而非替代品。它目前还无法独立运行系统综述,因为它在搜索阶段遗漏了太多研究,并在筛选阶段犯了太多错误,无法在没有监督的情况下被信任。然而,它快速扫描文档并指向特定句子的能力,使其成为加速人类研究人员工作的优秀工具。作者建议,最好的方法是将 AI 作为第二或第三名评审员,让它处理寻找信息的繁重工作,同时由人类专家进行监督,以纠正错误并确保最终结果的准确性。通过这种方式,这项技术可以在不牺牲医学科学所需的可靠性的前提下,降低研究的时间和成本。
技术摘要:评估 Elicit 作为系统评价中辅助搜索、筛选及数据提取工具的效能
问题陈述 系统评价是循证医学和政策制定的基础,但其过程极其耗时、成本高昂且易于出现人为错误,完成过程往往需要超过 67 周。已发表文献的数量呈爆炸式增长,促使研究人员探索利用人工智能(AI)来支持综述过程。尽管像 Elicit.org 这样的 AI 工具声称能够利用语义相似性和大语言模型来复制系统评价的工作流,但关于其准确性、可靠性以及引入偏倚的可能性,人们仍持有疑虑。先前的评估结果褒贬不一,一些研究指出其在筛选阶段敏感度较低,并在数据提取过程中存在“幻觉(confabulation)”现象。目前缺乏经过同行评审的证据,能够详细说明 Elicit 在与严格的人工标准进行对比时,在系统评价所有阶段(特别是在涉及精神病性谱系症状 [PSS] 等异质性度量指标的复杂精神健康研究背景下)的表现。
方法论 作者通过尝试使用 Elicit 复现近期完成的一项人工系统评价及元分析(Shah 等人),进行了对比评估。该人工评价研究了青少年精神病谱系症状是否预测随后的精神健康诊断,遵循 PRISMA 指南并使用 Covidence 平台。
人工标准: 一个由 4–5 名评审员组成的团队进行了标题/摘要的双重筛选,随后进行了数据提取。检索结果为 5,285 项研究,最终有 41 项研究被纳入元分析。
Elicit 方案: 单个用户使用“专业版(Pro-tier)”Elicit 订阅进行过程复现。研究问题直接输入 Elicit 的语义搜索中。为确保可比性,Elicit 的初始搜索结果(上限为 1,000 项研究)通过手动评价中进入全文筛选阶段的 233 项研究(排除重复项)进行了补充。
筛选配置: Elicit 的筛选阈值设置为默认的 2.5/5。针对四项特定的纳入/排除规则启用了“严格标准(Strict criteria)”功能:诊断结果、随访时长(>1 年)、研究设计(排除综述/海报)以及出版日期。
数据提取: 将 Elicit 的提取结果与 41 项纳入研究中的 34 项进行人工提取对比。匹配得分采用 0(不准确)到 2(完全匹配)的评分制,并特别关注即使在没有精确匹配的情况下,该工具是否提供了“有帮助的”特定句子引用。
指标: 本研究计算了搜索、筛选和提取阶段的准确率(accuracy)、精确率(precision)、敏感度(sensitivity)、错误率以及人时节省量(person-time savings)。
关键结果
搜索表现: Elicit 的语义搜索与人工搜索策略的重叠度较低。它仅识别出人工检索到的 5,285 项研究中的 158 项(重叠率为 15.8%),其精确率为 0.158。值得注意的是,最终人工元分析中包含的研究有 66% 未被 Elicit 的搜索功能返回。
筛选表现:
摘要筛选: Elicit 显示出中等的准确率(0.63)和敏感度(0.71),但精确率(0.68)较低,具有向假阳性倾斜的趋势。
全文筛选: 准确率保持在中等水平(0.74),敏感度为 0.78,但精确率显著下降至 0.38。
错误分析: 该工具表现出假阳性的偏差,错误地包含了会议摘要、海报以及具有错误诊断结果(例如,使用症状加重而非正式诊断)的研究。相反,当 Elicit 未能识别有效的诊断结果或因评分低于阈值而排除了符合标准的研究所产生的假阴性也确实存在。
数据提取:
准确性: 对于简单的元数据(作者、年份、国家),Elicit 实现了较高的精确匹配率(91–97%)。
细微数据: 对于复杂变量,性能有所下降。“平均年龄”的精确匹配率为 61%,而“效应(用于元分析的统计值)”的匹配率最低,为 65%。
帮助程度: 即使未找到精确匹配,Elicit 在所有标准中仍有 85% 的情况提供了“有帮助”的信息(例如,提供年龄范围而非平均值,或提供特定句子的引用)。
时间效率: 最显著的发现是人时的减少。人工评价需要 444.97 小时(涉及多名评审员),而 Elicit 辅助的过程仅耗时 3.16 小时。
核心贡献 本研究在复杂的精神医学领域,提供了 Elicit 相对于人类主导的系统评价在各个阶段的细粒度对比。它量化了效率与准确性之间的权衡,证明了虽然 Elicit 大幅减少了时间投入,但目前仍缺乏作为独立使用所需的全面文献检索召回率和筛选精确度。本文强调了特定的失效模式,例如无法区分“症状加重”与“正式诊断”,以及难以从包含多种亚组分析的论文中提取特定统计效应的问题。
意义与主张 作者得出结论,Elicit 具有作为辅助工具的前景 ,但尚未准备好作为系统评价过程的独立替代品 。
搜索: 搜索结果的低重叠度表明,Elicit 目前无法取代传统的数据库检索(如 Ovid Medline, PsycINFO)以实现全面的文献识别。
筛选: 高假阳性率和中等敏感度表明,Elicit 可以作为“第二评审员”来捕捉潜在的纳入研究,但仅依赖它存在排除相关研究(假阴性)或纳入无关研究(假阳性)的风险。
提取: 该工具提供特定句子引用的能力使其成为数据提取中有价值的效率辅助工具,可能允许单个人类评审员监督整个过程,而非需要双重筛选。然而,对于细微的数据点(如效应量和随访时长),人类的监督仍然至关重要。
本文提倡一种混合工作流,即让 Elicit 充当第二或第三评审员以加速过程,并通过人类裁决来解决冲突,而不是试图实现全自动化审查。
每周获取最佳 psychiatry and clinical psychology 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。