← 最新论文
📄 psychiatry and clinical psychology

Evaluation of Elicit as an adjunct search, screening, and data extraction tool for systematic reviews

本研究评估了 Elicit 作为系统综述 AI 工具的表现,发现虽然它在节省时间及数据提取能力方面具有显著优势,但其检索重叠度差以及筛选精准度低的问题表明,目前它仅适合作为辅助工具,而非系统综述流程的独立替代品。

原作者: Wei, I., Shah, J. N., Miah, A., Hawco, C., Coutts, F., Sikstrom, L., Ameis, S. H., Voineskos, A. N., Glatard, T., Dickie, E. W.

发布于 2026-10-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Wei, I., Shah, J. N., Miah, A., Hawco, C., Coutts, F., Sikstrom, L., Ameis, S. H., Voineskos, A. N., Glatard, T., Dickie, E. W.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在医学研究领域,系统综述被视为真理的基石。这是一个严谨的过程,科学家们收集针对特定问题的所有可用研究,极其仔细地筛选它们,并将研究结果结合起来,以确定关于某一健康问题的已知真相。这种方法对于做出治疗决策的医生和制定健康指南的政策制定者至关重要,但其过程也以艰辛著称。这一过程缓慢、昂贵,且需要巨大的体力投入,研究团队往往需要花费数年时间阅读数千篇标题和摘要,以决定哪些论文属于最终分析的一部分。随着每天发表的科学文献量不断增加,紧跟新文献的庞大任务已变得令人难以承受,这使得许多人开始思考人工智能是否可以承担这一沉重负担。

来自多伦多成瘾与精神健康中心(Centre for Addiction and Mental Health)的一个团队最近开展了一项研究,通过测试一款名为 Elicit 的特定人工智能工具,探索了这种可能性。研究人员想知道,这款软件是否能够复制人类团队进行系统综述的工作。为了找出答案,他们选取了一项由他们小组已经手动完成的综述——一项关于青少年早期轻微精神症状是否能预测后期精神健康诊断的研究——并要求 Elicit 完成完全相同的工作。他们将 AI 的结果与人类团队的工作在每一个阶段都进行了对比,从最初的论文检索到最终的数据提取,衡量了 AI 找到了多少正确研究、遗漏了多少,以及节省了多少时间。

结果显示,该工具功能强大,但尚未准备好独立工作。在初始检索阶段,Elicit 表现得非常吃力。当人类团队使用传统检索方法找到 5,000 多篇相关研究时,Elicit 的搜索引擎仅发现了其中 158 篇。这意味着 AI 遗漏了人类识别出的绝大部分研究,这表明其目前的搜索能力还不够广泛,无法取代人类研究人员进行的细致、结构化搜索。然而,一旦研究论文呈现在它面前,AI 就展现出了更多的潜力。在筛选阶段,即研究人员决定一篇论文是否具有足够的关联性以进行全文阅读时,Elicit 的表现尚可。它成功识别了大多数重要的研究,但也犯了一种特定的错误:它倾向于包含那些本应被排除的论文。它过于谨慎,将会议海报和摘要也纳入其中,而这些并非完整的研究论文,并且有时会误判一项研究是否具备正确的医疗诊断数据。

最令人鼓舞的发现出现在数据提取阶段,即 AI 尝试从选定的论文中提取特定的数字和事实。Elicit 被证明是一个得力的助手,在几乎所有情况下都能成功找到基本细节(如作者姓名、出版年份和研究国家)的精确匹配。即使它没有找到完美的数字,它也经常提供一段来自原文的句子,引导人类读者找到正确的信息,这极大地节省了时间。对于更复杂的细节,例如参与者的确切年龄或特定的统计结果,AI 的精确度较低,有时会从研究中的错误组别中提取数据,或者遗漏最终计算所需的特定数值。尽管存在这些缺陷,但速度上的差异却是惊人的。人类团队完成了整个综述过程耗费了近 445 个工时,涉及多名研究人员对每一步进行复核。而 AI 完成相同任务仅用了三个多小时。

最终,研究结论认为 Elicit 是一个有价值的伙伴,而非替代品。它目前还无法独立运行系统综述,因为它在搜索阶段遗漏了太多研究,并在筛选阶段犯了太多错误,无法在没有监督的情况下被信任。然而,它快速扫描文档并指向特定句子的能力,使其成为加速人类研究人员工作的优秀工具。作者建议,最好的方法是将 AI 作为第二或第三名评审员,让它处理寻找信息的繁重工作,同时由人类专家进行监督,以纠正错误并确保最终结果的准确性。通过这种方式,这项技术可以在不牺牲医学科学所需的可靠性的前提下,降低研究的时间和成本。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →