← 最新论文
💻 computer science

Cost-Efficient Large Language Model-Assisted Title­­ and Abstract Screening for Systematic Reviews: Method Evaluation and Validation

本研究表明,经过精心构建的大型语言模型工作流,特别是那些采用少样本提示(few-shot prompting)和显式推理的工作流,可以在实现系统评价筛选高灵敏度的同时,以极低的成本减少 80% 以上的人工投入。

原作者: Dimitri Belenki, Alexander Astanin, Dan Baaken, Heinrich A. M. Leymann, Felix Meyer, Blanka Pophof, Evelyn Weiser

发布于 2026-09-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Dimitri Belenki, Alexander Astanin, Dan Baaken, Heinrich A. M. Leymann, Felix Meyer, Blanka Pophof, Evelyn Weiser

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

每年,世界都在产生惊人的新科学论文浪潮。从医学到环境健康等各个领域,研究人员发表的研究比以往任何时候都多,创造了任何单个团队都无法在有生之年读完的信息洪流。为了从这种混乱中理出头绪,科学家们依赖于一种被称为“系统评价”(systematic review)的严谨过程。这并非对文献的随手浏览,而是一种有条不紊的搜寻,旨在寻找每一个能够回答特定问题的研究,例如某种化学物质是否会导致危害,或者一种新药是否比旧药更有效。这一搜寻过程中第一步,也是往往最令人精疲力竭的一步,是筛选。研究人员必须阅读成千上万篇文章的标题和简短摘要,瞬间决定哪些值得保留,哪些应该丢弃。如果在这一阶段遗漏了一项相关的研究,整个评价可能会出现偏差,导致对健康和安全的错误结论。几十年来,这一直是一项完全由人类眼睛完成的工作,是一个缓慢、昂贵且劳动密集型的瓶颈,延迟了获取关键答案的过程。

来自德国联邦辐射防护局的一个研究小组现在测试了一种应对这一问题的新方法,即使用人工智能。他们探索了大型语言模型——能够理解并生成人类语言的高级计算机程序——是否可以充当第一道过滤器,通过阅读这些成千上万的标题和摘要,来决定哪些值得人类关注。其目标不是取代人类评审员,而是作为一个强大的助手,承担繁重的工作,在剔除绝大多数无关论文的同时,确保绝不会意外丢弃任何重要的研究。研究人员将此视为一项科学实验,构建并测试了数十种不同的向计算机下达任务的方式,在信任其处理真实数据之前,仔细测量每种方法的有效程度。

该团队首先创建了一个受控的测试场。他们生成了100份合成的科学论文摘要,其中一半被设计为符合严格的纳入标准,另一半被设计为不符合标准。利用这组小规模样本,他们尝试了各种各样的策略。有些策略要求计算机给出简单的“是”或“否”的回答。另一些策略则要求它将决策过程拆解开来,分别评估研究设计的五个特定部分:涉及的人群、暴露或处理、对照组、测量的结果以及研究类型。他们还测试了在要求计算机判断新论文之前,先给它一些好论文和坏论文的例子是否有助于提高效率,以及要求计算机解释其每项决策背后的推理过程是否能提高准确性。他们在开源模型(可以在本地计算机上运行)和来自主要技术公司的商业模型上进行了这些测试,并对比了它们的运行速度、成本和准确性。

在确定了最佳方法后,研究人员进入了一个更严格的阶段,将他们的顶级候选方案应用于三个已经由人类专家完成的真实世界系统评价。这些评价侧重于射频电磁场的健康影响,这是该研究团队非常熟悉的课题。在这里,计算机的任务是查看原始搜索中的数千个标题和摘要,并决定哪些是人类最终保留的研究。结果令人瞩目。最成功的流程能够识别出几乎所有人类纳入的研究,敏感度达到了96%以上。这意味着,如果在一堆数千篇文献中隐藏着100篇相关研究,计算机也能找到至少96篇。同时,该系统能够正确识别并丢弃绝大多数无关论文,将人类需要阅读的记录数量减少了80%以上。

研究还表明,计算机模型的大小并不如其工作方式重要。研究人员发现,最有效的方法并不是使用现有的最大、最昂贵的模型,而是使用较小的、更具成本效益的模型,并辅以特定的引导方法。这种方法包括要求模型分别观察研究设计的五个关键部分,并对接受或拒绝每一部分的原因提供简短的解释。这种循序渐进的推理过程,结合一些关于好研究或坏研究的示例,使得即使是较小的、更便宜的模型也能表现出接近人类的准确度。研究人员发现,将任务拆分为五个独立的并行问题让计算机回答,实际上反而降低了准确度,这表明计算机在整体考虑全局的同时进行细节分析时效果最好。

当研究小组将他们表现最好的流程应用于涵盖癌症研究到关节炎治疗等八个完全不同的系统评价时,结果依然成立。该系统始终能找到几乎所有的相关研究,同时过滤掉噪音。运行这一过程的成本极低,大约每筛选1,000条记录仅需1美元左右。这表明该技术不仅是一个理论上的可能性,更是一个实用的工具,可以被预算有限的研究团队所使用。研究人员指出,该系统并非完美无缺;它有时会在处理信息极少的论文(例如只有标题而没有摘要的论文)时遇到困难。在这种情况下,系统会明智地将该论文标记出来供人类检查,从而确保重要内容不会丢失。

研究结论认为,人工智能现在可以作为科学过程中一个高度可靠的伙伴。通过使用精心设计的流程,要求计算机循序渐进地思考标准并解释其选择,研究人员可以大幅缩减文献综述所需的时间和精力。这并不意味着人类已经过时,而是意味着他们可以将精力集中在真正重要的论文上,并确信计算机已经完成了初步的筛选工作。这项工作提供了一个清晰、透明的框架,展示了如何负责任地使用这项技术,为在科学知识增长速度超过人类处理能力的时代,提供了一条实现更快、更高效证据合成的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →