← 最新论文
💻 computer science

Auxiliary uncertainty signals for LLM-assisted systematic review screening: a benchmark across eight Cohen drug-class reviews

本文证明了通过集成一个提供结构化不确定性信号的辅助 BERT+GCN 分类器,可以显著提高大语言模型辅助系统评价筛选的效率和召回率,确定了一种仅将“可能(MAYBE)”案例路由至大语言模型的帕累托最优策略,并揭示了当前的指令微调模型缺乏对其自身决策进行自我分诊的能力。

原作者: Arya Rahgozar, Pouria Mortezaagha

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Arya Rahgozar, Pouria Mortezaagha

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在医学研究领域,理解一种疗法最可靠的方法是系统评价(systematic review)。这是一项规模宏大且严谨的工作,专家们收集所有已发表的关于特定主题的研究,阅读它们,并决定哪些研究足够优秀,可以计入最终答案。这一过程中第一步也是最艰苦的一步是筛选。研究人员必须查看成千上万个标题和摘要(论文的简短总结),并决定哪些需要全文阅读,哪些应当舍弃。这项任务消耗了数百小时的专家时间,往往感觉就像是在大海捞针。最近,科学家们开始利用大语言模型——即那些能够写论文和回答问题的强大计算机程序——来辅助这项筛选工作。这些模型阅读速度很快,可以建议保留哪些论文,但它们有一个显著的缺陷:它们不知道自己何时处于不确定状态。当一个计算机程序说“保留这篇论文”时,它可能非常确定,也可能是在猜测,而人类评审员无法分辨其中的区别。这种不确定性造成了一个瓶颈,因为评审员无法轻易知道计算机的哪些建议值得人类进行二次查看。

渥太华大学和渥太华医院研究所的一个研究小组试图通过给计算机提供“第二意见”来解决这个问题。他们构建了一个专门的系统,作为主要筛选程序的安全网。这个系统结合了一个文本阅读引擎和一个理解论文之间相互联系的网络,它会在主程序之前阅读每一篇论文。随后,它会分配一个简单的标签:保留、舍弃或“也许”。“也许”标签是最重要的部分;它标志着系统感到困惑,或者该论文处于相关性的边缘。研究人员测试了将这种“也许”信号传递给主程序程序的不同方式。他们想看看,如果告诉主程序:“嘿,这篇很棘手,这是来自我们安全网的备注,”是否能在不浪费时间或金钱的情况下帮助它做出更好的决策。他们在八组不同的医学数据上进行了实验,涉及数千篇论文,以观察哪种方法效果最好。

结果显示,仅仅将“也许”警告传递给主计算机是最有效的策略。当研究人员告诉计算机仅对被标记为“也许”的论文给予额外关注时,该系统在寻找正确论文方面的准确度变得更高,且成本与不做任何特殊处理几乎持平。事实上,这种针对性的方法实现了性能与成本的最佳平衡。它实现了最高的正确论文发现率,且仅增加了极微小的计算资源消耗。相比之下,研究人员发现,如果向计算机告知安全网的信息(即使是对那些容易处理的论文),虽然能略微提高准确度,但运行成本却显著增加。然而,最令人惊讶的发现是关于计算机如何处理其自身的不确定性。研究人员尝试了一种方法:让计算机阅读一篇论文,说出“我不确定”,然后立即结合安全网的笔记再次阅读该论文,以观察它是否会改变主意。这种方法完全失败了。即使计算机承认自己不确定,并且得到了额外的帮助,它也从未改变最初的决定。它固守于最初的猜测,即使那个猜测很可能是错误的。这表明,这些计算机程序无法有效地实时重新评估自身的不确定性;当它们感到困惑时,需要人类介入,而不是试图自行解决问题。

研究还表明,他们构建的复杂安全网可以被简化。该系统使用两种不同的测试来决定一篇论文是否为“也许”,但研究人员发现其中一种测试在他们使用的数据中从未被触发。如果整个安全网仅依赖于一个简单的检查——即系统对其答案的信心程度——其功能表现得同样出色。这意味着其他研究人员可以构建类似的工具,而无需使用最初设计的复杂多部分机制。此外,这种安全网带来的益处并不取决于主计算机程序的强大程度。无论他们使用的是更新、更先进版本的软件还是旧版本,安全网都能提供同样的准确度提升。这说明安全网是一个可靠且独立的助手,它与主程序协同工作,而不仅仅是为较弱的模型填补空白。

对于从事这些医学综述工作的团队来说,未来的路径是清晰的。他们不应依赖筛选计算机去识别自身的困惑并请求帮助。相反,他们应该使用一个更简单的独立系统来标记困难论文,并将这些特定的标记反馈给主计算机。这种方法既能获得拥有“第二意见”的好处,又不会因为对每篇论文都进行两次检查而产生高昂的成本。研究人员已将其所有的代码、数据和工具向公众开放,允许其他科学家复制这些工作并将这些方法应用于他们自己的综述中。通过准确了解计算机何时需要帮助以及何时不需要帮助,医学研究人员可以加速寻找救命证据的过程,确保在不给负责最终工作的专家增加负担的情况下,能够审查到正确的研究。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →