← 最新论文
💻 computer science

Large language model-assisted discovery of cohorts from scientific literature

本文提出了一种利用大语言模型自动化提取科学文献中队列名称的问题驱动型框架,展示了其识别青少年攻击性遗传学相关队列的能力,而这些队列往往会被传统的队列目录所遗漏。

原作者: Moritz Sturm, Lisa M. Berg, Inken Berg, Harishny Sarma, Jasmin Hartmann, Denissa Girschik, Gemma Roig, Christine M. Freitag, Andreas G. Chiocchetti

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Moritz Sturm, Lisa M. Berg, Inken Berg, Harishny Sarma, Jasmin Hartmann, Denissa Girschik, Gemma Roig, Christine M. Freitag, Andreas G. Chiocchetti

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代科学的广袤领域中,研究人员经常面临的问题不是寻找新数据,而是寻找正确的旧数据。想象一位科学家想要了解为什么有些儿童会表现出攻击行为。为了得到清晰的答案,他们不能仅仅依赖于由几百人组成的一个单一群体;他们需要整合来自许多不同研究的数千个个体的资料。这个过程被称为多研究分析(multi-study analysis),它要求寻找具有特定特征的特定人群组,这些组被称为“队列”(cohorts):即拥有正确的年龄、正确的病史以及正确的测量类型(如基因代码或脑部扫描)。几十年来,寻找这些群体一直是一个缓慢的手动搜寻过程。科学家们不得不依赖自己的记忆,向同事寻求推荐,或者搜索专门的数据集列表,而这些列表可能无法涵盖每一种可能的科研问题。这些列表很有帮助,但它们通常是按所持有的数据类型而非按科学家想要提出的具体问题来组织的,这使得许多有用的群体隐藏在众目睽眯之下。

来自德国的一个研究团队开发了一种解决这一难题的新方法,将寻找这些数据组的过程转变为一个系统化、自动化的流程。他们没有等待人类逐一阅读成千上万篇科学论文,而是构建了一个数字工作流,利用大型语言模型——一种在海量文本上训练过的人工智能——来充当一名不知疲倦的研究助手。该系统从一个简单的提问开始,例如“哪些研究包含关于攻击性儿童的遗传数据?”随后,计算机将这个问题转化为数百个具体的搜索术语,并搜寻科学文献,提取出数千条文章标题和摘要。人工智能阅读这些摘要,寻找文中提到的特定人群组的名称。它提取这些名称,清理重复项,并将它们整理成一份清单供人类专家审查。

研究人员在寻找与青少年攻击行为相关的遗传研究这一特定挑战上测试了该系统。他们向系统输入了一组涵盖儿童、青少年、攻击行为和遗传学的搜索术语。计算机生成了超过五千个不同的搜索查询,并检索了超过五千条独特的科学记录。从这堆庞大的文本中,人工智能识别出了近两百个潜在的人群组。在人类专家根据严格规则对这些候选对象进行仔细检查后——确保这些组规模足够大、包含十八岁以下的儿童且具备必要的遗传数据——最终确定的合格队列为四十四个。这四十四个组代表了近九十万名参与者的总和,这种规模的数据如果靠手工收集,将会极其困难且耗时。

该团队还想知道,他们的新方法是否发现了那些旧有的、既定列表所遗漏的内容。他们将这四十四个合格组的名单与科学家通常依赖的四个主要知名数据库的结果进行了对比。当使用相同的问题进行搜索时,既定数据库找到了这四十四个组中的二十七个。然而,它们完全遗漏了新开发的基于文献的系统所发现的十七个组。这一差距表明,传统的列表并不是可用数据的完整地图。这种新方法并非要取代旧有的列表,而是作为一种强大的补充,揭示了那些被记录在科学论文中、但尚未被编入中央目录的宝贵资源。

为了确保人工智能的工作正确无误,研究人员将它的工作成果与人类专家进行了对比。他们要求两名人类评审员检查一组随机抽取的科学论文,以查看其中是否包含正确的组别。评审员之间并不总是达成一致,这在解释复杂文本时很常见,但人工智能的表现完全处于人类共识的范围内。它在避免“虚假警报”方面表现得非常出色,这意味着它很少在论文并不包含某个组的情况下声称其包含。虽然它错过了一些人类发现的组别,但其在极短时间内处理数千篇论文的能力,使其成为一个实用且可靠的工具。与被其取代的数百小时人力劳动相比,整个过程从搜索到提取名称所消耗的计算资源微乎其微。

研究结论指出,这种方法为针对任何特定研究问题构建数据组列表提供了一种实用且灵活的方式。通过将研究者的好奇心转化为对科学记录的系统性搜索,该方法将庞大且碎片化的已发表论文转化为了可用的数据清单。它不需要预先存在的组别列表即可工作;它通过阅读科学家已经讲述的关于其工作的“故事”来发现这些组别。这种能力对于那些没有中央数据库的利基研究领域,或对于跨越不同类型数据的研究问题而言,具有特别重要的价值。研究人员已向公众开放了他们的工具以及由此产生的四十四个青少年攻击行为队列的名单,邀请他人使用这种方法来发现各自领域的资料。这项工作证明,虽然经过人工整理的数据列表至关重要,但科学文献本身也蕴藏着一个互补的宝库,现在借助智能自动化工具,我们可以轻松获取其中的信息。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →