Building a clinical and academic health research network using data science and artificial intelligence
本研究表明,利用数据科学和人工智能对出版元数据进行系统分析并构建基于图的模型,是为构建专注于英格兰北部酒精、成瘾及心理健康领域的临床与学术研究网络,相较于人工方法而言,一种具有可扩展性、高效性且无偏见的替代方案。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在医学科学领域,解决复杂的健康问题很少是孤立发生的。当研究人员、医生和机构齐心协力时,他们就创建了一个研究网络——一种分享知识、资源和患者的结构化方式,以应对任何个人都无法独自处理的重大问题。这些联盟对于将科学发现转化为现实世界的治疗方案和政策至关重要。然而,建立这些网络传统上是一个缓慢且依赖人工的过程。科学家们通常依赖个人联系、调查或机构记录来寻找谁在从事什么研究。这种方法不仅耗费人力,而且容易出现人为错误,并且随着新专家的涌现和旧团队的解体,会迅速变得过时。这就像试图通过徒步走遍每一寸土地来绘制一片广阔且不断变化的景观;虽然可行,但极其疲惫,而且你可能会错过最重要的路径。
来自赫尔大学(University of Hull)的一个研究小组提出了一种不同的构建连接方式,即利用计算机的速度和模式识别能力。他们提出了一个疑问:数据科学和人工智能是否可以自动找到加入研究网络的人选,特别是针对那些研究英格兰北部酒精、成瘾和心理健康问题的专家。他们没有依赖电话沟通或电子表格,而是构建了一个系统,该系统可以扫描数百万篇科学文章以寻找作者,核实他们的身份,并绘制出谁已经在开展合作。其目标是观察机器是否能够承担起组建网络中的繁重工作,从而创建一个清晰、实时且具有可扩展性和系统性的研究版图图景。
研究人员将注意力集中在英格兰北部,该地区面临着与物质使用和心理健康相关的重大公共卫生挑战。他们希望识别出在该地区活跃从事上述课题研究的学者和临床医生,时间跨度为2020年至2025年。为此,他们求助于PubMed,这是一个庞大的免费医学文献数据库。他们选择了26本专门发表酒精、成瘾和心理健康相关工作的期刊。通过一个计算机程序,他们在这些期刊中搜索了过去五年发表的所有文章。随后,软件提取了作者姓名及其所属的大学或医院。
这类工作的一个主要障碍是许多研究人员姓名相同。为了解决这个问题,团队使用了一个名为ORCID的数字工具,它相当于科学家的唯一身份证。计算机尝试将文章中发现的姓名和所属机构与这些唯一ID进行匹配,以确保不会将某所大学的“约翰·史密斯”与另一所大学的“约翰·史密斯”混淆。一旦作者身份被识别并确认,团队便构建了他们的数字关系图。在这张图中,每位研究人员都是一个点,如果两人共同撰写过论文,则用一条线连接这两个点。这种视觉结构揭示了谁在与谁合作,以及不同群体之间的联系有多紧密。
这次自动化搜索的结果具有启发性。该系统在英格兰北部的21所机构中识别出了420位独特的科研人员。当研究人员观察这些研究人员的分布情况时,他们发现约克郡和亨伯地区(Yorkshire and Humber)最为活跃,产出了181篇论文。西北地区(North West)紧随其后,拥有162篇论文,东北地区(North East)则有55篇。在各大学层面,谢菲尔德大学(University of Sheffield)以94篇论文脱颖而出,其次是约克大学(University of York,57篇)和利物浦大学(University of Liverpool,52篇)。数据显示了一个明显的趋势:尽管此类主题的文章总量在过去几年中略有下降,但北部的专业知识集中度依然显著。
当研究人员检查这些科学家之间的联系时,他们发现了一个连接程度中等的网络。平均而言,每位研究人员与大约七个人进行过合作。地图显示,虽然大部分协作发生在单一大学内部,但不同机构之间也存在着健康的合作关系。谢菲尔德大学成为了约克郡和亨伯地区的中心枢纽,成为许多联系的焦点。然而,该网络并非完美的网状结构;分析表明,在这些研究人员之间,实际存在的协作仅占所有可能协作的约4%,这表明仍有大量的空间可以建立新的合作伙伴关系。
这项研究表明,利用人工智能构建研究网络是可行且强大的替代方案。作者认为,人工方法往往过于缓慢且缺乏一致性,无法满足大规模项目的需求,而他们的自动化方法可以快速生成一份潜在合作者的全面名单。这种方法提供了一种基于实际发表成果而非仅仅基于“谁认识谁”来观察真实研究版图的方式。然而,研究人员也谨慎地指出,他们的方法并非完美无缺。由于该系统依赖于已发表的文章,它可能会遗漏尚未发表作品的早期职业研究人员,或是未在选定期刊上撰文的临床医生。此外,计算机无法为每一位作者都找到唯一的ID,因此部分姓名必须按原样使用,这带来了一定的误差风险。
尽管存在这些局限性,这项工作展示了如何形成并理解研究共同体的清晰路径。通过将浩瀚、混乱的科学文献转化为结构化的地图,这种方法为资助机构和决策者提供了一个识别专业知识分布及潜在缺口的工具。研究结论认为,这种自动化的、数据驱动的方法比传统的组建网络方式有了实质性的提升。它提供了一种系统化识别正在从事相关工作的人员的方法,使得将他们聚集在一起以应对英格兰北部及其他地区复杂健康挑战的任务变得更加容易。这项工作的未来将涉及完善工具以捕捉更多研究人员,并将该软件开放给他人使用,从而使构建这些至关重要的联系成为科学过程中的标准组成部分。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。