ResLit: A Large-Scale Automated Literature Mining Database for Antimicrobial Resistance
ResLit 是一个免费开放的大规模自动化数据库,它利用先进的 AI 模型从数百万篇科学论文中挖掘并提取抗生素耐药基因、突变、生物体及机制,为研究界提供了一个全面的、具有证据链接的资源。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在细菌的微观世界中,一场无声的斗争正在不断进行。这些单细胞生物正在学习如何生存于旨在杀死它们的药物之中,这种现象被称为抗生素耐药性。当细菌产生这种能力时,即使在接触抗生素后仍能继续繁殖,这使得感染变得更难治疗,对人类也更加危险。科学家们早已知晓,理解这种生存能力的的关键在于细菌的遗传密码。它们基因中的特定变化,或某些特定遗传序列的存在,充当了允许它们抵抗药物的指令。然而,科学界面临着一个巨大的障碍:研究发表的数量极其庞大。每天都有新的研究发布,描述这些遗传变化,创造了过于浩瀚的信息洪流,以至于任何人类团队都无法独自完成阅读、分类和关联工作。
为了解决这个问题,研究人员开发了一种名为 ResLit 的新型数字化工具,它充当了这些研究成果的庞大自动化图书馆。该团队并没有依赖人工去阅读数百万篇论文,而是创建了一个计算机系统,能够扫描整个科学文献领域。这一过程始于来自全球医学研究数据库的两百万条候选研究记录的海量池。系统首先使用专门的计算机程序阅读这些论文的摘要,并识别哪些论文确实是关于抗生素耐药性的。这一初步筛选将范围缩小到了 356,000 篇相关论文。随后,系统致力于检索这些文档的全文,并成功收集了 117,000 份完整研究。
一旦研究人员获得了这些全文,系统就会对最重要的特定数据点进行详细提取。它寻找耐药基因的名称、遗传密码中的特定突变或变化、涉及的细菌类型,以及它们对抗药物所使用的机制。为了确保准确性,这一提取过程分两个细致的步骤进行。最终结果是一个包含 3,120 个不同基因和 13,593 个特定突变的公共数据库。这些发现并非孤立列出;系统通过与另外三个主要的、已建立的遗传数据集合进行交叉引用,以验证这些联系。该数据库将这些信息组织成四个不同的证据等级,展示了每项发现受研究支持的强度。
该项目还包括一个允许科学界协助改进工作的功能。研究人员和专家可以审查自动生成的输出,并提出修正或补充建议,从而确保数据库随着时间的推移变得更加准确。这种方法并非取代人类判断,而是为人类判断提供一个结构化的基础,将一片混乱的文本海洋转化为一张可导航的遗传事实地图。该数据库现在已向任何需要探索药物耐药性遗传基础的人免费开放,为这个影响全球健康的问题提供了一个清晰且具有证据关联的视角。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。