Automated dataset integrating structural and bioactivity data for structure-based drug discovery
DockTData 是一个新发布的、开源许可的数据集,它整合了来自 PDB 的 24,719 个实验测定的蛋白质-配体结构以及来自 BindingDB 和 ChEMBL 的标准化生物活性测量数据,为基于结构的药物发现中训练机器学习模型提供了一个更大且可复现的资源。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你正在试图教一个机器人如何设计一把能完美契合特定锁具的新钥匙。在医学世界中,“锁”是人体内导致疾病的蛋白质,而“钥匙”则是微小的药物分子。几十年来,科学家们一直试图构建一个超级智能的机器人(利用机器学习),仅通过观察它们的形状就能预测一把钥匙能否完美契合一把锁。但有一个巨大的问题:这个机器人非常“饥渴”,它需要大量的数据,而这些数据却散落在各处。有些科学家拥有锁的形状,有些则拥有钥匙转动效果的测量值,但它们很少出现在同一个地方。这就像是在试图教一位厨师烹饪完美佳肴,但食谱在一本书里,食材的照片在另一本书里,而品尝测试的结果又在第三本书里。如果没有一个庞大且有序的图书馆来连接锁的形状与钥匙抓握强度的精确测量值,机器人就无法有效地学习。
这就是 DockTData 故事的开始。来自巴西国家科学计算实验室的一个研究小组决定建立这个缺失的图书馆。他们不仅收集了几份食谱,还建立了一个自动化工厂,搜寻互联网上关于蛋白质锁和药物钥匙的所有可用信息,将它们缝合在一起,并组织成一个单一的、巨大的数据集。可以把它看作是一个大规模的数字“媒人”服务。它提取了来自蛋白质数据库(PDB)的蛋白质 3D 蓝图,并将其与来自 BindingDB 和 ChEMBL 等数据库的现实世界测试结果联系起来。其结果是一个包含超过 24,719 个独特的蛋白质-配体复合物的宝库。这不仅仅是一份数字列表;这是一个每一个药物分子都直接与其 3D 结构以及测得的强度(即结合紧密度)相连的集合,并且经过了标准化处理,以便计算机可以一次性读取所有内容。通过向所有人开放并免费提供这些数据,作者们希望为下一代药物发现机器人的学习提供所需的燃料,使其学得更快、更聪明,从而有望为目前尚无疗法的疾病开发出新药。
论文的核心使命:构建终极药物设计图书馆
这篇论文介绍了 DockTData,这是一个旨在增强“基于结构的药物发现”的新型开放获取数据集。简单来说,这是通过观察目标蛋白质的 3D 形状并确定哪些分子最适合嵌入其中来进行药物设计的过程。作者通过构建一个充当超高效图书管理员的自动化流水线创建了这个数据集。这位图书管理员前往三个庞大的来源——持有蛋白质 3D 结构的 蛋白质数据库 (PDB);持有药物与蛋白质结合测量值的 BindingDB;以及 ChEMBL——并将所有内容整合在一起。
DockTData 的魔力在于它如何将这些点连接起来。在此之前,科学家可能有一张药物卡在蛋白质上的照片,但他们不知道这种结合到底有多强;或者他们可能在另一个数据库中找到了强度测量值,却找不到对应的照片。DockTData 通过将 24,719 个蛋白质-配体复合物(“锁”及其“钥匙”)直接链接到 45,331 个生物活性测量值来解决这个问题。这些测量值包括 Kd、Ki、IC50 和 EC50,这些都是表达“这个药物粘附得有多紧”的不同方式。作者将所有这些数值统一为 纳摩尔 (nM) 单位,以便进行“苹果对苹果”式的公平比较。
他们是如何做到的:自动匹配机器
研究人员并非只是简单的复制粘贴;他们构建了一个复杂的系统以确保匹配的完美性。他们使用了几种巧妙的技巧来确保数据的干净与可靠:
- 蛋白质匹配: 他们使用了一个名为 MMseqs2 的工具来比较蛋白质序列。他们设定了一个规则:只有当药物测试中的蛋白质与 3D 结构中的蛋白质序列相似度至少为 85% 时,才算作匹配。这就像是在说:“如果这把锁看起来与照片中的那把有 85% 相似,我们就假设它是同一把锁。”选择这个阈值是为了在包含有用变体(如同一蛋白质的略微不同版本)的同时,排除完全不同的蛋白质。
- 药物匹配: 对于药物分子,他们使用了名为 InChIKey 的工具。你可以把它想象成每个化学结构的唯一 27 位字符条形码。通过使用标准工具 (RDKit) 为每一个条目重新计算这些条形码,他们确保了同一个药物不会因为不同的名称或微小且令人困惑的差异而被重复列出。
- “一键一锁”原则: 他们在配对方面非常严格。如果一个蛋白质结构同时附着有两个不同的药物,他们就会将其排除。他们只保留那种恰好有一个药物分子与一个蛋白质结构配对的复合物。这可以防止在训练计算机模型时产生混乱。
盒子里装了什么?
生成的数据集是一个组织有序、易于使用的表格化大规模信息集合。以下是你将获得的内容:
- 24,719 个独特的蛋白质-配体复合物。
- 11,742 个不同的药物分子(配体)。
- 来自 PDB 的 17,732 个独特的蛋白质结构。
- 2,163 个不同的蛋白质靶点(“锁”)。
- 包含 小分子(经典药物类型,占 24,378 个条目)、多肽(271 个条目)甚至一些 寡糖(70 个条目)的混合。
作者指出,他们的集合中,小分子的部分比流行的 PDBbind 2020 通用集(包含 16,744 个条目)要大 46%。这意味着 DockTData 为科学家们提供了一个显著更大的实验场。
为什么这很重要:不仅仅是数字
论文强调,数据质量和规模是机器学习在药物发现领域面临的最大瓶颈。如果用一个小而混乱的数据集来训练机器人,它会学坏习惯。DockTData 提供了一个更“干净”、更大且更透明的数据集。由于作者追踪了每一项数据的来源(“溯源性”),科学家可以追溯任何数字到其原始来源,检查错误并理解其背景。
该数据集包含了多种测量类型:58.8% 是 IC50 值,20.3% 是 Ki,11.3% 是 Kd,以及 9.7% 是 EC50。这种多样性非常重要,因为不同类型的测量值讲述了关于药物作用的不同侧面。通过将它们全部放在一起并统一为 纳摩尔 单位,研究人员可以选择符合其需求的特定数据类型。
“禁区”:论文排除了什么
需要注意的是 DockTData 不是 什么。作者明确表示,他们不包括仅由计算机预测(如来自 AlphaFold)而缺乏实验证据的结构。他们只包含了在实验室中通过 X 射线、核磁共振 (NMR) 或冷冻电子显微镜实际解析出的结构。这意味着该数据集严格基于 实验现实,而非计算机模拟。
此外,论文排除了模糊的配对。如果一个蛋白质结构拥有多个不同的药物附着,或者蛋白质序列与药物测量值之间的联系过弱(低于 85% 的恒等性阈值),该数据就会被丢弃。作者认为,这种严格性对于避免可能误导机器学习模型的“噪声”是必要的。他们还指出,虽然他们拥有大量数据,但并不声称已经解决了药物发现问题。相反,他们是在提供一个更好的基础——一个“透明、可重用且持续扩展的资源”——供他人在此基础上进行开发。
最终总结
DockTData 是送给科学界的一份礼物。它是一个庞大、有序且免费的图书馆,将蛋白质的 3D 形状与药物相互作用的现实强度联系在一起。通过自动化收集和清洗数据的过程,作者创建了一个比以往许多集合都更大、更多样化的资源。他们使得研究人员能够训练更聪明的 AI 模型,测试关于药物如何与蛋白质结合的新理论,并最终加速新药的发现。该数据集在 Creative Commons Attribution 4.0 International License 许可下开放,这意味着只要注明出处,任何人都可以使用、分享并基于此进行开发。这是将混乱的药物发现数据转化为机器可学习的结构化语言的一次明确进步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。