← 最新论文
💻 bioinformatics

OpenAntigens: a structure-aware database for antigen construct design across the human cell-surface and secreted proteome

OpenAntigens 是一个免费、无需登录的数据库,它通过将多样化的结构、拓扑和比较数据整合到一个统一且交互式的流程中,为人类分泌及细胞表面蛋白质组组建抗原构建设计提供简化流程,从而生成具有可重复性且兼顾交叉反应性的设计建议。

原作者: Teixeira, A. A. R., Zhu, H., Kothiwal, D., Cao, R., Mills, A.

发布于 2026-09-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Teixeira, A. A. R., Zhu, H., Kothiwal, D., Cao, R., Mills, A.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在现代医学和生物学领域,科学家经常需要研究特定的蛋白质,以了解疾病如何运作或开发新的治疗方法。许多这类蛋白质位于细胞表面或在人体体液中自由漂浮,充当着信号、门户或锚点的角色。为了在实验室中研究它们,研究人员必须首先为该蛋白质的恰当部分创建一个物理副本,即“构建体”(construct)。这是一项艰巨的任务,因为蛋白质是长而复杂的链状结构,会折叠成特定的三维形状。如果科学家切断链条的位置不对,最终可能会得到一个松散、无用的碎片,无法保持其形状;或者他们可能会不小心包含了位于细胞膜内部的部分,而这部分是无法在标准试管中进行研究的。

挑战在于,单个蛋白质在各种科学数据库中的描述方式各不相同。一个来源可能列出蛋白质从哪里开始以及在哪里结束,另一个可能展示计算机生成的形状预测,而第三个可能列出哪些部分已知能与其他分子发生相互作用。在科学家订购用于制造其蛋白质副本的 DNA 之前,他们必须手动收集所有这些零散的线索,检查它们是否一致,并决定确切的切割位置。这个过程缓慢、容易出错,并且通常需要处理数十个不同的网站和文件,仅仅为了回答一个基本的科学问题:我应该构建这个蛋白质的哪一部分?

一个名为 OpenAntigens 的新资源旨在通过将所有这些信息整合到一个地方来解决这一瓶颈。该数据库由蛋白质创新研究所(Institute for Protein Innovation)的一个团队开发,专注于 5,328 种人类蛋白质,这些蛋白质要么由细胞分泌,要么位于细胞表面。与其让研究人员从多个来源拼凑线索,OpenAntigens 会自动从主要的生物档案中收集数据,包括蛋白质形状的记录、已知的家族关系以及疾病关联。随后,它利用这些信息为每种蛋白质生成一份详细的报告,建议哪些部分是实验室研究的最佳候选对象。

该系统通过观察蛋白质的结构及其生物学背景来运作。对于具有计算机模型预测出的 3D 形状的蛋白质,数据库会分析该模型的置信度,以寻找稳定、折叠的区域。它能够区分蛋白质中哪些部分可能是刚性且有用的,哪些部分是松散或无序的。基于这种分析,它为每种蛋白质提供五种不同类型的建议。有些建议涵盖了蛋白质的整个外部部分,这对于想要研究整个形状如何与其他分子相互作用的科学家非常有用。另一些则侧重于在以往实验中观察到的特定、定义明确的结构域或区域。系统还提供“严格”建议,将蛋白质分解为最小且最稳定的构建单元,这对于创建非常专注的工具很有帮助。

除了建议在哪里切割之外,该数据库还能帮助科学家考虑安全性与特异性。它会检查“缺陷”(liabilities),例如可能导致蛋白质产生不希望出现的自我粘附的未配对化学基团,或者细胞自然切割或修饰蛋白质的位点。至关重要的是,它还会查看人类蛋白质与小鼠和猴子(常见的实验动物)蛋白质之间的相似性。通过展示人类蛋白质在不同物种之间哪些部分是完全相同的,该数据库可以帮助科学家判断为人类构建的工具是否也能在动物身上发挥作用,或者他们是否需要避开某些区域以防止工具对错误目标产生反应。

其结果是一个包含超过 55,000 个特定设计建议和近 150,000 次蛋白质比较的海量集合,并被组织在一个免费、易用的网站上。对于任何给定的蛋白质,用户都可以看到建议切割位置的可视化图谱、形状的置信度以及氨基酸序列。如果存在兼容的计算机模型,网站甚至包含一个交互式工具,允许用户通过拖动手势在蛋白质形状上进行选择,并实时观察系统关于潜在化学问题或缺失部分的警告。这种交互式功能使研究人员能够根据特定需求优化建议,而无需编写复杂的代码或手动交叉引用数十份文档。

虽然该数据库提供了一个强大的起点,但作者也谨慎地指出,它并不保证某种蛋白质易于制造,也不保证基于它构建的工具一定会完美运行。这些建议是基于现有的数据和计算机预测,而非该数据库本身进行的物理实验。某些蛋白质,特别是那些多次跨越细胞膜或需要伴侣蛋白才能发挥功能的蛋白质,仍然难以研究,数据库会对这些情况进行标记,以便科学家知道需要格外谨慎。该工具的设计初衷是承担起信息收集和初步规划的繁重工作,从而让研究人员能够专注于实际的实验。

通过将数千种蛋白质组织成清晰、可操作的报告,OpenAntigens 将一个混乱的、手动的过程转变为一个流线型的流程。它让科学家能够更快地从研究某个蛋白质的想法过渡到制造该蛋白质的实际行动。无论是为了开发新的抗体、创建诊断测试,还是为了理解与疾病相关的蛋白质结构,这一资源都提供了一张可靠的地图,用以导航复杂的人类蛋白质景观,确保研究旅程的第一步尽可能地基于充分的信息且精准无误。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →