← 最新论文
💻 bioinformatics

Scalable Extraction of Information on Protein-Protein Interactions using Topological Data Analysis

本文介绍了一种可扩展的拓扑数据分析框架,该框架在显著降低从表面斑块预测蛋白质-蛋白质相互作用界面计算成本的同时,保持了与既有几何深度学习方法相比具有竞争力的准确度。

原作者: Mukherjee, A., Park, B., Malmstrom, A., Cisewski-Kehe, J., Van Lehn, R. C., Zavala, V. M.

发布于 2026-08-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Mukherjee, A., Park, B., Malmstrom, A., Cisewski-Kehe, J., Van Lehn, R. C., Zavala, V. M.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,人体就像一座繁忙的城市,蛋白质是其中的工人、建筑和车辆。为了让这座城市运转起来,这些蛋白质需要相互交流,通过“握手”来传递信息、建造结构或抵御入侵者。这些握手被称为蛋白质-蛋白质相互作用(PPI)。为了了解这座城市是如何运作的,或者为了设计一种新的工具(例如药物)来阻止一次“坏的握手”,科学家需要准确知道这些握手发生在蛋白质表面的哪个位置。这就像是试图弄清楚城堡墙壁上的哪块特定砖块是那扇秘密之门。

长期以来,科学家一直使用强大的计算机程序,通常被称为“几何深度学习”,来扫描这些蛋白质表面。你可以把这些程序想象成极其精细的3D扫描仪,能够绘制出每一个凸起和曲线。它们非常擅长寻找这些秘密之门,但它们也像高端超级计算机一样:运行缓慢、对海量数据有着极高的渴求,并且非常耗能。如果你想扫描整个蛋白质库,你可能得等待数天甚至数周。这篇论文提出了一个简单的问题:我们能否在保持同样出色效果的同时,找到一个更快、更轻量且更高效的工具?

本文作者提出了一种使用拓扑数据分析(TDA)这一数学分支的新方法。如果说几何深度学习像是为每一块砖拍摄一张高分辨率的照片,那么 TDA 则更像是计算墙壁上的孔洞、环路和隧道。它忽略了细微的油漆和纹理细节,而是专注于宏观形状:“这个区域是一个平坦的墙面、一个深邃的山洞,还是一个圆环?”研究人员构建了一个新系统,该系统利用这些“形状计数器”结合一些基础的化学信息(例如表面的粘性或电性)来预测蛋白质会在何处握手。

以下是他们的发现:他们这种以“形状”为核心的新方法是一个“速度达人”。当他们在包含 3,362 个蛋白质的数据集上进行测试时,它的速度远快于既有的“超级扫描”方法(称为 MaSIF-site)。旧方法仅准备每个蛋白质进行分析就需要约 27 秒,而他们的新方法仅需 5 到 8 秒。训练时间——即教计算机如何识别握手的时间——从大约 6 小时降至约 1 到 1.3 小时。

然而,速度并不是全部;准确性同样重要。论文指出,虽然他们的新方法效率极高,但其准确度略低于那套重型“超级扫描”工具。旧方法能正确识别相互作用位点的概率约为 84%(一个被称为 AUC 的评分)。新方法的得分则在 76% 到 77% 左右。虽然这在精度上略有下降,但作者认为,巨大的速度提升使其成为快速扫描大规模蛋白质库的一个非常有吸引力的选择。他们还发现,即使在观察蛋白质表面的较大区域时,他们的方法依然表现良好,而这通常是会让其他方法变慢的因素。

简而言之,这篇论文并不声称已经完美解决了寻找蛋白质握手的问题。相反,它表明通过从“摄影式”方法转向“形状计数式”方法,科学家可以更快地获得一个非常不错的答案。这可以帮助研究人员在以前只能筛选少量蛋白质的时间内,筛选数千个蛋白质,从而为更快的药物研发以及更好地理解我们细胞城市是如何运作的开启大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →