← 最新论文
🧬 biology

Automated in situ CryoET Structure Determination with a Self-Configuring Workflow

本文介绍了一个自动化框架,该框架将自配置深度学习检测器 Octopi 与标准化的 py2rely 工作流相结合,旨在实现跨多种生物样本的高分辨率(3–20 Å)原位冷冻电子断层扫描结构测定,且仅需极少的专家干预。

原作者: Dari Kimanius, Jonathan Schwartz, Daniel Ji, Utz Ermel, Joshua Hutchings, Rahel Woldeyes, Zhuowen Zhao, Christof Henkel, Mallak Ali, Yue Yu, David Agard, Mohammadreza Paraan, Bridget Carragher

发布于 2026-08-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Dari Kimanius, Jonathan Schwartz, Daniel Ji, Utz Ermel, Joshua Hutchings, Rahel Woldeyes, Zhuowen Zhao, Christof Henkel, Mallak Ali, Yue Yu, David Agard, Mohammadreza Paraan, Bridget Carragher

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在每一个活细胞内部,一个由分子机器组成的繁忙城市正在三维空间中运作,构建蛋白质、复制遗传密码并运输物质。为了理解生命在最基础层面的运作方式,科学家们不仅需要将这些机器视为孤立的部分,更需要看到它们在自然且拥挤的环境中是如何存在的。多年来,研究人员一直使用一种称为冷冻电子断层扫描(cryo-electron tomography)的技术来获取这些冻结细胞的三维快照。这种方法使他们能够窥探细胞景观的内部,但将那些原始图像转化为清晰、高分辨率结构的这一过程,一直是一个困难的手动过程。这就像拥有一个模糊照片组成的图书馆,其中每一本书都略有不同;为了阅读文本,必须由人类专家仔细挑选出每一本书,将其与其他书籍对齐,并手动锐化图像。这种瓶颈限制了科学家可以研究的结构数量,使得大部分细胞世界仍处于未被探索的状态。

来自 Chan Zuckerberg Biohub 的一个研究团队现在构建了一个能够自动化整个过程的系统,将一项劳动密集型任务转变为一个自我配置的工作流。他们开发了两个协同工作的核心工具:一个用于在复杂的细胞噪声中寻找分子机器,另一个用于从这些发现中组装出清晰的结构。第一个名为 Octopi 的工具扮演着智能检测器的角色。Octopi 并不依赖于人类在每次新实验中教它寻找什么,而是通过试错法自动调整其内部设置,以适应其正在分析的具体数据。它学会了识别目标分子的形状和信号,即使该分子被膜结构或其他细胞碎片所包围。一旦 Octopi 确定了这些分子的位置,第二个工具 py2rely 就会接管工作。该系统收集识别出的碎片并进行数学组合,通过反复循环不断优化图像,直到出现一个清晰的三维结构。

研究人员在十七项不同的任务上测试了这个自动化系统,范围涵盖了从试管中的纯化分子到复杂的完整细菌细胞和人类细胞。在所有案例中,该系统都无需人类为每个新数据集重新配置软件即可正常运行。当他们将其应用于包含六种不同类型分子的标准基准数据集时,该自动检测器找到目标的目标准确度与近期国际竞赛中表现最佳的人类设计模型不相上下。更重要的是,利用这些自动发现构建的结构同样清晰。对于某些目标,该系统生成的图像分辨率达到了 3.0 埃(Ångströms),这一细节水平足以观察到单个原子。在其他具有挑战性的案例中(例如附着在细胞膜上的分子),该系统仍能产生分辨率在 10 到 20 埃之间的结构,揭示了复合物的整体形状和关键特征。

该系统最显著的成就之一是处理信号微弱或被遮蔽的困难环境的能力。在人类细胞中,研究人员要求系统区分在细胞液中自由漂浮的核糖体和附着在细胞内部膜上的核糖体。通过仅使用少量人工标记的样本进行训练,该系统学会了同时识别这两类群体以及膜结构本身。它成功地分离了这两个群体,并为每个群体构建了清晰的结构,甚至揭示了一个在以往研究中见过的附着在膜上的蛋白质复合物。同样,在细菌细胞中,该系统仅利用极少量的训练样本,就识别出了致密的细菌细胞质中的大型蛋白质环和病毒样颗粒。它甚至能够泛化到新的、未见过的数据库,在无需任何进一步调优的情况下,在不同类型的细胞制备样本上正确运行。

研究还表明,这种自动化方法可以改进以往的结果。当团队将他们的自动化结构构建工作流应用于一项竞赛的数据时,生成的图像明显比最初发表的图像更清晰。例如,一个此前分辨率为 6.8 埃的核糖体结构,仅通过使用这种新的、一致的处理步骤,就被提升到了 3.7 埃。这表明之前的局限性并非源于数据本身,而是由于分析过程中的手动性和变异性。研究人员发现,该系统甚至可以从非常稀疏的信息中学习;对于一个困难的目标,仅用五十个手动标记的样本进行训练的模型就足以生成高质量的结构。

尽管该系统非常高效,但研究人员也指出了一处仍需人工干预的地方。对于一种在突触小泡中发现的特定蛋白质复合物,自动化工作流需要人类手动选择最佳的颗粒组并调整分析掩模(mask)。这一例外情况凸显了虽然系统可以处理大多数场景,但最复杂的膜相关目标仍受益于专家的监督。然而,该项目的整体成功证明,一条从原始数据到原子结构的通用自动化路径现在已经成为可能。通过消除对专家引导的颗粒拾取和自定义工作流组装的需求,这一新框架为大规模研究各种细胞结构打开了大门,使得科学家能够以空前的速度和一致性绘制生命分子机器的图谱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →