← 最新论文
🧬 biology

Is Retrieval All You Need? Assessment and Emergence of Novelty in Protein Structure Generation

本文通过引入结构域检索率(Domain Retrieval Rate, DRR)揭示了大多数生成的蛋白质骨架实际上包含已知的结构域,从而挑战了“低全链相似度即可保证新颖蛋白质折叠”这一假设,并提出了一个基于检索的零训练基准模型 RetFold,以证明无需复杂的生成模型也能实现此类结果。

原作者: Tongyue Xu, Yijie Zhang, Mutian He, Lingdong Shen, Zhihong Liu, Tianlei Ying, Cheng Tan

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Tongyue Xu, Yijie Zhang, Mutian He, Lingdong Shen, Zhihong Liu, Tianlei Ying, Cheng Tan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下你是一位试图发明全新菜肴的大厨。在生物学的世界里,蛋白质就是你的“食材”,它们是构建和运行每一个生命体的分子机器。几十年来,科学家们一直试图教会计算机去烹饪自然界从未见过的全新蛋白质形状。如果计算机创造出的蛋白质形状看起来与已知天然蛋白质的庞大库完全不同,我们通常会欢呼雀跃并说:“哇,这是一个全新的发明!”

但问题在于:仅仅因为一整道菜看起来很奇特,并不意味着食材是新的。也许大厨只是把已知的土豆、已知的胡萝卜和已知的牛排,以一种从未见过的新奇方式堆叠在一起。这究竟是一个新发明,还是仅仅是旧零件的新排列?这就是科学家们针对计算机生成的蛋白质所提出的核心问题。他们想知道,计算机是在真正发现新的“折叠”(即蛋白质采取的三维形状),还是仅仅在重新排列熟悉的构建模块。如果我们无法区分这两者,我们可能就是在为那些实际上只是“旧零件的新排列”而庆祝所谓的“新发现”。

这篇题为《检索就是全部吗?》(Is Retrieval All You Need?)的论文深入到了这个“厨房”中去检查食材。作者们是一支来自中国、加拿大和美国的大学研究团队,他们决定测试目前衡量“新颖性”的方法是否真的在误导我们。他们研究了八种不同的生成蛋白质形状的计算机程序。这些程序使用各种高级数学技巧,如“扩散”(类似于将噪声逐渐转化为清晰图像)和“流匹配”(flow matching),来构思出新的结构。

检查一个生成的蛋白质是否“新”的标准方法,是将整个结构与一个庞大的已知蛋白质数据库进行对比。如果整个形状与数据库中的任何内容都不匹配,它就会被贴上“新颖”的标签。但作者认为,这就像是仅凭三明治的总重量来评判它一样。如果你做了一个三明治,用了两片从未见过的面包,但填充物却是一片你见过无数次的标准火腿,那么整个三明治看起来可能很独特,但那片火腿并不是新的。

为了解决这个问题,研究人员引入了一种观察数据的新方法,称为领域检索率(Domain Retrieval Rate, DRR)。他们不再将整个蛋白质链视为一个巨大的整体,而是将其分解成更小的、独立的块,称为“结构域”(domains)。你可以把这些结构域想象成构成城堡的单个乐高积木。研究人员问道:“即使整个城堡看起来很奇怪,其中的单个积木是否仍然是我们已有的标准乐高件?”

当他们将这项新测试应用于这八个计算机程序时,结果令人惊讶。他们发现,即使计算机生成的蛋白质从头到脚看起来完全陌生,几乎所有的蛋白质实际上都是由熟悉的“乐高积木”组成的。事实上,对于大多数程序而言,超过90%生成的蛋白质都包含至少一个与数据库中已知结构域相匹配的部分。这种“新颖性”主要只是将旧零件以一种新的方式粘合在一起。

为了证明这不仅仅是偶然现象,团队构建了他们自己的一个超级简单的计算机程序,名为 RetFold。这个程序没有使用任何高级的学习或人工智能训练。它是一个“零训练”基准,这意味着它并不“学习”任何东西;它只是从数据库中抓取已知的乐高积木,并使用简单的几何规则将它们粘合在一起。结果如何?RetFold 创造出的蛋白质形状在旧的“全链”方法下看起来竟然非常“新”,尽管它仅仅是在重新组合已知的部分。在旧的测试下,那些高级 AI 程序表现得非常新颖(大多数程序的全链检索率仅为 0.0% 到 0.6%),而 RetFold 的检索率则为 20%。这表明,无需任何学习,仅仅通过重新排列已知部分,就能达到 AI 程序所报告的那种“新颖性”水平。

论文还测试了三种不同的评分方式来衡量蛋白质有多“新”。他们发现,最常用的评分方式(即观察整个链条的方式)其实带有一点“陷阱”。它有一个隐藏的缺陷:如果你制作的蛋白质链非常长,分数会自动下降,从而使其看起来很“新”,即便它只是一串由旧零件组成的长链。作者展示了,如果使用一种更严格、更诚实的评分方式——即检查整个已知部分是否真的存在——情况就会完全改变。在更严格的测试下,那些高级 AI 程序看起来的“创造力”大打折扣,而我们已知只是在重新组合旧零件的简单程序 RetFold,其检索率却是 100%。这证实了 RetFold 确实只是在使用已知部分,同时也证明了更严格的评分能够成功地将“重组型”基准与 AI 生成器区分开来,揭示了 AI 程序并不像旧评分所暗示的那样具有纯粹的“创造性”。

作者总结道,我们需要更加谨慎地对待如何庆祝新的蛋白质设计。仅仅因为计算机吐出了一个从顶端到底端都与已知蛋白质不匹配的形状,并不意味着它发现了一个新的折叠。它可能只是对旧零件的一次巧妙重组。他们建议,未来的研究应该准确报告他们是如何衡量“新颖性”的,并且要检查构建模块本身是否真的是新的,而不仅仅是最终的组装体是否新颖。这提醒我们,在科学领域,有时最令人兴奋的发现,其实只是换了新装的老朋友。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →