← 最新论文
🧬 biology

Hermes: Large DEL Datasets Train Generalizable Protein-Ligand Binding Prediction Models

本文介绍了 Hermes,这是一个仅利用大规模 DNA 编码化学库(DEL)数据训练的轻量级 Transformer 模型,它证明了无需传统亲和力测量数据即可实现跨靶点和化学骨架的泛化,并具备适用于大规模虚拟筛选的推理速度。

原作者: Maxwell Kleinsasser, Brayden J. Halverson, Edward Kraft, Sean Francis-Lyon, Sarah E. Hugo, Mackenzie R. Roman, Ben Miller, Andrew D. Blevins, Ian K. Quigley

发布于 2026-02-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Maxwell Kleinsasser, Brayden J. Halverson, Edward Kraft, Sean Francis-Lyon, Sarah E. Hugo, Mackenzie R. Roman, Ben Miller, Andrew D. Blevins, Ian K. Quigley

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

这篇论文介绍了一个名为 Hermes 的人工智能模型,它的任务是预测“药物分子”和“人体蛋白质”之间是否会像钥匙和锁一样紧密结合。

为了让你轻松理解,我们可以把这项研究想象成寻找完美的“钥匙”(药物)来打开特定的“锁”(致病蛋白质)

1. 以前的难题:混乱的“钥匙库”

在药物研发中,科学家需要知道哪些小分子(钥匙)能锁住特定的蛋白质(锁)。

  • 旧方法的问题:过去,科学家收集了成千上万个实验室的数据。但这就像是从全球各地的不同人手里收集“钥匙”:有的用尺子量,有的用眼睛看,有的甚至用不同的单位。数据标准不统一,充满了噪音和偏见。这就好比你试图用一堆杂乱无章、测量标准不一的地图来导航,很难训练出一个通用的导航 AI。
  • 结果:以前的 AI 模型虽然聪明,但往往只能记住训练过的特定“锁”,换个新锁就认不出来了(泛化能力差)。

2. 新的解决方案:DNA 编码图书馆 (DEL)

论文提出了一种新的数据源:DNA 编码化学库 (DEL)

  • 什么是 DEL? 想象一下,科学家制造了一个超级巨大的图书馆,里面有几十亿把不同的“钥匙”。每把钥匙上都贴着一个独特的DNA 条形码(就像快递单号)。
  • 如何筛选? 科学家把这一大桶钥匙倒进一个装着特定“锁”(蛋白质)的池子里。
    • 能锁住的钥匙会粘在锁上。
    • 锁不住的钥匙会被冲走。
    • 最后,科学家把粘在锁上的钥匙捞出来,扫描它们的 DNA 条形码,就知道哪些钥匙有效。
  • 优势:这种方法非常统一(所有钥匙都在同一个池子里测试),而且数据量巨大(几十亿次测试),就像是用一台超级精密的机器,用完全相同的标准测试了海量的钥匙。

3. Hermes 模型:只吃“新食谱”的超级厨师

Hermes 就是在这个巨大的 DEL 数据“食谱”上训练出来的 AI 厨师。

  • 独特的训练方式:Hermes 从未见过传统的“结合力数值”(比如具体的结合强度数字)。它只见过“这把钥匙能锁住”或“锁不住”的简单标签(就像只教它“好吃”或“不好吃”,而不教它具体的卡路里)。
  • 惊人的能力:尽管没学过复杂的物理公式,Hermes 却学会了通用的规律
    • 它没见过的新蛋白质(新锁),它能猜个大概。
    • 它没见过的化学结构(新形状的钥匙),它也能判断。
    • 甚至在其他实验室用不同方法测出来的数据上,它也能表现良好。
    • 比喻:这就像是一个厨师,虽然只吃过一种特定来源的食材,但他学会了“鲜味”和“口感”的底层逻辑。当他面对从未见过的食材时,他依然能做出美味的菜肴,而不是只会照搬菜谱。

4. 为什么 Hermes 很厉害?

  • 速度快如闪电
    • 以前的顶级模型(比如 Boltz-2)就像是用超级计算机去模拟每一把钥匙和锁的物理碰撞过程,非常精准但极其缓慢(就像用显微镜去观察每一颗螺丝)。
    • Hermes 则像是一个经验丰富的老手,它只看钥匙和锁的“形状描述”(序列),就能瞬间判断能不能锁住。
    • 速度对比:Hermes 的速度比传统模型快 500 到 700 倍!这意味着以前需要跑几个月的虚拟筛选,现在可能几个小时就搞定了。这对于在海量药物库中快速寻找候选药物至关重要。
  • 通用性强:它证明了,只要数据量够大、质量够高(像 DEL 这样统一标准的数据),AI 就能学会药物和蛋白质互动的“通用语言”,而不需要死记硬背每一个具体的物理细节。

5. 总结与未来

这篇论文的核心思想是:数据的质量比数据的“类型”更重要。

  • 以前:我们纠结于收集各种各样但质量参差不齐的“传统数据”。
  • 现在:Hermes 证明了,利用大规模、标准化的 DEL 数据,我们可以训练出更聪明、更通用的 AI。

未来的展望
虽然 Hermes 目前主要是一个“快速筛选器”(用来从几亿个分子中快速挑出几百个候选者),但它为药物研发打开了一扇新大门。未来,结合更精细的结构模型,我们或许能更快地找到治愈疾病的新药,就像拥有了一个能瞬间在茫茫大海中找到完美钥匙的超级向导。

一句话总结
Hermes 是一个利用“超级图书馆”数据训练出来的 AI,它虽然不懂复杂的物理公式,但因为它见过海量的“钥匙与锁”的配对案例,所以它能以极快的速度极强的通用性,帮科学家在茫茫药海中快速找到能治病的“金钥匙”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →