← 最新论文
💻 computer science

STRIDE: Post-Training LLMs to Reason and Refine Bio-Sequences via Edit Trajectories

该论文提出了 STRIDE 框架,通过监督微调与组策略优化训练大语言模型生成可执行的原子编辑轨迹,从而在严格语法约束下显著提升了生物序列(如蛋白质和分子)的变长优化成功率、新颖性及可控性。

原作者: Daiheng Zhang, Shiyang Zhang, Sizhuang He, Yangtian Zhang, Syed Asad Rizvi, David van Dijk

发布于 2026-03-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Daiheng Zhang, Shiyang Zhang, Sizhuang He, Yangtian Zhang, Syed Asad Rizvi, David van Dijk

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 STRIDE 的新方法,它就像给大语言模型(LLM)装上了一套“生物序列编辑导航仪”。

为了让你更容易理解,我们可以把生物序列(比如蛋白质或药物分子)想象成一段乐高积木搭建的城堡,或者一本由特定字母组成的食谱

1. 核心问题:我们要修好城堡,但不能乱拆

科学家想要改进这些“生物城堡”(比如让蛋白质发光更亮,或者让药物更有效),通常不是要把整个城堡拆了重盖(从头生成),而是在现有的基础上进行微调

这就好比:

  • 目标:把城堡的塔楼加高一点,或者把窗户换个颜色,让它更漂亮。
  • 难点
    • 规则严格:你不能随便把一块积木扔了,否则城堡会塌(生物序列必须符合严格的化学或生物规则,否则就是无效的)。
    • 步骤复杂:有时候你需要先拆掉一块,再插进两块,顺序不能乱。
    • 现有工具的局限
      • 扩散模型(Diffusion):像是一个“蒙眼画家”,它通过不断去噪来慢慢画出新图。虽然画得不错,但它不知道具体是哪一步动了哪块积木,很难精确控制。
      • 普通大模型(LLM):像是一个“直觉型厨师”,它知道怎么做菜,但有时候只顾着把菜做好吃,却忘了食谱的格式要求,或者没有规划好“先切葱再放油”的步骤,导致最后做出来的菜虽然好吃但格式全错。

2. STRIDE 的解决方案:把“修改过程”写下来

STRIDE 的核心思想是:不要直接给结果,要教模型把“修改步骤”像写日记一样一步步写出来。

它把优化过程变成了**“编辑轨迹”**(Edit Trajectories)。

  • 原子操作:模型不再直接输出最终的序列,而是输出三个具体的动作指令:
    1. 插入 (INSERT):在某个位置加一块积木。
    2. 删除 (DELETE):拿走某块积木。
    3. 替换 (REPLACE):把某块积木换成另一种颜色的。

比喻
想象你在修乐高城堡。

  • 普通方法:直接给你看修好后的城堡照片。
  • STRIDE 方法:给你一张施工图纸,上面写着:“第一步,把第 5 层的红色砖块拿走;第二步,在第 5 层加一块蓝色砖块;第三步,把第 3 层的窗户换成拱形的……"
  • 好处:因为每一步都写得很清楚,而且每一步都经过验证(确保城堡没塌),所以最后的结果既符合规则,又达到了目标。

3. STRIDE 是怎么训练的?(两阶段魔法)

STRIDE 的训练过程分两步走,就像教一个实习生成为大师:

第一阶段:临摹大师的“最短路径” (SFT)

  • 怎么做:研究人员用一种数学算法(莱文斯坦距离),算出从“旧城堡”变成“新城堡”最省力、步骤最少的修改方案。
  • 训练:让模型去临摹这些最完美的修改步骤。
  • 目的:让模型学会“怎么改才不乱”,保证改出来的东西是合法的(城堡不会塌),而且步骤精简(不瞎折腾)。

第二阶段:根据“评分表”优化策略 (GRPO)

  • 怎么做:模型开始自己尝试修改。每改完一次,就有一个“评分员”(比如预测蛋白质亮度的 AI,或者药物评分系统)给它打分。
  • 奖励机制
    • 如果改得更好(分数高了),就奖励它。
    • 如果改得乱七八糟(分数低了,或者城堡塌了),就惩罚它。
    • 关键点:模型不仅要分高,还要保持它第一阶段学到的“不乱改”的好习惯。
  • 目的:让模型学会为了达到特定的目标(比如“更亮”或“更像药”),主动规划出最佳的修改步骤。

4. 效果如何?(实战表现)

论文在两个领域做了测试:

  1. 蛋白质优化:让蛋白质发光更亮。
    • 结果:普通方法成功率只有 42%,而 STRIDE 达到了 89%!而且它改出来的蛋白质种类更多,不像其他方法那样只会“复制粘贴”已有的方案。
  2. 药物分子优化:让药物分子更符合特定的药效要求。
    • 结果:STRIDE 不仅能成功修改分子,还能严格控制修改过程,不会把药物改得面目全非(比如本来要增加溶解度,结果把毒性也增加了)。

5. 总结:为什么这很重要?

想象一下,如果你要教一个 AI 去修改基因或设计新药:

  • 以前的 AI:像是一个天才但鲁莽的艺术家,偶尔能画出惊世骇俗的杰作,但经常画出无法使用的废品,而且你不知道它是怎么画出来的。
  • STRIDE:像是一个严谨的工程师,它手里拿着施工图纸(编辑轨迹),每一步都经过计算和验证。它不仅知道怎么改,还能解释为什么要这么改。

一句话概括
STRIDE 让大模型学会了**“边思考边动手”,通过一步步写出具体的修改指令(插入、删除、替换),在严格遵守生物规则的前提下,精准地优化蛋白质和药物分子。这就像给生物设计领域装上了一个可解释、可控制的导航系统**。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →