Pushing Biomolecular Utility-Diversity Frontiers with Supergroup Relative Policy Optimization
本文介绍了超群相对策略优化(SGRPO),这是一个灵活的框架,它从候选超群中构建集合级多样性奖励,以在生物分子生成任务中有效解耦并同步优化效用与多样性,从而在各种分子和蛋白质设计基准上扩展效用 - 多样性帕累托前沿。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象你是一位主厨,正试图发明一道新菜。你有两个主要目标:
- 口味(效用):菜肴必须美味,并满足特定标准(例如“低卡路里”、“辛辣”或“无麸质”)。
- 多样性(多样性):你不想制作 100 份完全相同的辣味意面。你希望菜单上有许多不同且独特的选择。
问题所在:
在人工智能生成分子(用于药物)或蛋白质(用于生物学)的领域中,当前的人工智能主厨擅长制作一道完美的菜肴。但如果你要求它们制作 100 道都“美味”的菜肴,它们往往会陷入僵局。它们可能会制作 100 份同一道意面菜肴的略微不同版本。由于过于专注于“完美口味”,它们失去了多样性。
现有方法试图通过告诉人工智能“不要制作你以前做过的任何东西”来解决这个问题。但这就像告诉一位厨师:“因为你昨天用过盐,所以今天不要用盐。”这是一种间接的修复,有时会让食物味道怪异,或者导致厨师去制作无法食用的胡言乱语。
解决方案:SGRPO(超级组相对策略优化)
这篇论文介绍了一种名为SGRPO的新训练方法。你可以将其视为一种“组别口味测试”策略。
SGRPO 不是逐一评判每一道菜肴,而是将人工智能的尝试组织成组(例如一个包含 100 道菜肴的“超级组”)。
以下是使用我们的厨房类比,分步解释其工作原理:
- 组别挑战:人工智能被要求针对特定请求制作一批 100 道菜肴(例如:“制作一道辛辣、低卡路里的餐食”)。
- 组别评分:系统查看整批菜肴,并问道:“这 100 道菜肴彼此之间有多大的差异?”
- 如果该批次包含 100 种独特的食谱(沙拉、咖喱、汤、塔可等),该组将获得高多样性评分。
- 如果该批次包含 100 份同一道意面的版本,该组将获得低多样性评分。
- 比较:人工智能制作多个这样的批次。它进行比较。“批次 A 非常多样;批次 B 很无聊。”
- “留一法”技巧(秘密武器):这是巧妙之处。系统不仅仅奖励整个组;它还要找出哪些特定菜肴使该组变得多样。
- 它会问:“如果我们从组中移除这道特定的塔可,该组是否仍然多样?”
- 如果移除塔可会让该组变得无聊,那么这道塔可因其独特性而获得巨额奖励。
- 如果移除塔可不会改变太多(因为还有 10 道塔可),那么这道塔可获得的奖励较小。
- 奖励:人工智能了解到,为了获得最佳评分,它需要制作既美味又真正为组别多样性做出贡献的独特菜肴。
为什么这更好?
- 不再有“回声室”:旧方法经常迫使人工智能仅仅为了不同而不同,导致结果糟糕。SGRPO 奖励有用的多样性。
- “帕累托前沿”:用数学术语来说,这篇论文声称 SGRPO 将“前沿”向外推移。想象一个图表,X 轴是“口味”,Y 轴是“多样性”。
- 旧的人工智能可以获得高口味但低多样性,或者高多样性但低口味。
- SGRPO 允许人工智能同时获得高口味和高多样性。它扩展了可能选项的菜单。
他们在哪里测试了这一点?
作者们在三个现实世界的烹饪挑战中测试了这种“组别口味测试”:
- 发明新的小分子(例如从头开始为药物创建新的化学结构)。
- 设计契合特定口袋的分子(例如设计一把能契合特定锁的钥匙,如蛋白质结合位点)。
- 设计新蛋白质(创建新的生物序列)。
结果:
在所有三种情况下,SGRPO 都比以前的方法产生了更广泛的高质量选项。它不仅仅是让人工智能变得“随机”;它使人工智能更擅长平衡特定功能的需求与创造性多样性的需求。
简而言之:
SGRPO 是一种训练方法,教导人工智能停止自我复制。它不是孤立地评判每一次尝试,而是评判一组尝试,奖励人工智能创建这样的批次:其中每一个项目都为混合体增添了新的、有价值的东西。这导致了更广泛、更有用的科学发现选择。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。