Uncertainty-aware reinforcement learning for chemical language models
本文提出并评估了两种用于化学语言模型的具有不确定性感知能力的强化学习框架,通过将不确定性视为优化目标或调节策略更新,来降低探索不可靠化学空间的风险,最终实现了更稳健的分子设计,并显著提高了真实命中率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名正在广袤、未知的洞穴系统中寻找最珍贵宝石的寻宝者。这个洞穴代表了“化学空间”——一个拥有数万亿种可能分子的宇宙。你的目标是设计出能够成为救命药物的新分子。
为了帮助你导航,你拥有一个化学语言模型(CLM)。你可以把这个模型想象成一个技术精湛但有些过度自信的向导,他背诵了一张关于一小块已被充分探索区域的地图(训练数据)。当你询问向导新宝石的位置时,他会利用他的知识来预测那颗宝石可能有多么珍贵。
问题所在:过度自信的向导
论文指出,我们通常使用这些向导的方式存在一个重大缺陷。在过去,我们将向导的预测视为绝对的事实。如果向导说:“这个位置有一颗价值 100 万美元的钻石!”,我们会盲目相信。
然而,向导只在他原本地图附近的区域才是有信心的。如果你问他在黑暗、未知的深处某个位置的情况,他可能依然会以同样的自信大喊:“钻石!”尽管这其实只是在瞎猜。实际上,这些预测是摇摆不定且不可靠的。
当我们盲目地跟随向导进入这些“高分但高不确定性”的区域时,我们最终会浪费时间在虚假的宝藏上。优化过程会变得不稳定,生成的分子在理论上看起来很棒,但在现实世界中却无法奏效。
解决方案:教会向导说“我不确定”
他们提议了一种使用强化学习(RL)的新方法,强化学习本质上是一种通过试错来学习的训练方法。他们想要教会向导关注自己的不确定性——即他对于自己是否了解所谈论内容的一种内在“直觉”。
他们测试了两种创新的策略来修复向导的过度自信问题:
策略 1:“诚实奖励”(得分调节)
想象你在玩一款通过寻找宝石获得积分的游戏。
- 旧方法: 你仅根据宝石的价值获得积分。
- 新方法(得分调节): 你的积分等于宝石的价值,减去一个由于向导不确定而产生的惩罚。
- 类比: 这就像是在告诉向导:“如果你 100% 确定这是一颗钻石,我会给你巨大的奖金。但如果你只是在瞎猜,我会从你的分数中扣除点数。”这鼓励向导停止探索黑暗、未知的角落,转而留在那些它能确定自己发现的、光线充足且熟悉的路径上。
策略 2:“音量旋钮”(损失调节)
这种方法更为微妙。想象向导正在给你提供一系列建议,而你才是那个在学习的人。
- 旧方法: 你以同样的强度去倾听每一个建议,无论向导是有信心还是在瞎猜。
- 新方法(损失调节): 你调大那些有信心的建议的音量,并调低(或静音)那些摇摆不定的建议。
- 类比: 如果向导说:“我有 90% 的把握这是一颗钻石”,你会倾听并从中学习。如果他说:“我觉得这可能是一颗钻石,但我不太确定”,你就会几乎不去理会。这防止了向导的胡乱猜测破坏你的训练。
结果:更好的寻宝体验
研究人员在三种不同的场景下测试了这些想法:
- 模拟洞穴: 一个计算机生成的虚拟世界,在这里他们明确知道向导距离其地图有多远,以及向导有多少是在瞎猜。
- 真实药物数据 (ChemProp): 使用基于小型与大型数据集训练的真实世界模型。
- 统计安全网 (符合性预测/Conformal Prediction): 使用一种如果预测不符合已知模式就会将其标记为“不确定”的方法。
发生了什么?
- 没有修复措施时: 向导经常会找到看起来非常惊人但实际上是幻象的“宝石”(假阳性)。它会陷入那些它在进行疯狂猜测的区域。
- 有了修复措施后(尤其是“音量旋钮”策略): 向导不再在黑暗的角落浪费时间。它专注于它有信心的区域。
- 真实的、有效的命中次数(真正的宝石)增加了 50%(从 0.5 增加到 0.75)。
- 总的真实命中次数几乎翻了一番。
- 至关重要的是,他们并没有失去寻找高价值分子的能力;他们只是停止寻找那些虚假的分子。
核心启示
论文的结论是,我们不应该仅仅询问我们的 AI 向导“最好的分子是什么?”。我们还应该问:“你有多确定?”
通过将不确定性视为一种工具而非予以忽略,我们可以让 AI 对化学空间的探索变得更加稳健。这就像是给寻宝者配备了一个指南针,它不仅能指向黄金,还能在他们即将走出地图边缘时发出警告。其结果是,一种更快、更安全且更可靠的发现新药的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。