Diffusion Large Language Models for Black-Box Optimization
本文介绍了 dLLM,这是一种用于离线黑盒优化的新颖方法,它利用带有上下文去噪模块和掩码扩散树搜索的扩散大语言模型,通过迭代优化设计,在少样本场景下实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一位试图发明完美新配方的顶级大厨。然而,你面临一个巨大的难题:你手里只有一个记着 10 个旧配方及其评分的小笔记本。你没有可以实时测试新想法的厨房,因为测试成本太高或过于危险。你必须仅通过观察这个小笔记本,就找出最好的新配方。
这就是**离线黑盒优化(Offline Black-Box Optimization)**的挑战。所谓的“黑盒”,就是那个决定一个设计(比如一段 DNA 序列或一个机器人形状)好坏的未知规则。而“离线”的部分是指你无法进行实时的测试,只能利用过去的数据。
以下是这篇论文提出的新方法 dLLM 如何解决这一问题的,通过简单的类比来解释。
旧方法的缺陷
以往解决此类问题的方法使用的是自回归模型(Autoregressive Models)。把它们想象成一个作家,从左到右、一个词一个词地写故事。
- 缺陷: 如果你在写一个句子,句子的结尾往往会改变你应该如何书写开头。但一个从左向右写作的人在写开头时看不见结尾。他们会错过“全局观”层面的联系。在复杂的设计(如 DNA)中,每一部分都依赖于其他部分,因此严格地从左向右书写往往会导致混乱且平庸的结果。
新方案:“扩散”大厨
作者引入了扩散大语言模型(Diffusion Large Language Models, dLLMs)。与其一个词一个词地写作,不如想象一位大厨,他从一碗空白且被遮盖的食材(用 [M] 表示)开始,然后逐步揭开配方,并在过程中不断精炼。
这种方法有两个超能力:
- 双向视野: 大厨可以同时观察整碗食材。他们可以看到“结尾”如何影响“开头”,从而能够进行全局性的修正,而不只是局部修正。
- 迭代精炼: 他们不会瞬间猜出最终的菜肴。他们从一个粗略的草图开始,然后慢慢填补空白,每一步都变得越来越好。
它是如何运作的:两步舞曲
论文结合了两个聪明的技巧,让这位大厨变得更加出色:
1. 上下文内去噪(“智能提示”)
在大厨开始烹饪之前,你会给他们一张特殊的指令卡。这张卡片包含:
- 目标: “制作一段能最紧密粘附于特定蛋白质的 DNA 序列。”
- 笔记本: 你离线数据集中那 10 个示例。
- 命令: “请提议一个更好的新序列。”
模型阅读这张卡片,并利用其庞大的预训练知识(就像一位读过数百万本食谱的大厨一样),开始对被遮盖的食材进行“去噪”。它将空白的 [M] 转化为实际的字母(A, C, G, T),缓慢地揭示出一个候选设计。
2. 掩码扩散树搜索(“分支探索者”)
仅仅猜测一个配方是不够的。如果大厨陷入了一条错误的路径怎么办?作者添加了一个**树搜索(Tree Search)**机制。想象大厨不仅仅是在做一道菜,而是设置了一系列分支的可能性:
- 选择(Selection): 大厨查看所有当前的局部配方,并挑选出最有希望的一个作为下一步的研究对象(使用一种平衡“尝试新事物”与“坚持已知有效做法”的评分机制)。
- 扩展(Expansion): 他们拿着那个有希望的局部配方,生成几种不同的方式来填补接下来的几个空白。现在,你拥有的不再是一条路径,而是一棵由许多可能性组成的树。
- 评估(Evaluation): 对于每一个新分支,他们使用一个“预测器”(高斯过程,类似于根据你的 10 个示例训练出的智能计算器)来猜测如果完成这个设计,最终的菜肴会有多好。
- 回溯(Backpropagation): 如果一个分支看起来很美味,大厨会记住这条路径并进一步探索;如果一个分支味道不好,他们就会修剪掉它,不再浪费时间。
这个过程就像是蒙特卡洛树搜索(Monte Carlo Tree Search)(一种用于 AI 玩围棋的策略),只不过 AI 不是在下棋,而是在玩“填空游戏”,以寻找完美的设计。
实验结果
论文在四个不同的挑战上测试了这种方法:
- 蚂蚁形态学(Ant Morphology): 设计一个爬行速度快的机器人蚂蚁。
- D'Kitty 形态学(D'Kitty Morphology): 设计一个爬行速度快的机器人猫。
- TF Bind 8 & 10: 设计短 DNA 序列以粘附到特定的蛋白质。
在所有这些测试中,dLLM 方法的表现都优于现有的所有方法,包括那些使用梯度、生成模型或标准语言模型的方法。即使在只有 10 个示例可以学习的情况下,它在寻找绝对最佳设计(即“前 1%”)方面表现得尤为出色。
总结
把旧方法想象成一个只能从左向右书写且容易卡壳的作家。而新的 dLLM 方法则像是一位大师级大厨,他:
- 阅读你有限的笔记本和指令。
- 从一张空白画布开始。
- 在观察全局的同时,缓慢地揭示设计。
- 使用树搜索策略同时探索许多种“如果……会怎样”的情景,以确保不会错过完美的解决方案。
这使得他们即使在数据稀缺且游戏规则隐藏的情况下,也能找到最好的设计。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。