Relation Reasoning with LLMs in Expensive Optimization
本文提出了一种名为 R2SAEA 的新型代理辅助进化算法,该算法利用经强化训练的大语言模型,针对高成本优化问题执行高效的零样本基于关系的推理,从而克服了传统代理模型的重训练开销,并实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在一片巨大且迷雾笼罩的山脉中找到最佳路线。问题在于,检查任何单个地点的海拔高度都需要一整天的徒步(这就是论文中所谓的“昂贵评估”)。你的时间有限(预算紧张),因此无法徒步走遍所有地方。
传统上,科学家使用“地图”(数学模型)来猜测低点的位置。但这些地图很棘手:随着你探索新区域,旧地图会变得无用,你必须花费宝贵的时间从头重绘它们。这正是论文试图解决的瓶颈。
以下是该论文解决方案的分解,以简单概念呈现:
1. 新“地图”:智能裁判而非计算器
与其试图预测某一点的确切高度(这很难且需要不断重绘),作者训练 AI 扮演拳击比赛中的裁判。
- 旧方法:AI 试图猜测每位选手的确切得分。
- 新方法(R2SAEA):AI 一次只看两名选手,并回答一个简单问题:“选手 A 是否比选手 B 更好?”
这被称为关系推理。由于进化算法(搜索方法)主要关心哪个选项比另一个“更好”,而不是具体数值,因此这种“裁判”方法要高效得多。
2. “锚点”技巧:避免图书馆式过载
如果你有 100 名徒步者,想知道每个人与其他每个人的比较情况,你就需要让裁判比较约 10,000 对组合。这对 AI 来说问题太多了(它会耗尽“内存”或上下文)。
作者发明了一种**“锚点”策略**:
- 不是一次性询问所有人,而是选出一名徒步者作为**“锚点”**(参考点)。
- 他们问 AI:“徒步者 A 与锚点相比如何?徒步者 B 与锚点相比如何?徒步者 C 与锚点相比如何?”
- 他们逐个为每位徒步者这样做。
- 结果:这将一大堆庞大而混乱的问题转化为一系列小型、可管理的列表。这就像让老师通过将每个学生与“班级平均分”逐一比较来给全班打分,而不是试图同时比较每对学生。
3. “投票”系统:将意见转化为分数
在 AI 判断完所有配对后,它拥有一堆“更好/更差”的意见。如何选出最佳徒步者?
- 系统使用投票机制。
- 如果 AI 说“徒步者 X 比 90% 的锚点都好”,那么徒步者 X 获得高分。
- 如果徒步者 X 比大多数都差,则获得低分。
- 这将 AI 的“意见”转化为清晰的排名,使搜索算法确切知道应派遣哪些徒步者进行昂贵的实地检查。
4. 训练裁判:强化学习(“教练”)
作者并未使用通用 AI,而是训练了一个特定的 AI(基于名为 Qwen2.5 的模型)成为大师级裁判。
- 他们创建了一个**“教练”**(强化学习),观察 AI 做出猜测。
- 如果 AI 正确判断了关系,教练给予奖励;如果猜错,则给予惩罚。
- 随着时间的推移,AI 学会了比通用 AI 更敏锐地察觉解决方案之间的细微差别。
- 神奇之处:一旦训练完成,该 AI 无需每天重新训练。它可以即时“思考”(推理)。这节省了巨大的时间和金钱。
5. “口袋大小”的裁判:在小型设备上运行
通常,强大的 AI 需要巨大且昂贵的超级计算机。作者表明,通过缩小模型并压缩其“大脑”(称为量化的过程),这位智能裁判可以在小型便携设备上运行,例如高端笔记本电脑,甚至是用于无人机或机器人的专用芯片(边缘设备)。
核心结论
该论文声称,通过将问题转化为一连串简单的"A 与 B"比较,利用巧妙的“锚点”方法使问题保持可管理,并训练专门的 AI 裁判,他们能够以比先前方法少得多的昂贵测试次数,找到困难问题的最佳解决方案。
- 更快:无需每次重绘地图。
- 更便宜:AI 可在更小、更便宜的硬件上运行。
- 效果更好:在测试中,该方法在单目标和多目标问题上均发现了优于其他顶级方法的解决方案。
作者已将其“智能裁判”和代码公开供他人使用,证明如果你提出正确的问题,就不需要超级计算机来解决昂贵的优化问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。