Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces
本文介绍了 OPT*,这是一个具有扩展搜索空间的、可扩展的优化类任务族,它通过基于求解器引导的在线策略优化和基于搜索的离线强化学习,使大语言模型能够进行逐步的类优化推理训练与评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个非常聪明但有点天真的机器人厨师,如何烹饪一道复杂的、多道菜的盛宴。
问题所在:“足够好”陷阱
目前,这些 AI 厨师(大语言模型)非常擅长遵循只有唯一正确答案的食谱,比如解决数学方程或编写可以编译的代码片段。如果它们得到了最终答案,就会得到一颗金星。
但现实生活并非如此。现实生活更像是为 50 辆卡车规划配送路线、为 20 名员工分配 20 个不同的班次,或者装载一辆搬家卡车。在这些场景中,并不存在唯一的正确答案,而是存在成千上万种“有效”的方法(没有出错,每个人都有工作),但其中只有极少数是“极佳”的方法(最短距离、最高满意度、最少空间浪费)。
论文指出,目前的 AI 在处理这类问题时表现挣扎。它可能会找到一个有效的计划,但往往会陷入一个“足够好”的计划中,并因此错过那个“完美”的计划,因为它不知道如何提前观察或及早剔除糟糕的想法。
解决方案:OPT⋆(无限游乐场)
作者创建了一个新的训练场——OPT⋆。你可以把它想象成一个视频游戏关卡生成器,它可以让游戏变得越来越难,而无需人类设计师来绘制新关卡。
- 游戏: 他们使用了经典的优化谜题(如旅行商问题,即以最短路径访问城市,或将物品装入背包)。
- 作弊条(辅助工具): 游戏内置了两个工具:
- 规则检查器: 立即告知你某个动作是否非法(例如:“你不能把那个沉重的箱子放在脆弱的箱子上面”)。
- 计分员: 立即告诉你最终结果有多好(例如:“你的路线节省了 10 分钟”)。
- 难度调节旋钮: 你可以通过旋转一个旋钮(称为 )来增加更多的城市、更多的工人或更多的物品。这会让可能的路径呈指数级爆炸式增长,但规则和评分机制保持简单且自动化。不需要人类来批改作业。
他们是如何教 AI 的:两种方法
论文测试了两种教导 AI 在这些庞大且不断扩张的迷宫中导航的方法:
1. “离线”方法:寻宝游戏
想象一下,AI 被丢进了一个黑暗的洞穴(搜索空间),手里只拿着一把手电筒。它没有地图。
- 策略: AI 到处乱逛,尝试不同的路径。当它发现一条通往宝藏(高分)的路径时,它会记住这条路径。
- 诀窍: 论文引入了两个“智能过滤器”来提高寻宝效率:
- 保镖(可行性检查): 如果 AI 试图穿墙而过(执行非法动作),保镖会立即阻止它。这样它就不会在死胡同里浪费时间。
- 孪生检测器(去重): 有时 AI 会用英语说“向北走”,用法语说“向上走”,或者用西班牙语说“向上移动”。这些其实都是同一个动作。孪生检测器意识到它们是相同的动作,并只保留一个,从而避免 AI 浪费精力重复思考同一个想法。
- 结果: AI 学会了忽略死胡同和重复的想法,从而更快地找到宝藏。
2. “在线”方法:拥有预知能力的教练
在这种情景下,AI 有一位能够看到未来的教练(求解器)。
- 策略: AI 做出一个动作。教练观察这个动作,并立即计算:“如果你采取这一步,从这里开始你最高能达到的分数是 90 分。”
- 奖励: AI 不必等到游戏结束才获得分数,而是能在每一步都获得即时反馈。如果某一步会导致潜在得分降低,教练会说:“坏的动作!”如果某一步能带来高潜力,教练会说:“好的动作!”
- 结果: AI 学会了如何进行步步优化的决策,而不是仅仅寄希望于一个好的结局。
他们的发现
- “分支”瓶颈: 随着游戏变得越来越难(更多城市/物品),路径的数量增长得如此之快,以至于普通的搜索就像是在一个银河系规模的草堆里寻找一根针。论文从数学上证明,要取得成功,AI 必须变得更擅长过滤掉坏路径,而不仅仅是更努力地尝试。
- 过滤器奏效了: “保镖”和“孪生检测器”(离线方法)显著提高了搜索效率。AI 比不使用它们时能更快地找到高质量的解决方案。
- 教练法效果最好(但成本高): 使用教练(求解器)的“在线”方法培养出了最聪明的 AI,但它需要一台强大的计算机来充当教练。而“离线”方法在没有超级计算机可用时是一个很好的备选方案。
- 泛化能力: 当他们在这些优化谜题上训练 AI 时,它在其他空间任务(如旋转形状或覆盖网格)上也变得更出色了,甚至提高了其数学推理能力。这表明 AI 学到的是一种通用的“如何规划”的技能,而不仅仅是解决某一个特定谜题的技巧。
简而言之
这篇论文介绍了一种通过使用可以自动变得无限难的游戏来训练 AI 进行复杂规划的方法。通过教导 AI 快速识别非法动作并避免重复相同的想法,我们可以帮助它在庞大且复杂的难题中找到最优解,即使没有人类老师在旁边监督。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。