← 最新论文
💬 NLP

PathWise: Planning through World Model for Automated Heuristic Design via Self-Evolving LLMs

PathWise 是一种新颖的多智能体框架,通过将组合优化中的自动化启发式设计过程建模为 entailment 图上的状态感知序贯决策任务,从而以战略规划和自我演进的推理取代短视的试错,以实现更快的收敛和更好的泛化能力。

原作者: Oguzhan Gungordu, Siheng Xiong, Faramarz Fekri

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Oguzhan Gungordu, Siheng Xiong, Faramarz Fekri

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于PathWise论文的解读,已用通俗易懂的语言并辅以生动的类比进行翻译。

宏观图景:教导机器人发明更优规则

想象你面对一个巨大且凌乱的拼图(例如旅行商问题,即送货员需要找到访问 100 个城市的最佳最短路线)。为了解决这个问题,人类通常会编写“规则”(启发式算法)来指导计算机如何选择下一个城市。

长期以来,计算机尝试利用大语言模型(LLMs)(即那种能写文章或代码的同类人工智能)自动编写这些规则。然而,以往的方法有点像一位厨师试图通过随机向锅里扔食材、尝一口味道,然后寄希望于好运来发明新食谱。它们经常重复犯错,忘记过去的成功经验,或者陷入死循环,反复尝试同样的糟糕点子。

PathWise是一个新系统,它改变了这一过程。它不再进行随机猜测,而是像一个聪明且善于自我反思的建筑师,通过构建自身思维过程的地图,从而更快地设计出更优的规则。


核心问题:过往人工智能的“失忆症”

该论文指出,以往用于设计这些规则的人工智能方法存在两个主要缺陷:

  1. 它们遗忘了过去:它们将每一次新的尝试都视为第一次,忽略了从过往失败中吸取的教训。
  2. 它们缺乏洞察力:它们不理解规则为何有效或为何失败,仅仅关注最终得分。

这导致了“短视”的结果,人工智能浪费了时间,反复重新发现同样的糟糕点子。

解决方案:PathWise(“世界模型”方法)

PathWise 通过将设计过程视为一个带有存档功能的电子游戏来解决这一问题。它使用了一种称为**蕴含图(Entailment Graph)**的特殊结构。

将蕴含图想象成一张思想的族谱

  • 节点(人物):每个节点代表人工智能创建的一个特定规则(启发式算法)。
  • 边(关系):连接它们的线条展示了规则是如何从一个衍生到另一个的。人工智能是组合了两个想法?还是微调了其中一个?
  • 记忆:这张图记住了整个历史。它知道“规则 B"是对“规则 A"的轻微改进,而“规则 C"之所以失败,是因为它忽略了交通模式。

工作原理:三方代理团队

PathWise 不仅仅使用一个人工智能,而是使用一个由三个专业化代理组成的团队协同工作,这就像一支电影制作团队

1. 导演(策略代理)

  • 角色:该代理查看“族谱”(图),并决定下一步行动。
  • 行动:它选择哪些过往规则作为“父母”,并撰写一份“剧本”(指令),告诉下一个代理如何混合它们。
  • 类比:想象一位导演看着分镜脚本说:“让我们采用第 3 场的灯光和第 5 场的镜头角度,但让画面更暗一些。”

2. 演员(世界模型代理)

  • 角色:该代理接收导演的剧本,并实际编写代码(新规则)。
  • 行动:它根据指令生成实际的计算机程序。
  • 类比:这就是阅读剧本并演绎场景的演员。它努力将导演的愿景变为现实。

3. 评论家(评论代理)

  • 角色:这些代理观看表演并提供反馈。
  • 行动:它们将新规则与旧规则进行比较。如果新规则更好,它们会告诉导演:“干得漂亮,继续保持!”如果更差,它们会说:“那个灯光太暗了;试试别的。”
  • 类比:这些是影评人和导演的助理。它们不仅仅说“好”或“坏”;它们解释为什么,以便导演能改进下一份剧本。

秘密武器:“状态感知”规划

PathWise 的魔力在于,它不仅仅关注当前的得分,而是审视整个旅程

  • 旧方法:“我试了这个,失败了。让我们尝试一个完全不同的东西。”
  • PathWise 方法:“我试了这个,失败了,因为我忽略了到下一个城市的距离。我也试过那个,效果很好。让我们将第二次尝试中的距离逻辑与第一次尝试中的速度逻辑结合起来。”

通过保持这种“有状态的记忆”,PathWise 避免了重复犯错,并在成功的基础上进行构建,从而实现了更快的收敛(更快地找到最佳解决方案)。

结果:更快且更智能

该论文在多种复杂谜题(如卡车路线规划、装箱问题以及旅行商问题)上测试了 PathWise。

  • 速度:与其他方法相比,PathWise 用更少的尝试次数找到了更好的解决方案。它更快地到达了“终点线”。
  • 质量:它发明的规则优于人类或其他人工智能方法所制作的规则。
  • 通用性:它能很好地与不同类型的人工智能模型(“骨干”)配合,并适用于不同规模的问题。

总结类比

想象你正在尝试发明完美的三明治。

  • 旧人工智能:你做一个三明治,吃掉它,如果味道不好,你就把它扔掉,然后毫无记忆地随机制作一个全新的三明治,完全不记得你加了什么。
  • PathWise:你保留一本食谱日记。当你制作三明治时,你记录下你具体做了什么。如果味道不好,你阅读日记,意识到盐放多了,并记下这一点。下次,你请一位“评论家”审查你的日记,它会告诉你:“不要只是猜测;使用周二那个低盐的食谱,但加上周一的奶酪。”

PathWise 就是这套聪明的食谱日记系统,它允许人工智能从自身历史中学习,从而为复杂问题发明更好的解决方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →