← 最新论文
🤖 AI

CEDAR: Agent-Orchestrated Tree Search for Goal-Directed Optimization of Complex Systems

CEDAR 是一个自主框架,它通过在蒙特卡洛树搜索过程中利用大语言模型智能体,来自动发现并优化复杂的系统结构,从而实现对涌现行为的有目标设计,并减少传统建模工作流中通常所需的体力劳动。

原作者: Yingtao Tian

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Yingtao Tian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图烤出一个完美的蛋糕,但你手头没有食谱。你只有一个模糊的想法:“它需要口感蓬松、甜而不腻,且不会太沉重。”在现实世界中,许多事物——比如城市的扩张方式、病毒的传播方式,或者经济对新法律的反应——都非常像这个蛋糕。它们是“复杂系统”,这意味着它们由许多相互作用的部分组成,这些部分通过循环进行沟通。如果你改变其中一个环节,这种变化会以意想不到的方式波及整个系统。几十年来,科学家们一直试图为这些系统构建数字模型以预测未来,但这一直是一场噩梦。通常,这需要人类专家编写非常具体且困难的代码,即便如此,想要弄清楚如何微调模型以达到理想的结果,就像是通过猜测风向来驾驶一艘船一样困难。

现在,出现了一种名为 CEDAR 的新方法。把它想象成一支由超级聪明、不知疲倦的机器人厨师组成的团队,他们正齐心协力地从零开始发明那份完美的蛋糕食谱。CEDAR 并不依赖人类编写代码,而是使用一种特殊的智能(大语言模型,简称 LLM),它扮演着“法官”(Judge)和“编辑”(Editor)的角色。编辑尝试重写食谱(即计算机代码)以让蛋糕变得更好,而法官则品尝结果并给出评分。但最神奇的地方在于:它们并非在盲目猜测。它们使用了一种叫做“蒙特卡洛树搜索”(Monte Carlo Tree Search)的策略,这就像一名侦探在探索一个巨大的、分支繁多的迷宫。在每一个岔路口,侦探都会询问:“如果我走这条路,能否找到更好的蛋糕?”这使得系统能够探索数千个不同版本的食谱,从错误中学习,并找到人类可能永远无法想到的路径。论文表明,这支机器人团队可以接手一个混乱的现有模型,并自动对其进行改进,以实现诸如“增加人口增长但保持低污染”之类的目标,其速度和创造力都超过了传统方法。

机器人厨师与可能性的迷宫

本文的核心思想是,我们可以利用人工智能来自动设计并改进复杂系统,这些系统是模拟生态系统、经济或人口等事物的模型。这些系统之所以棘手,是因为它们充满了反馈循环——其中一部分的输出变成了另一部分的输入,从而创造了一个难以预测的因果网络。传统上,构建这些模型是一项缓慢且繁重的工作,由专家使用专门且过时的软件完成。如果你想修改模型以观察添加一条新规则会发生什么,你必须亲自重写代码。

CEDAR 通过将这一过程转变为一种自主的、自动驾驶的过程,改变了游戏规则。它将创建系统模型的过程视为一场探索游戏。该系统被表示为一段 Python 代码(一种常见的编程语言),用于模拟系统随时间变化的过程。目标是找到一个行为符合人类预期(例如“在最大化人口增长的同时最小化污染”)的代码版本。

为此,CED 采用了两个在循环中工作的 AI 智能体:

  1. 编辑 (The Editor): 这个 AI 查看当前的代码和模拟结果。然后,它会对代码提出修改建议。它可能会微调一个数值,在变量之间增加新的关系,或者改变公式的工作方式。它就像一位试图尝试新食材的创意厨师。
  2. 法官 (The Judge): 这个 AI 运行新代码,观察模拟过程,然后根据目标进行评估。它会给新版本打分,并写出一份详细报告,解释其表现优异或糟糕的原因。它就像一位品尝蛋糕的食评人。

但仅仅尝试随机的变化是不够的。这就是蒙特卡洛树搜索 (MCTS) 发挥作用的地方。想象一棵树,树干是你的初始模型。每当编辑做出一次改变,就会长出一个新的分支。MCTS 算法决定下一步探索哪些分支。它不仅仅选择目前看起来最好的分支;它在探索新奇想法(以寻找隐藏的瑰宝)与深入挖掘最有希望的路径之间取得平衡。这防止了系统陷入“足够好”的局部最优解,并帮助它找到真正惊人的结果。

实验:从世界动态到人口增长

作者在两个主要挑战上测试了 CEDAR,以验证其是否真的有效。

挑战 1:“世界动态”蛋糕
第一个测试使用了一个著名的复杂模型,称为“世界动态”(World Dynamics),它模拟了人类人口、自然资源和污染的协同演化。这个原始模型由一位人类专家在 20 世纪 70 年代创建,它显示出如果任其自然发展,人口会增长,资源会被耗尽,且污染会激增。CEDAR 的目标是微调这个模型,寻找一个“甜点”,即人口可以增长,但资源不会枯耗,且污染保持在较低水平。

结果令人印象深刻。CEDAR 不仅仅是找到了小幅度的改进;它发现了全新的平衡系统的方法。在一次运行中,它成功地在 200 年内将人口增加了 6.4 倍(从 16.5 亿增加到 105.7 亿),同时仅消耗了 19.9% 的自然资源,并将污染积累控制在极低水平。这比原始模型有了巨大的进步,原始模型显示出大规模的资源枯竭和污染激增。论文指出,不同的 AI “大脑”(如 Claude 和 GPT-5.1)找到了不同的解决方案,这表明 CEDAR 可以发现多种有效的解决问题的方法,而不仅仅是单一答案。

挑战 2:从蛋糕中推测食谱
第二个挑战更加困难。团队给了 CEDAR 一个“地面真值”(ground truth)系统——一个带有随机、不可预测元素(例如死亡率每一步都在随机变化)的复杂人口模型。他们没有告诉 CEDAR 这个系统的公式。相反,他们给了它一份随时间变化的人口数据记录,并要求它构建一个能够重现该记录的模型。

为了公平起见,他们将 CEDAR 与一种标准的优化工具 Optuna 进行了对比。他们给了 Optuna 三种不同程度的帮助:

  • 无公式: 仅有两个简单的数字(出生率和死亡率)。
  • 简单公式: 一个基础的反馈循环。
  • 完整公式: 真实系统的精确数学结构(已知结构)。

尽管 CEDAR 在起始阶段没有任何公式(它必须自己发明结构),但它的表现甚至超越了拥有完整公式(已知结构)的 Optuna。在模拟中,CEDAR 实现了更低的误差率(L1 距离为 2.22),而拥有完整公式的 Optuna 的 L1 距离为 3.71。这表明 CEDAR 非常擅长探索可能性空间,它仅通过观察数据就能推导出系统的底层规则,而无需人类预先告知其方程。

为什么这很重要(以及它不具备的能力)

论文指出,这种方法可以使复杂系统建模变得更加容易。用户不再需要拥有系统动力学博士学位来编写代码,只需用简单的英语描述一个目标,CEDAR 就会完成繁重的工作。它还提供了“可解释性”,这意味着 AI 会解释它为什么要做出改变。例如,在“世界动态”实验中,AI 解释了它是如何通过减少 25-40% 的资源使用量和 30-40% 的污染产生量来实现更好的平衡。这些解释有助于人类理解 AI 正在进行的权衡。

然而,作者对其声明保持谨慎。他们指出,虽然这些模拟结果很强,但该方法的理论保证(即证明它一定能找到最优解的数学证明)仍是一个开放性问题。他们还提到,“法官”和“编辑”都是大语言模型,这意味着存在两者互相强化彼此错误的微小风险,尽管树搜索结构有助于防止这种情况。论文并未声称这是一个解决了所有现实场景问题的方案,而是将其视为一种强大的新工具,表明我们可以自动化地发现复杂的系统行为,而这在以前是无法想象的。

简而言之,CEDAR 就像是给了一支 AI 探险队一张通往广袤、未知森林(所有可能的系统模型空间)的地图和指南针(目标)。它们不再是漫无目的地游荡,而是利用一种聪明的策略,去寻找那些最美丽、最有用的林间空地,并经常发现人类徒步旅行者从未想过要去寻找的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →