← 最新论文
🤖 AI

PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments

该论文介绍了 PACE-Bench,这是一个基于模拟器驱动的基准测试,旨在评估自我进化智能体在物理环境发生变化时调整基于代码行为的能力,研究揭示了当前方法在机制重构方面存在困难,并且基于模拟器的反思优于未经验证的自我修正。

原作者: Yuhao Zhan, Bingxiang He, Zecong Tang, Chaojun Xiao

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuhao Zhan, Bingxiang He, Zecong Tang, Chaojun Xiao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何建造一座桥。你向它展示了如何建造一座在干燥、坚实地面上运行完美的桥梁。机器人学会了规则,编写了代码,并建造了一个稳固的结构。现在,想象一下你偷偷地把地面换成了一层冰面。昨天还完美运行的桥梁在今天瞬间崩塌。这正是许多智能计算机程序的日常现实:它们在固定的世界中遵循指令表现出色,但当游戏规则突然改变时,它们往往会陷入僵局。

科学家们正试图构建“自我进化智能体”(self-evolving agents)——即能够从错误中学习并进行自我修复,而无需人类按下“重置”按钮的 AI 系统。把这些智能体想象成电子游戏中的角色,它们不仅仅是背下了地图,而是会在掉进坑里后,实际修改自己的角色属性表。核心问题在于:如果世界的物理特性发生了变化(比如重力变强或摩擦力消失),这些智能体能否弄清楚为什么它们旧的方案失效了,并发明出一个全新的方案?这不仅仅是知道答案,而是要懂得在燃料改变时如何重新构建引擎。

这正是这项名为 PACE-Bench 的新论文所旨在测试的内容。研究人员创建了一个巨大的数字游乐场——一个“基准测试”(benchmark),以观察这些自我修复机器人处理物理规则突变的能力。他们不仅是给 AI 出了一道谜题,而是给它一个它已经解决过的谜题,然后秘密地改变了宇宙的规则,并问道:“你能修复你的方案吗?”

游戏规则:PACE-Bench

研究人员构建了 144 个不同的挑战,分布在六个不同的“物理世界”中,范围从简单的静态结构(如桥梁)到复杂的动态摆动(如摇晃的单摆或在泥泞中行驶的车辆)。

以下是游戏的运作方式:

  1. 源环境(The Source): 给出一个 AI 智能体一个任务和一个“源环境”(例如,在 10 米的间隙上建造一座桥)。它编写一段计算机程序来建造一座可以工作的桥。
  2. 转折(The Twist): 环境发生了突变。间隙可能突然变成了 20 米,风可能开始横向吹袭,或者材料可能变得易碎。旧的桥梁代码现在失效了。
  3. 挑战(The Challenge): 智能体有 20 次尝试的机会去观察失败的原因,推测发生了什么变化,并重写其代码以在条件下建造一座新桥。至关重要的一点是,智能体并不会被明确告知究竟发生了什么变化。它必须通过获得的反馈(例如:“你的桥断裂是因为接头在过大的压力下折断了”)来推断新的物理特性。

结果:谁通过了测试?

研究人员使用各种 AI 模型测试了 10 种不同的自我进化方法(即 AI 如何尝试自我修复的不同策略)。结果令人大开眼界:

  • 基准测试难度极大: 即便是最聪明的 AI 模型也表现挣扎。表现最好的组合(一种称为 Reflexion 的方法配合大型模型)仅在约 35.9% 的挑战中取得了成功。即使是顶尖的模型 GPT-5.5 也仅解决了较简单的“静态结构”(Statics)子集的 66.7%。这意味着该基准测试远未被“攻克”;在 AI 适应新物理现实的能力方面,仍存在巨大差距。
  • “反思”胜过“盲目修改”: 最成功的方法是 Reflexion。这种方法迫使 AI 停下来思考:“我失败是因为 X,所以我应该尝试 Y。”这就像一名学生在重新尝试之前,先通过复盘试卷来查看自己为什么答错了。相比之下,那些只是不断重写代码而不检查新想法是否合理的方法(称为 Self-Refine)往往会让情况变得更糟,从而导致错误累积。
  • 记忆可能成为陷阱: 一些方法试图通过记住过去的成功经验来帮助解决新问题。然而,论文发现,这往往会将 AI “锚定”在旧的、错误的思路上。AI 不再去探索新的解决方案,而是反复尝试微调那座已经注定失败的旧桥,作者将这种行为称为设计固着(Design Fixation)
  • 搜索却无法收敛: 其他方法尝试同时探索许多不同的想法(就像树木长出许多分枝)。虽然这有助于找到一些解决方案,但它们往往无法在 20 次尝试限制内找到最优解,从而陷入无止尽实验的循环中。

重大发现:“知其然”与“知其所以然”

或许最令人惊讶的发现来自一项特定的实验。研究人员尝试通过告诉 AI 究竟发生了什么变化来提供帮助(例如,“摩擦力现在是 0.5”)。你可能会认为这会让任务变得简单。

然而事实并非如此。即使 AI 知道了新物理特性的确切数值,它仍然无法解决问题。这表明真正的瓶颈不在于参数推断(搞清楚数值是多少),而在于机制重构(搞清楚如何根据这些数值重建结构)。仅仅知道风速是 50 英里/小时并不能解决问题,如果你不知道如何重塑桥梁以抵御阵风。

为什么这很重要

论文总结道,虽然 AI 在解决静态问题方面正变得越来越好,但在面对世界变化时的适应能力仍然非常笨拙。目前的“自我进化”工具往往过于僵化,要么过度固守初衷,要么过于混乱,无法找到稳定的解决方案。

作者指出,要让 AI 真正成为终身学习者,它需要变得更擅长重构机制,而不仅仅是微调参数。PACE-Bench 提供了一种可复现的方式来测试这一点,作为对下一代 AI 的“压力测试”,这些 AI 有望在复杂多变的现实世界中运行。就目前而言,论文表明,我们距离拥有那种能看到冰面上的坍塌桥梁并立即知道如何建造更好桥梁的 AI 还有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →