← 最新论文
💻 computer science

Beyond Executable Models: The Pufibara Agent Harness and the Modelica Agent Workflow Benchmark for Physical System Modeling

本文介绍了 Pufibara,这是一种旨在维持持久工程状态并将仿真证据与 Modelica 中物理系统建模的具体候选对象相链接的智能体框架,在全新的 232 项任务基准测试中,证明了其相比 Claude Code 具有更高的任务成功率和显著降低的资源消耗。

原作者: Zizhe Wang

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Zizhe Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在工程领域,建造一座桥梁、一个电网或一套供暖系统,不仅仅是编写计算机可以读取的代码。它要求数字模型必须表现得与它所代表的真实物理实体完全一致。几十年来,工程师们一直使用一种名为 Modelica 的专门语言来描述这些复杂的系统。与标准编程(即计算机按照从上到下的严格指令列表进行操作)不同,Modelica 通过陈述量之间的关系来工作,例如压力如何与流量相关联,或者电压如何与电流相关联。随后,计算机会自动计算出求解这些关系的操作顺序。这种灵活性非常强大,但也为人工智能创造了一个独特的难题。AI 可以轻易地编写出看起来正确且甚至能正常运行而不崩溃的 Modelica 代码,但其描述的物理系统却可能违反物理定律,或无法满足项目的特定需求。机器遵循了语法规则,却忽略了工程学的本质。

这种“一个仅仅能运行的模型”与“一个真正正确的模型”之间的差距,正是德累斯顿工业大学(TU Dresden)研究人员一项新研究所解决的核心挑战。由 Wang Zizhe 领导的研究团队旨在探索:AI 智能体(能够思考、行动并使用工具的程序)是否可以被信任去自主修复、构建和调试这些物理系统模型。他们发现,虽然目前的 AI 工具具备生成代码的能力,但在进行修改时,它们往往会丢失最初的工程目标,或者依赖于不再适用于当前模型的旧版本测试结果。为了解决这个问题,研究人员开发了一个名为 Pufibara 的新系统。该系统充当一个严格的监督者,负责保存项目要求的永久记录,确保 AI 每当修改模型时,都会根据原始目标重新检查新版本。他们使用一个包含 232 个不同工程任务的海量集合,针对该系统与一款领先的商业 AI 编程工具进行了测试。结果表明,新系统不仅解决了更多的题目,而且使用的计算资源显著减少,这证明了 AI 如何被引导与它所使用的智能本身同样重要。

研究人员通过认识到物理工程与编写标准计算机程序的不同之处来处理这一问题。在典型的软件项目中,如果一个程序运行没有错误,通常就被视为成功。但在物理建模中,一个模型可能运行得非常完美,却依然是错误的。例如,AI 可能会生成一个水泵模型,该模型可以编译并平滑地进行仿真,但如果该模型预测水在没有水泵的情况下会向上流动,那么它就未能通过工程测试。核心难点在于工作的迭代性质。当一个 AI 智能体试图修复模型时,它可能会修改一个参数,运行一次仿真,看到一个结果,然后修改另一个参数。如果没有精细的记忆系统,智能体可能会忘记第一次修改是必要的,或者它可能会错误地认为来自旧版本模型的仿真结果仍然适用于新模型。这种混乱可能导致智能体提交一个表面上看起来很好,但未能满足特定物理要求的最终模型。

为了防止这种情况,团队设计了 Pufibara,其采用了将工程要求视为“持久性义务”的特定架构。想象一位项目经理,他手里拿着一份清单,记录着建筑必须遵守的每一条规则,从钢材的强度到空气的流量。每当建筑师做出更改时,经理都会根据这份清单检查新的设计,并忽略任何不再匹配当前设计的旧测试结果。Pufibara 对 AI 智能体也正是这样做的。它维护着一个工程要求的“账本”,该账本在整个过程中始终保持活跃。它将每个仿真结果直接与产生该结果的具体模型版本联系起来。如果模型发生了变化,系统就会知道旧的结果不再有效,并强制智能体重新评估新版本。至关重要的是,系统要求智能体做出一个明确的决策来提交最终答案。AI 不能仅仅因为时间耗尽或代码编译通过就停止,它必须主动声明自己已经收集了足够的证据,以证明该模型符合所有的工程规则。

为了测试这种方法是否真的有效,研究人员需要一种公平且现实的方法来衡量性能。他们不能简单地使用现有的公开模型,因为 AI 可能已经在训练过程中见过这些模型,从而只是记住了答案。相反,他们创建了一个名为 Modelica Agent Workflow Benchmark 的新基准测试。他们从真实的、正在运行的工程模型开始,然后引入特定的故障、新的设计要求或调优目标,从而创造了 232 个独特的挑战。这些任务范围广泛,从修复损坏的模型到从零开始构建新模型,再到调整参数以达到特定的性能目标。该基准测试包含了一个隐藏的“评估器”,它充当独立的裁判。这个裁判看不见 AI 的内部思考过程或中间步骤;它只看智能体提交的最终模型,并检查该模型是否通过了一套严格的物理和行为测试。这确保了测试的是 AI 解决问题的能力,而不是它猜测测试形式的能力。

研究通过将新开发的 Pufibara 系统与一款知名的商业 AI 编程助手 Claude Code 进行对比,并使用两种不同的语言大模型作为智能体的“大脑”。结果清晰且一致。在所有 232 个任务中,Pufibara 成功完成的任务数量超过了这款商业工具。在使用其中一个特定的 AI 大脑时,Pufibara 解决了 202 个任务,而另一款工具解决了 185 个。在使用另一个 AI 大脑时,Pufibara 同样解决了 202 个任务,而竞争对手为 187 个。这种差异在需要从头开始构建模型的任务中最为显著,Pufibara 在这类任务中的表现明显优于另一套系统。除了解决更多问题外,Pufibara 也更加高效。它使用了大约 76% 到 82% 更少的计算 Token(即 AI 处理的基本信息单位),并且完成任务所需的时间也显著缩短,部分运行时间比竞争对手减少了多达 58%。

或许最重要的发现不仅在于 Pufibara 解决了更多的题目,还在于它解决了“正确类型”的问题。研究人员发现,竞争对手的工具经常生成的模型虽然可以执行并能通过基本检查,但却无法满足深层的物理要求。在一组困难任务中,这款商业工具提交的模型虽然运行没有错误,但在 38 个案例中有 21 个未能根据工程规则正确表现。而 Pufibara 只犯了 4 次此类错误。这表明,商业工具往往满足于一个“仅仅能运行”的模型,而 Pufibara 将证据与当前版本紧密挂钩,并强制要求验证所有工程义务的要求,从而防止了提交有缺陷的方案。这项研究表明,AI 智能体的工作流结构——即它如何记忆、检查和决策——与语言模型本身的智能水平同样关键。

这项工作的意义超越了仅仅一种类型的工程语言。研究表明,对于 AI 要想在物理和工程等复杂的现实领域发挥真正的作用,它不能仅仅是一个代码生成器。它必须是一个能够理解“程序可以运行”与“系统在物理上是正确的”之间区别的智能体。通过保持对需求的持久记录,并强制 AI 在每次做出更改时都针对这些需求重新验证其工作,该系统确保了最终输出是可靠的。研究人员指出,尽管他们的结果很强有力,但这些结果是针对所测试的任务和条件而言的。他们并不声称已经永久解决了 AI 在工程领域的问题,但他们提供了一个清晰的蓝图,展示了如何构建不太可能犯下危险错误的 AI 系统。随着领域的推进,未来的焦点可能会转向在更复杂的工业问题上测试这些方法,并探索它们在不同类型 AI 模型上的表现,以确保未来的工具能像它们所设计的系统一样可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →