← 最新论文
🔬 physics

Heuristic Learning for Active Flow Control Using Coding Agents

本文介绍了一种利用编码智能体进行启发式学习的框架,用于直接搜索主动流动控制的显式、可解释反馈律,证明了该方法在 13 个基准测试中达到或超过了最先进的深度强化学习水平,同时提供了更高的透明度和物理洞察力。

原作者: Paul Garnier, Jonathan Viquerat, Elie Hachem

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Paul Garnier, Jonathan Viquerat, Elie Hachem

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何驾驶一艘非常棘手、且处于隐形状态的小船,穿过一条波涛汹涌的河流。这条河流充满了隐藏的漩涡和突如其来的巨浪,而你只能看到前方一小片水域。你的目标是让小船平稳行驶,既不撞毁,也不浪费燃料。

长期以来,科学家们一直尝试用**深度强化学习(Deep Reinforcement Learning, DRL)**来解决这个问题。你可以把 DRL 想象成一个超级聪明但神秘的学徒。你让这个学徒在计算机模拟中撞毁小船数千次,从每一次错误中学习。最终,这个学徒会变得非常擅长驾驶。但问题在于,学徒的大脑是一个由数字组成的巨大且错综复杂的网络(神经网络)。即使是科学家也无法轻易观察其内部并说:“啊,我明白了!因为水流在这里变快了,所以你把舵向左转。”这是一个虽然有效但无法解释的“黑盒”:它能奏效,但没人知道它究竟是如何思考的。此外,训练这样一个学徒需要消耗大量的计算能力和时间。

在这篇论文中,作者保罗·加尼尔(Paul Garnier)及其团队尝试了一种完全不同的方法。他们没有训练一个神秘的学徒,而是雇佣了一位编程智能体(Coding Agent)——你可以把它想象成一个才华横溢、不知疲倦的机器人程序员。

新策略:编写规则,而非学习感觉
与其让 AI 去微调数百万个看不见的数字,研究人员要求这个编程智能体编写实际的、可读的计算机代码,作为驾驶规则。这就像是要求智能体写一个简单的食谱:“如果左侧水面看起来波浪起伏,请等待 11 秒,然后将舵稍微向右推。”

智能体会尝试一个食谱,运行一次模拟,看看小船是否撞毁;如果撞毁了,智能体会重写食谱。它不断重复这个过程,阅读自己关于成功与失败的“日记”,直到找到一套完美的指令。

他们的发现(好消息)
团队在 13 个不同的流体力学挑战上测试了这种新的“机器人程序员”方法,范围从简单的二维流体到复杂的三维湍流通道。他们给予编程智能体与最优秀的 DRL 学徒完全相同的计算时间和相同的规则。

结果令人惊喜:

  • 13 个挑战中的 10 个中,机器人程序员找到的驾驶规则与表现最好的 DRL 学徒一样好,甚至更好。
  • 在一项特定的三维湍流通道测试中,这种新方法减少了近 40% 的阻力(空气/水阻力),击败了仅实现约 30% 减阻效果的 DRL 方法。
  • 最优秀的机器人程序员(被称为“Codex”)找到的解决方案是紧凑、可读且易于人类理解的。你实际上可以查看代码并理解其中的逻辑:“噢,它是利用延迟来等待波浪经过后再采取行动!”

他们排除了什么(“禁区”)
这篇论文对该方法“不是什么”有着严格的界定。

  • 不是一种不需要限制就能奏效的魔术。研究人员明确排除了让 AI 通过观察模拟中的“隐藏”部分或改变游戏规则来作弊的可能性。机器人程序员必须遵守与 DRL 学徒完全相同的严格规则。
  • 并不总是更好。在 13 个案例中的 3 个中,机器人程序员并没有完全超越 DRL 学徒。论文指出,虽然这种新方法是一个强有力的竞争者,但它尚未完全解决所有问题。
  • 不是关于拥有更多信息。团队曾尝试给机器人程序员提供一个观察整个河流的超强视角(全网格场)而非仅仅是几个传感器。令人惊讶的是,这并没有起到帮助作用;事实上,有时这会让搜索变得更加困难。论文表明,拥有过多的数据可能会干扰寻找简单、清晰规则的过程。

他们有多确定?
作者之所以对他们的数字充满信心,是因为他们在受控的模拟环境中进行了这些实验。他们不仅仅是在猜测,而是进行了测量。

  • 他们证明了机器人程序员可以找到匹配或超越表现最好的 DRL 方法的规则。
  • 他们展示了这些规则具有良好的迁移性。例如,他们为拥有 5 个喷口(执行器)的河流编写的规则,经过微调后可以完美适用于拥有 10 个喷口的河流,而无需从头开始。
  • 他们发现这些规则是鲁棒的(稳健的)。即使他们减少了传感器的数量(使视野变得非常模糊),机器人程序员仍能找到好的解决方案,而 DRL 学徒则表现得非常吃力。

大局观
这篇论文表明,我们可能不需要仅仅依赖那些庞大且神秘的神经网络来控制流体流动。通过使用现代编程智能体来搜索简单、人类可读的规则,我们可以获得相同(甚至更好)的性能,同时终于能够理解控制器做出决策的原因。这就像是将一根能奏效但不可捉摸的魔杖,换成了一本任何人都可以阅读、修改和信任的清晰、分步骤的说明书。

作者总结道,这种“启发式学习”(heuristic learning)是一种可靠且令人兴奋的传统方法替代方案,它将 AI 的力量与人类逻辑的清晰性结合在一起。他们甚至公开了他们的代码和提示词供他人尝试,证明了这不仅仅是一个秘密技巧,更是一种看待如何控制自然界无形力量的新思维方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →