← 最新论文
💬 NLP

EnvHarness: Awakening Static Worlds for Agent Learning

本文介绍了 EnvHarness,这是一个可编程层,能够在不修改底层逻辑的情况下,通过动态重塑静态环境来针对智能体的弱点;以及 EnvRigger,一个能够合成这些组件的自动化系统,旨在显著提升智能体性能并实现跨多样化领域的持续协同进化。

原作者: Chengsong Huang, Zifeng Wang, Rujun Han, Jun Yan, Yanfei Chen, Zoey CuiZhu, Ke Jiang, Peng Xia, Han Yu, Yufan Zhuang, Yifei Ming, Jiaqi Pan, Bhavana Dalvi Mishra, Jiaxin Huang, Burak Gokturk, Tomas Pf
发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Chengsong Huang, Zifeng Wang, Rujun Han, Jun Yan, Yanfei Chen, Zoey CuiZhu, Ke Jiang, Peng Xia, Han Yu, Yufan Zhuang, Yifei Ming, Jiaqi Pan, Bhavana Dalvi Mishra, Jiaxin Huang, Burak Gokturk, Tomas Pfister, Chen-Yu Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,人工智能领域一直依赖于阅读海量的文本库来学习如何思考和表达。但随着这些系统被部署为独立智能体——在网页中导航、修复软件漏洞或管理办公任务——它们必须通过“做”来学习,即通过与会对其行为做出响应的数字环境进行交互。对于一个智能体而言,若要实现进步,它需要从这些交互中获得反馈,就像学生需要老师指出错误一样。问题在于,我们为它们构建的数字世界往往是僵化且不变的。它们是静态的舞台,无论表演者表现得多么笨拙或熟练,布景永远不会改变。如果一个智能体因为找不到隐藏物体而失败,环境并不会改变以帮助它学习,而只是简单地再次呈现那个同样无法完成的谜题。这种停滞限制了智能体的成长空间,使其陷入重复犯错的循环,而无法被挑战去克服困难。

谷歌云 AI 研究院(Google Cloud AI Research)与圣路易斯华盛闻大学的研究人员提出了一种打破这一循环的新方法,引入了一个名为 EnvHarness 的系统。他们并没有尝试从头开始构建全新的世界——这是一个昂贵且往往不可靠的过程——而是决定对现有世界进行修改。想象一下一片无法改变的冰封景观;EnvHarness 就像是一个可编程的层,位于这片景观之上,在不改变底层地貌的情况下重塑体验。它通过将静态环境包裹在一套插件组件中来实现这一点,这些组件可以调整初始条件、过滤智能体所见,或将不同的任务链接在一起。这使得一个原本不变的环境能够为挣扎中的智能体呈现一个隐藏物体,或者为学得太快的智能体移除一条捷径,同时保持原始规则和评分系统完好无损。

为了使这一过程自动化,团队创建了一个名为 EnvRigger 的配套系统。该系统将智能体视为一个“黑盒”,观察它执行任务的表现,并识别出它究竟在哪里失败。如果一个智能体不断犯同样的错误,EnvRigger 会诊断其弱点,并编写一套新的规则,迫使智能体直面该特定问题。随后,它通过让智能体进行新的尝试来测试这些新规则。如果智能体学会了并成功完成,则保留新规则;如果失败,则修订规则。这创造了一个持续的循环,使环境能够直接响应智能体的需求而演进,确保每一次训练都针对真实的弱点,而非仅仅重复智能体已经掌握的知识。

研究人员在五个不同的基准测试中测试了这种方法,涵盖了从软件工程、办公自动化到网页浏览及物理机器人模拟等领域。在每种情况下,在这些定制化环境中训练的智能体表现都优于在原始静态版本中训练的智能体。在一项具有挑战性的软件工程测试中,智能体的成功率提升了近 9 个百分点,同时完成任务所需的步骤也更少了。该系统在不同类型的 AI 模型(从较小、较快的模型到更大、更强大的模型)中都证明了其有效性,表明该方法具有鲁棒性和广泛的适用性。更令人瞩目的是该系统的扩展能力:随着研究人员增加定制化环境的数量,智能体的表现持续提升;相比之下,在标准或自动生成环境下训练的智能体最终会遇到性能瓶颈。

一项关键发现是,该系统不仅能修复特定错误,还能扩展任务的复杂度。通过将不同的环境链接在一起,研究人员创建了更长、要求更高的场景,要求智能体在较长时间内记住目标。这种能力使智能体能够培养出不仅仅是解决单个问题,而是管理一系列挑战的技能。结果表明,这种针对性的方法比单纯生成更多随机任务要高效得多。虽然其他生成新环境的方法往往会产生过于简单或过于重复的变体,但 EnvHarness 始终能产生与智能体当前能力水平完美匹配的训练场景。

研究还表明,这种方法在强化学习(一种智能体通过试错来最大化奖励的技术)中表现出色。在这些测试中,定制化环境提供的改进信号比原始环境更强,从而产生了能力显著提升的策略。研究人员指出,系统的成功并不依赖于特定的 AI 模型类型,也不需要重写环境的底层代码。由于完全在接口层面运行,该系统可以应用于任何领域,从在虚拟房屋中导航到调试代码,而无需为每个领域开发定制方案。

归根结底,这项工作重新定义了我们构建人工智能训练场的方式。研究人员表明,与其将环境视为一个必须从头重建以教授新课时的固定背景,不如通过适配现有的世界来匹配学习者。这种方法降低了创建新环境的工程负担,并确保了训练数据的可靠性,因为原始的验证系统从未受到破坏。研究结果为扩展智能体学习提供了一条切实可行的路径:让环境随智能体的成长而演进,持续提供恰到好处的挑战,以驱动真正的进步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →