← 最新论文
🤖 AI

Agent-G2^2: Gaussian Guidance for Agentic Reinforcement Learning

Agent-G2^2 是一种新颖的强化学习框架,它通过从在线估计的高斯分布中进行采样来优化基于提示的引导深度,从而在智能体任务中超越了现有的确定性和探测式方法,同时显著降低了计算成本。

原作者: Zixuan Wang, Yanrui Miao, Zhengxi Lu, Teng Pan, Yiwen Qiu, Hongxing Li, Peng Qiu, Ruiqing Zhang, Yongliang Shen

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Zixuan Wang, Yanrui Miao, Zhengxi Lu, Teng Pan, Yiwen Qiu, Hongxing Li, Peng Qiu, Ruiqing Zhang, Yongliang Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机程序正试图学习如何在复杂的环境中导航,比如一个机器人在房屋中移动,或者一个虚拟代理在网站上购物。这些任务通常需要一系列长链条式的决策,程序必须经过许多步骤才能最终成功或失败。核心问题在于,程序只有在最后结束时才会收到一个关于它赢了还是输了的信号。这使得学习变得异常困难,就像通过在骑完一英里路后才被告知“做得好”或“你摔倒了”来学习骑自行车一样,而在中间过程中,你并不知道自己的转向是否正确。为了帮助程序学习,研究人员尝试在每次尝试开始时给它一个“提示”:一段由专家完成的完美路径的短片段。这给了程序一个良好的开端,让它更接近终点线,从而可以学习剩余的步骤。然而,一个关键问题仍然存在:应该展示多少专家路径?展示得太少,程序依然会迷失方向;展示得太多,它只会单纯地模仿专家而学不到任何新东西。

长期以来,研究人员在处理这个问题时,仿佛存在一个适用于所有任务的完美辅助量,或者他们试图通过运行许多昂贵的额外练习轮次来测试不同的辅助水平,从而为每个特定任务猜测出正确的量。浙江大学和百度的一个研究团队提出的新观点认为,这两种方法都偏离了目标。研究人员发现,“最佳点”并不是一个单一、精确的点,而是一个范围。对于任何给定的任务,都存在一个能产生良好效果的不同辅助量的区间,并且这个区间会随着任务难度的不同而移动。与其试图确定一个精确的数字,该团队开发了一种将合适的辅助量视为随程序学习而变化的灵活范围的方法。他们将这个系统称为 Agent-G2。

研究人员在两个具有挑战性的环境中测试了他们的想法:一个是文本世界,其中的智能体必须完成如捡拾物品或打扫卫生之类的家务活;另一个是模拟在线商店,其中的智能体必须搜索并购买特定商品。他们使用语言模型作为这些智能体的“大脑”。在实验中,他们发现最有效的辅助量在理想点周围呈钟形曲线分布。这意味着对于一项困难的任务,广泛的辅助水平可能都会奏效,而对于较简单的任务,其范围可能会更窄。至关重要的是,他们发现任务的难度与专家路径的长度密切相关。一个需要二十个步骤的任务通常比仅需两个步骤的任务更难。

为了解决寻找正确辅助量而浪费时间的问题,Agent-G2 根据任务长度对任务进行分组,然后利用当前练习轮次的结果来调整下一轮的辅助量。如果短任务组进展得过于顺利,系统会自动减少给予它们的辅助量。如果长任务失败了,则增加它们的辅助量。系统通过计算每个组的中心点和跨度来实现这一点,本质上是创建了一个关于学习应发生之处的动态地图。然后,它会为每次新的尝试从该地图中随机抽取一个特定的辅助量。这种方法允许系统同时探索多种有效的起始点,确保既容易又难的任务都能得到适当的推动,而无需为了确定设置而运行额外的测试。

结果令人瞩目。在家庭任务环境中,使用较小的模型实现了 95.3% 的成功率,使用较大的模型实现了 98.4% 的成功率。这优于现有的使用提示的最强方法,也优于那些尝试在没有任何提示的情况下进行学习的方法。或许最重要的一点是,新方法使用的计算资源远少于之前试图为每个任务单独猜测合适辅助量的最佳方法。那些旧方法需要运行许多额外的练习轮次来寻找答案,这既缓慢又昂贵。新系统则是在运行过程中实时学习正确设置,利用它正在收集的数据来改进智能体。

研究还表明,该系统在不同规模的计算机模型上都能表现良好,证明了辅助交付的方式与进行学习的“大脑”规模同样重要。事实上,使用这种智能引导系统的较小模型,其表现优于使用旧有、不够复杂方法的更大模型。研究人员指出,他们的方法依赖于为每个任务准备一个完美的示例路径作为开始。如果没有这样的完美路径,该系统就无法直接使用。然而,对于许多专家可以演示正确路径的现实问题,这种方法提供了一种强大的方式,教人工智能如何从自身的错误中学习,而不是仅仅模仿它所看到的东西。通过将合适的指导视为一个灵活的范围而非一个固定的数字,研究人员找到了一种更高效且更稳健的方法,来帮助机器掌握复杂的长期目标。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →