AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning
本文介绍了 AEM,一种用于多轮智能体强化学习的无需监督的信用分配方法,该方法通过自适应调节响应级熵动力学来改善探索与利用的权衡,并在 SWE-bench-Verified 等具有挑战性的基准测试中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教导一位非常聪明但缺乏经验的机器人助手如何解决复杂的多步骤谜题,例如在虚拟房屋中导航以找到特定物品,或调试一段计算机代码。机器人尝试不同的动作,但只有在整个过程的最后才会收到“干得好!”或“再试一次”的反馈。它并不知道哪一个具体步骤对最终结果起到了帮助或阻碍作用。这正是本文要解决的核心问题:当奖励仅在终点出现时,如何将功劳归于正确的步骤?
作者提出了一种名为**AEM(自适应熵调节)**的新方法。以下是其工作原理,辅以简单的类比:
问题所在:“盲目”的导师
在传统训练中,机器人会执行一系列漫长的动作(称为“轨迹”)。如果它成功了,导师会说“干得漂亮!”,机器人便认为它采取的每一步都是好的。如果它失败了,导师会说“干得不好!”,机器人便认为每一步都是坏的。
- 缺陷:这就像一个学生参加了一场包含 10 道题的数学考试。如果学生得了满分,老师会表扬第 3 题,尽管第 3 题只是幸运猜中的,而第 7 题才是他们真正挣扎的难题。机器人会感到困惑,不知道应该继续做什么,又应该停止做什么。
解决方案:AEM(“信心计”)
本文提出了一种方法,让机器人审视自身的“信心”(文中称为熵),以此判断哪些步骤实际上是好的或坏的。
将熵想象成机器人的不确定性计:
- 高熵(高不确定性):机器人在胡乱猜测。它正在探索新的、有风险的路径。这就像学生因为不懂材料而胡乱猜测答案。
- 低熵(高信心):机器人对自己的答案很有把握。它正在利用已知的知识。这就像学生自信地写下自己已熟记的公式。
AEM 如何运作:“智能教练”
AEM 就像一位智能教练,实时观察机器人的信心计,并根据具体情况调整“表扬”或“批评”。
当机器人在探索时(训练早期):
- 机器人不确定,正在尝试许多不同的事物(高熵)。
- 如果它犯了错,教练会说:“没关系!你正在探索。下次让我们尝试一些更不同的东西。”(AEM 增加了探索的压力)。
- 如果它幸运地成功了,教练会说:“太棒了!但既然你只是在猜测,先别太自满。”(AEM 保持探索的持续进行)。
当机器人在利用时(训练后期):
- 机器人已经掌握了规则并充满信心(低熵)。
- 如果它犯了错,教练会说:“等等,你本该对这一点很有把握的!你需要重新思考你的策略。”(AEM 增加了改变的压力)。
- 如果它成功了,教练会说:“完美!你清楚自己在做什么。就继续完全照这样做。”(AEM 强化了这种自信的行为)。
魔法技巧:
本文从数学上证明,可以利用机器人自身的“惊讶”程度(即其答案与其通常行为相比的意外程度),自动决定是鼓励它更大胆(探索)还是更谨慎(利用)。你不需要人类去评估每一个步骤,也不需要额外的数据。机器人利用其内部的“信心”进行自我修正。
结果:制胜策略
作者在三种不同类型的“谜题”上测试了这种方法:
- ALFWorld:一款基于文本的游戏,机器人需要在虚拟房屋中清洁、烹饪和整理。
- WebShop:一个模拟的在线购物任务,机器人需要搜索并购买特定物品。
- SWE-bench:一项极具挑战性的任务,机器人需要修复真实世界软件代码中的错误。
发生了什么?
- 机器人学习得更快,解决的谜题也比以前更多。
- 在最难的软件工程测试(SWE-bench)上,将 AEM 添加到现有最佳方法中,将成功率提高了1.4%。虽然这听起来很小,但在人工智能领域,对于如此困难的任务而言,这是一个巨大的飞跃。
- 该方法在小型和超大型 AI 模型(从 15 亿到 320 亿个“脑细胞”)上均表现良好。
为何重要
本文声称 AEM 是一个“即插即用”的工具。这意味着你可以将几乎任何现有的 AI 训练系统接入这个“信心计”,而无需重建整个系统或雇佣更多人去评估机器人的工作。它帮助 AI 自然地判断何时应成为狂野的探索者,何时应成为专注的专家,从而以更少的麻烦获得更好的结果。
简而言之: AEM 教导 AI 智能体倾听自身的“直觉”(不确定性),以知道何时尝试新事物,何时坚持行之有效的方法,使它们在无需人类微观管理每一步的情况下,更擅长解决复杂的多步骤问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。