Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL
Envs-FORGE 是一种新颖的提示策略,它通过将验证器奖励转化为基于混合整数线性规划的逐种子动作,动态优化环境合成以用于强化学习,从而生成定制化的训练环境,与固定配方基准相比,显著提升了智能体在各种基准测试中的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人如何修理电脑或编写一段代码。你不能直接把手册递给它;它需要通过实践来学习。这就是强化学习 (Reinforcement Learning, RL) 的世界——在这里,AI 智能体通过尝试、犯错,并在成功时获得“奖励”(比如高分)来学习。但问题在于:为了让机器人变得更好,它所练习的问题必须恰到好处。如果问题太简单,机器人会感到无聊且学不到新东西;如果问题太难,它会感到挫败并选择放弃。这个甜点区被称为“学习前沿”(learning frontier)——即机器人当前能力的边缘,在那里,一点点挑战能最有效地帮助它成长。
长期以来,科学家们一直尝试利用大型语言模型(LLM,即聊天机器人背后的超强大脑)来自动创建这些练习题。他们使用简单的、固定的“配方”来生成任务,就像一位厨师无论面对的是幼儿还是美食家,都使用完全相同的食谱来烹饪每一顿饭一样。这篇论文介绍了一种更聪明的“烹饪”练习题的方法。它被称为 Envs-FORGE。Envs-FORGE 不再使用一成不变的食谱,而是像一位私人教练,观察机器人的当前力量,弄清楚下一个挑战的具体难度,然后为它量身定制一套独特的练习。其目标是确保每一个练习任务都能完美调优,从而推动机器人超越其目前的能力边界。
“一刀切”配方的弊端
过去,当研究人员想要为这些 AI 智能体创建新的训练任务时,他们依赖于固定的策略。想象一位老师拿着一张统一的练习卷,并决定无论学生是谁,都只需“稍微增加难度”。对于已经掌握了测试内容的优秀学生来说,这张新练习卷可能仍然太简单;而对于正在挣扎的学生来说,它可能根本无法完成。
论文指出,这些固定方法(如 “Self-Instruct” 或 “Evol-Instruct”)就像那位刻板的老师。它们对每一个初始想法(或称“种子”)应用同样的逻辑,而不去检查 AI 是否已经准备好应对它。它们可能会在应该降低难度时增加了难度,或者在 AI 只需要深入练习某项特定技能时却改变了主题。这浪费了时间,并导致生成的训练数据并没有什么帮助。
走进 Envs-FORGE:聪明的私人教练
作者提出了 Envs-FORGE(前沿优化奖励驱动的环境合成)。把它想象成一个聪明的系统,它不仅是在猜测下一步该做什么,而是在进行计算。
以下是它的工作步骤:
- 体检: 首先,系统查看一个初始任务,并让当前的 AI 智能体尝试解决它。系统会统计智能体成功的频率。这会产生一个“通过率”,就像一份成绩单,显示了该任务对于当前这个特定机器人来说是易是难。
- 策略会议: 根据这份成绩单,系统会考虑六种不同的修改任务的方式。它可以选择:
- 增加 难度(添加更多约束或边缘情况)。
- 降低 难度(如果机器人卡住了,则简化任务)。
- 多样化 任务(改变背景,但保持难度相似)。
- 并且对于上述每种方式,它可以选择深入(深入挖掘同一个主题)或广度(探索更广泛的相关主题)。
- 数学魔法 (MILP): 系统使用一种特殊的数学谜题,称为“混合整数线性规划”(Mixed-Integer Linear Program, MILP),来为该特定任务挑选出唯一最佳的变更组合。这就像教练观察球员的统计数据后决定:“好吧,对于这个球员,我们需要通过‘深度’来增加难度,以达到完美的学习区间。”
- 构建: 一旦选定了最佳策略,系统就会重写整个任务包。它不仅仅是改变问题,还会更新指令、数据、解决方案、测试用例,甚至包括计算机环境(如 Docker 容器),以确保所有内容依然能够协同工作。
- 金标准检查: 在新任务被允许进入“训练健身房”之前,它必须通过一个严格的“金标准验证器”(Gold Verifier)。这是一个极其严格的测试,以确保新的任务是可运行的、一致的且确实可以被解决。如果失败,它会被丢弃。只有完美的任务才能胜出。
研究发现
研究人员在强大的 AI 模型 Qwen 3.5 35B 上测试了这种新方法。他们将 Envs-FORGE 与旧有的固定配方(Few-shot、Self-Instruct 和 Evol-Instruct)以及没有额外训练的基准模型进行了对比。
结果非常明确:Envs-FORGE 获胜了。
- 在名为 tb-core 的基准测试中,基准模型的得分是 40.0%;表现最好的固定配方得分为 46.8%,而 Envs-FORGE 则飙升至 49.2%。这比起点提高了 9.2 个百分点。
- 在 tb-2.0 上,基准模型得分为 23.0%,而 Envs-FORGE 达到了 29.4%,提升了 6.4 个百分点。
- 即使是在一个非常困难的现实世界测试 SWE-bench Verified 上,Envs-FORGE 也达到了 77.1% 的得分,超过了基准模型的 73.4%。
至关重要的是,论文表明这并不是因为 Envs-FORGE 使用了更多的计算能力或生成了更多的数据。所有的算法都生成了完全相同的 100 个经过验证的环境 进行训练。区别纯粹在于它们选择这 100 个任务的方式。Envs-FORGE 只是选择了更好的任务。
为什么这很重要
这篇论文的核心观点是:我们创建训练数据的方式与数据本身同样重要。通过停止使用僵化的、“一刀切”的配方,转而使用一种智能的、数据驱动的方法,根据 AI 当前的能力量身定制每一个任务,我们可以帮助这些智能体更快、更好地学习。
作者建议,这种“前沿感知”(frontier-aware)的方法——不断检查智能体的现状,并调整挑战程度以使其保持在能力边缘——是构建能够处理复杂软件工程和系统管理任务的高级终端智能体的关键。虽然这项研究侧重于特定的基准测试和模型规模,但结果有力地表明,这种“智能合成”的方法是教导 AI 如何学习的一个重要进步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。