← 最新论文
🤖 machine learning

A Few Teacher Steps Go a Long Way: Cost-Efficient On-Policy Data Augmentation for Agent Post-Training

本文提出了一种用于大语言模型智能体后训练的高性价比同策略数据增强策略,该策略将监督预算分配给在学习器诱导上下文下的短促、未经筛选的教师续写,证明了这种方法在多个基准测试中优于纯行为克隆,并达到或超过了更复杂的筛选方法。

原作者: Junze Ye, Jiayi Cheng, Miao Lu, Michal Mankowski, Jose Blanchet, Mohsen Bayati

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Junze Ye, Jiayi Cheng, Miao Lu, Michal Mankowski, Jose Blanchet, Mohsen Bayati

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一名学生正在通过观察大师从头到尾完成任务的过程,来学习一项复杂的技能,比如破解谜题或修理一台损坏的机器。学生模仿专家做的每一个动作,希望通过模仿完美的路径,最终能够独立解决问题。这种方法起初效果很好,但隐藏着一个缺陷。在现实世界中,学生会犯错。当学生踉跄跌倒时,情况发生了变化。他们现在所处的路径与专家所走的完美路径不同。如果学生只练习专家的完美路径,他们就无法应对实际面临的混乱且不完美的情况。他们知道如何跟随大师,却不知道在偏离轨道时如何恢复。

这就是斯坦福大学和纽约大学的研究人员试图为人工智能智能体(AI agents)解决的核心挑战。这些智能体是旨在行动于世界之中的大语言模型,无论是通过搜索网络寻找答案、在基于文本的模拟环境中规划家务,还是编写代码来修复软件漏洞。为了教导这些智能体,开发者经常使用一种叫做“监督微调”的方法,即由一个强大的“教师”模型生成完美的示例,而较小的“学生”模型则通过学习来模仿它们。标准做法是将成千上万个完美的端到端演示喂给学生。然而,研究人员意识到,这种方法让学生在处理自身错误时显得力不从心。当学生最终在实际任务中犯错时,它发现自己处于一个从未见过的语境中,因为教师从未演示过在特定类型的失败后该如何继续。

为了解决这个问题,团队提出了一种新的生成训练数据的方法。他们不再仅仅让教师从头开始完成任务,而是先让学生尝试解决问题。当学生陷入困境或走错路时,研究人员会让学生暂停,并要求教师介入,展示如何从那个精确的失败点继续下去。这被称为“在线策略”(on-policy)数据,因为它根据学生的实际行为而非假设的完美路径来生成。但这提出了一个新的实际问题:研究人员应该如何分配他们有限的资源?他们应该把预算花在从头开始生成更多的长篇演示上吗?应该要求教师为每一个错误写出长篇且详细的解决方案吗?还是应该只要求提供几个快速的步骤,以让学生重回正轨?

研究人员将此视为一个预算分配问题。他们在三种不同类型的任务中测试了不同的策略:使用搜索引擎回答复杂问题、在模拟家庭环境中规划物理动作,以及在命令行界面中调试代码。他们将复制完整的专家演示的标准方法,与他们提出的“在学生失败时刻由教师提供简短且有针对性的纠正”的新方法进行了对比。他们仔细追踪了两类成本:生成教师响应所使用的总计算能力,以及实际用于训练学生的数据量。

结果清晰且令人惊讶。在他们测试的所有环境中,仅在学生特定失败点请求少量步骤指导的策略被证明是最有效的。当研究人员限制教师仅提供少量的回合数——有时仅为一到三个步骤——来纠正学生的路径时,学生的学习效果明显优于接受更长、更详尽纠正时的表现。事实上,要求教师从失败点开始写出完整的完美解决方案往往是在浪费资源。额外的长度并没有帮助学生学习,它只是消耗了更多的预算,却没有提高性能。

研究发现,在恰当的位置提供几个教师步骤,比提供一个更长、更精选的完整方案要更有价值。例如,在编程任务中,一种结合了这些简短、即时纠正且仅使用通常训练数据一小部分的模型,能够使学生的表现达到一个经过大规模数据集训练并经过复杂多阶段强化学习过程的系统水平。研究人员还发现,根据教师的响应是否“成功”或“完美”来进行过滤,并不总是最好的资源利用方式。有时,看到一位教师如何应对困难局面,即使最终结果并不完美,也比只看到完美的路径更具启发性。

核心结论是:教导人工智能智能体最有效的方法,不是向它展示一部关于任务应如何完成的完美电影,而是在它迷失方向的时刻进行短暂的干预。通过将预算投入到短促、有针对性的纠正,而不是长篇的演示,开发者可以创造出更聪明、更擅长从错误中恢复的智能体。这项研究表明,对于许多复杂任务而言,适量的专家指导,在正确的时刻送达,其价值远超预期。这种方法可以实现更高效的学习,这意味着在相同的计算能力下,我们可以构建出更稳健、更能在充满变数的现实世界问题中游刃有余的智能体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →