← 最新论文
🤖 AI

Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories

Agentic-DPO 是一种轻量级的离线策略优化方法,它将专家轨迹转化为以状态为条件的动作偏好,使 LLM 智能体能够学习超越简单模仿的最优决策,在不需要环境回放或奖励模型的情况下,实现与在线强化学习相媲美的性能。

原作者: Yixiong Chen, Alan Yuille

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yixiong Chen, Alan Yuille

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人管家如何清理乱七八糟的房间。旧的方法叫做监督微调(Supervised Fine-Tuning, SFT),就像是给机器人看一段人类打扫卫生的视频,并对它说:“完全模仿你看到的一切。”机器人学习的是动作的序列:捡起袜子,把袜子放进脏衣篮,拿起簸箕。但问题在于,机器人并不知道为什么要做出这些动作。如果那只袜子其实是一件垃圾,机器人可能仍然会把它捡起来,因为它只是在模仿视频,而不是在思考自己可能犯下的错误。

这篇论文介绍了一种更轻量级的新方法,叫做 Agentic-DPO,旨在解决这个问题。它不再仅仅是模仿,而是将训练数据变成了一场“选择你自己的冒险”游戏,让机器人学会识别自己潜在的失误。

核心思想:“不要只模仿,要对比”

作者提出,与其将专家的路径视为一段需要死记硬背的单一文本,不如将每一个步骤都视为一个决策点。在任何时刻,机器人既可以做出专家的正确动作,也可以做出一个“看似合理的错误”。

Agentic-DPO 的工作原理如下:

  1. 设置: 向机器人展示专家历史记录中的特定时刻(即“状态”)。
  2. 测试: 询问机器人:“如果是你,现在会怎么做?”
  3. 比较: 如果机器人的建议与专家的动作不同,你就创建一个配对:“专家动作(好)” vs. “机器人的猜测(坏)”。
  4. 教导: 教导机器人比起它自己可能犯的错误,更倾向于选择专家的动作。

这是一个巨大的转变。论文指出,以往的方法要么只是单纯模仿(SFT),要么试图通过在真实环境中反复进行实际操作来学习(强化学习),而后者既缓慢又昂贵,且需要复杂的评分系统。Agentic-DPO 表明,你可以获得从错误中学习的好处,而无需真正去“玩游戏”,也不需要雇佣人类裁判来为每一个动作评分。

“魔术技巧”:保持规则清晰

教机器人时有一个棘手的问题:它们可能会被“如何书写”所迷惑,而不是被“含义是什么”所吸引。例如,要求机器人“调用工具”可能会写成 call_tool(){"tool": "call"}。如果机器人只是学习偏好专家的文本格式,那么当格式改变时,它就会失败。

为了解决这个问题,作者引入了一种巧妙的技术,称为策略保持增强(Policy-Preserving Augmentation, PPA)。想象一下你在教学生解数学题。你向他们展示同一个问题,但分别用英语、西班牙语以及漫画书的形式来呈现,而其解题过程(数学逻辑)始终保持不变。PPA 对机器人也是如此:它用许多种不同的“方言”或格式重写专家的动作,同时保持核心决策完全一致。这迫使机器人去学习选择背后的逻辑,而不是特定的词汇。

数据说话

作者在三个“游乐场”中测试了这个想法,在这些场景中,机器人必须与工具、用户和网站进行交互:

  • StableToolBench: 一个测试工具使用的场所。
  • τ-bench (tau-bench): 一个零售模拟环境,机器人需要与客户聊天。
  • Mind2Web: 一个机器人需要在真实网站上进行导航的任务。

结果表明,在不同规模的机器人模型上,Agentic-DPO 始终优于标准的“模仿”方法(SFT):

  • τ-bench 零售任务中,一个 90 亿参数的模型从标准模仿的 21.7% 成功率跃升至使用 Agentic-DPO 后的 41.4%
  • StableToolBench 上,一个较小的 20 亿参数模型从 57.1% 提升到了 90.9%
  • Mind2Web 上,步骤的平均成功率从 45.6% 提升到了 64.4%

有趣的是,论文指出,Agentic-DPO 的表现不亚于一种更昂贵的方法——GRPO(该方法需要机器人在学习过程中实际进行数千次游戏),但 Agentic-DPO 在训练步骤中从未与真实环境进行过交互。

这种方法无法做到的事情

了解这种方法没有解决什么问题也很重要。论文明确排除了这样一种观点,即该方法可以发现专家从未见过的新情况。因为它只能从专家现有的视频中所呈现的状态中学习,所以它无法进入专家从未进入过的房间进行探索。这表明这是一种权衡:你获得了一种更便宜、更快速的训练方法,在已知的决策点上表现出色,但你失去了发现那些需要“不按常理出牌”才能找到的新方案的能力。

总结

作者认为,通过将专家演示转化为一系列每一步都存在的“对与错”的选择,并利用“格式洗牌”技巧(PPA)让机器人专注于逻辑,我们可以比以前更廉价地训练出更聪明的智能体。这就像是将机器人从一个盲目模仿的鹦鹉升级为一个能够思考“为什么我会犯错”的学生,而且无需投入数百万美元的计算资源去运行无休止的模拟。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →