ISE: An Execution-Grounded Recipe for Multi-Turn OS-Agent Trajectories
本文介绍了 ISE,这是一种三阶段合成范式,通过生成高质量、具备执行落地能力的式多轮 OS 智能体轨迹,显著提升了微调模型的工具使用性能,其表现优于规模更大的零样本基准模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个非常聪明但缺乏经验的机器人如何使用电脑。你希望它能够处理复杂的任务,比如“整理我的文件,根据这些文件写一份报告,然后把报告发给我的老板。”
问题在于,根据这篇论文,我们用来教这些机器人的“教科书”(训练数据)在三个方面存在缺陷:
- 它们从工具开始,而不是从用户开始: 大多数数据是通过观察可用的计算机命令列表(如“删除文件”或“发送电子邮件”)并虚构出一个使用它们的理由而构建的。这就像是通过告诉厨师“这里有一把刀,现在想象一个切东西的理由”来教厨师,而不是从“我饿了,给我做个三明治”开始。
- 它们太短了: 现实生活涉及来回互动。如果机器人犯了错,你会纠正它;如果它成功了,你会要求下一步。大多数训练数据只是一个问题和一个答案,就像自动售货机的交易,而不是一场真正的对话。
- 它们是虚假的: 机器人通常是在“模拟”结果上进行训练的。计算机会“假装”删除了一个文件,或者“猜测”错误信息会是什么。它从未真正接触过真实的计算机,因此它永远学不会在现实情况出错时该怎么办。
解决方案:ISE(意图 → 模拟 → 执行)
作者提出了一个名为 ISE 的新三步配方来解决这些问题。把它想象成一所针对机器人的高级烹饪学校。
第一步:菜单(意图 - Intent)
他们不是从工具列表开始,而是从真实的人类需求开始。
- 类比: 想象一位厨师根据不同类型的人真正想吃什么来设计菜单,而不是仅仅根据储藏室里有什么食材。
- 做法: 他们创建了 5 万个独特的“人格”(例如忙碌的财务经理、创意作家或学生),并将他们与不同类型的任务和难度等级混合在一起。这确保了机器人学习处理各种各样的现实请求,而不仅仅是那些简单、常见的请求。
第二步:角色扮演(模拟 - Simulate)
这是解决“太短”问题的环节。他们使用一种特殊的 AI 来扮演人类用户。
- 类比: 想象一位扮演沮丧顾客的方法派演员。这位演员不会只说“给我做个三明治”然后就结束了。如果机器人掉落了面包,演员会说:“嘿,你把面包掉地上了,把它捡起来!”如果机器人做得很好,演员会说:“太棒了,现在把奶酪放上去。”
- 秘诀: 作者确保这个“演员”AI 始终保持角色设定。它不会不小心变成一个得力的助手(这会破坏训练)。它严格保持在用户的角色中,对机器人实际所做的行为做出反应,而不是对机器人认为它做了什么的反应。
第三步:真实的厨房(执行 - Execute)
这是最关键的一步。机器人不仅仅是猜测发生了什么,它实际上在进行操作,在一台真实的、隔离的计算机上。
- 类比: 厨师不是在并不真实的切菜板上假装切菜,而是真的在切真实的蔬菜。如果刀滑了并切到了桌子,系统会记录下那个真实的错误。
- 为什么重要: 当机器人尝试运行一个命令并失败时(例如,“找不到文件”),“演员”用户会看到真实的错误信息并对此做出反应。这教会了机器人如何从现实世界的灾难中恢复,而真实的模拟无法做到这一点。
结果
他们使用这种新的“教科书”(称为 ISETrace)来训练一个机器人(具体是一个名为 Qwen3-8B 的模型)。
- 之前: 没有这种新训练,机器人只能解决约 19% 的复杂多步计算机任务。
- 之后: 使用这种新训练后,机器人解决了 37% 的任务。
- 对比: 这个经过训练的 80 亿参数机器人,其表现实际上优于:
- 一个没有经过此类数据训练的规模大得多的机器人(320 亿参数)。
- 一个没有经过此类数据训练的非常著名且昂贵的商业机器人(GPT-4o)。
总结
论文指出,如何创建训练数据与你创建了什么数据同样重要。通过从真实的人类需求开始,强制进行长对话,并让机器人直接在真实计算机上进行练习(包括失败的情况),他们创造了一个更聪明的智能体。
他们还证明了“长对话”部分是关键。当他们将训练数据缩减为仅包含单个问题(去掉了来回互动的过程)时,机器人的性能显著下降。这表明,学习如何处理对话对于让机器人真正发挥作用至关重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。