MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?
本文介绍了 MMG2Skill,这是一个闭环框架及相应的基准测试(MMG2Bench),它使 AI 智能体能够通过结构化编译和轨迹驱动的修订,将嘈杂的多模态网络指南提炼为自我进化的可执行技能,并在多种领域中显著超越基线智能体。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个才华横溢但略显天真的机器人助手。你想让它执行复杂的任务,比如编辑照片、在电子游戏中盖房子,或者玩策略卡牌游戏。互联网上有一个庞大的库,里面充满了人类编写的指南、教程和维基百科,解释了如何完成这些事情。
问题在于,这些指南是为人类编写的,而不是为机器人编写的。它们很杂乱,假设你知道一些机器人并不了解的事情,而且如果机器人犯了一个小错误,它们就会变得手忙脚乱。如果你只是把一个“如何盖房子”的文章链接直接丢给机器人,它可能会被文本淹没,错过关键步骤,或者尝试以错误的顺序执行操作。
这篇论文介绍了 MMG2Skill,一种利用这些杂乱的人类指南来教机器人的新方法。你可以把它看作是一个“翻译官兼教练”系统,将人类的指令转化为机器人的个人剧本。
它是如何工作的,分为三个简单的阶段:
1. 翻译官:将“人类语言”转化为“机器人剧本”
系统并不会把整篇杂乱的文章交给机器人,而是首先阅读指南并提取核心步骤。它将文章转化为一份干净、结构化的清单,称为技能(Skill)。
- 类比: 想象一位人类厨师在阅读一篇复杂的食谱博客文章。主厨不会把整个博客交给副厨,而是写下一张简洁、带符号的“标准作业程序”(SOP)卡片:“第一步:切洋葱。第二步:热锅。第三步:加油。”
- 结果: 机器人现在拥有了一张清晰、可编辑的指令卡(一个
SKILL.md文件),而不是一段令人困惑的文字墙。
2. 教练:在实时过程中从错误中学习
机器人尝试使用这个新清单来执行任务。如果它失败了,系统不会只说“再试一次”。它会像侦探一样行动。
- 侦探: 它观察机器人的具体操作,将其与目标进行对比,并找出为什么失败。是因为机器人忘记等待文件保存了吗?是因为它点错了按钮吗?
- 修正: 系统随后会修改清单。它会添加一条笔记,例如:“在点击‘完成’之前,请等待 5 秒钟以确保文件已保存。”
- 类比: 这就像一名驾驶教练看着学生在侧方位停车测试中失败。教练不仅仅是说“你失败了”,而是在学生的练习单上写下一条笔记:“在倒车前记得检查后视镜。” 下次,学生就会使用那份更新后的练习单。
3. 智能停止器:知道何时收手
有时,机器人即使在成功后仍会不停地尝试,或者在循环中不断失败。系统包含了一个“智能停止器”。
- 类比: 想象一个 GPS 意识到你已经到达了目的地。它不会让你为了确保万无一失而在街区里多绕几圈,而是会说:“你已到达。熄火。”
- 益处: 这通过在看到明确成功的迹象时立即停止机器人,而不是强迫它运行固定次数的尝试,从而节省了时间(计算能力)和金钱。
他们发现了什么?
研究人员在三个非常不同的世界中测试了它:
- 桌面电脑: 控制 Word 或 Photoshop 等软件。
- 电子游戏: 玩《我的世界》(Minecraft)来收集资源和制作物品。
- 卡牌游戏: 玩像《斗地主》或麻将这样的策略游戏。
结果:
- 原始指南有害: 当他们仅仅把原始的、杂乱的人类指南交给机器人时,机器人的表现实际上变差了。额外的噪音让它感到困惑。
- 剧本胜出: 当他们使用“翻译官兼教练”系统(MMG2Skill)将这些指南转化为干净、可编辑的技能时,机器人的表现有了显著提升。它们在各方面都提高了 12% 到 25%。
- 编辑的力量: 最大的收益来自于系统在出错后修正清单的能力。仅仅进行一次性的翻译是不够的;机器人需要从自身的失败中学习,并更新自己的剧本。
核心结论
这篇论文表明,我们不需要为每个机器人任务编写完美的程序代码。我们可以利用互联网上现有的数百万计的人类指南,但我们必须将它们翻译成机器人理解的格式,并允许机器人随着学习过程自行编辑它们。它将一份杂乱的人类手册变成了一个能够自我完善的机器人剧本。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。