← 最新论文
💬 NLP

MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?

本文介绍了 MMG2Skill,这是一个闭环框架及相应的基准测试(MMG2Bench),它使 AI 智能体能够通过结构化编译和轨迹驱动的修订,将嘈杂的多模态网络指南提炼为自我进化的可执行技能,并在多种领域中显著超越基线智能体。

原作者: Xinyu Che, Junqi Xiong, Yunfei Ge, Xinping Lei, Shihao Li, Hang Yan, Han Li, Yuanxing Zhang, Zhiqi Bai, Jinhua Hao, Ming Sun, Han Li, Jiaheng Liu

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyu Che, Junqi Xiong, Yunfei Ge, Xinping Lei, Shihao Li, Hang Yan, Han Li, Yuanxing Zhang, Zhiqi Bai, Jinhua Hao, Ming Sun, Han Li, Jiaheng Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个才华横溢但略显天真的机器人助手。你想让它执行复杂的任务,比如编辑照片、在电子游戏中盖房子,或者玩策略卡牌游戏。互联网上有一个庞大的库,里面充满了人类编写的指南、教程和维基百科,解释了如何完成这些事情。

问题在于,这些指南是为人类编写的,而不是为机器人编写的。它们很杂乱,假设你知道一些机器人并不了解的事情,而且如果机器人犯了一个小错误,它们就会变得手忙脚乱。如果你只是把一个“如何盖房子”的文章链接直接丢给机器人,它可能会被文本淹没,错过关键步骤,或者尝试以错误的顺序执行操作。

这篇论文介绍了 MMG2Skill,一种利用这些杂乱的人类指南来教机器人的新方法。你可以把它看作是一个“翻译官兼教练”系统,将人类的指令转化为机器人的个人剧本。

它是如何工作的,分为三个简单的阶段:

1. 翻译官:将“人类语言”转化为“机器人剧本”

系统并不会把整篇杂乱的文章交给机器人,而是首先阅读指南并提取核心步骤。它将文章转化为一份干净、结构化的清单,称为技能(Skill)

  • 类比: 想象一位人类厨师在阅读一篇复杂的食谱博客文章。主厨不会把整个博客交给副厨,而是写下一张简洁、带符号的“标准作业程序”(SOP)卡片:“第一步:切洋葱。第二步:热锅。第三步:加油。”
  • 结果: 机器人现在拥有了一张清晰、可编辑的指令卡(一个 SKILL.md 文件),而不是一段令人困惑的文字墙。

2. 教练:在实时过程中从错误中学习

机器人尝试使用这个新清单来执行任务。如果它失败了,系统不会只说“再试一次”。它会像侦探一样行动。

  • 侦探: 它观察机器人的具体操作,将其与目标进行对比,并找出为什么失败。是因为机器人忘记等待文件保存了吗?是因为它点错了按钮吗?
  • 修正: 系统随后会修改清单。它会添加一条笔记,例如:“在点击‘完成’之前,请等待 5 秒钟以确保文件已保存。”
  • 类比: 这就像一名驾驶教练看着学生在侧方位停车测试中失败。教练不仅仅是说“你失败了”,而是在学生的练习单上写下一条笔记:“在倒车前记得检查后视镜。” 下次,学生就会使用那份更新后的练习单。

3. 智能停止器:知道何时收手

有时,机器人即使在成功后仍会不停地尝试,或者在循环中不断失败。系统包含了一个“智能停止器”。

  • 类比: 想象一个 GPS 意识到你已经到达了目的地。它不会让你为了确保万无一失而在街区里多绕几圈,而是会说:“你已到达。熄火。”
  • 益处: 这通过在看到明确成功的迹象时立即停止机器人,而不是强迫它运行固定次数的尝试,从而节省了时间(计算能力)和金钱。

他们发现了什么?

研究人员在三个非常不同的世界中测试了它:

  1. 桌面电脑: 控制 Word 或 Photoshop 等软件。
  2. 电子游戏: 玩《我的世界》(Minecraft)来收集资源和制作物品。
  3. 卡牌游戏: 玩像《斗地主》或麻将这样的策略游戏。

结果:

  • 原始指南有害: 当他们仅仅把原始的、杂乱的人类指南交给机器人时,机器人的表现实际上变差了。额外的噪音让它感到困惑。
  • 剧本胜出: 当他们使用“翻译官兼教练”系统(MMG2Skill)将这些指南转化为干净、可编辑的技能时,机器人的表现有了显著提升。它们在各方面都提高了 12% 到 25%
  • 编辑的力量: 最大的收益来自于系统在出错后修正清单的能力。仅仅进行一次性的翻译是不够的;机器人需要从自身的失败中学习,并更新自己的剧本。

核心结论

这篇论文表明,我们不需要为每个机器人任务编写完美的程序代码。我们可以利用互联网上现有的数百万计的人类指南,但我们必须将它们翻译成机器人理解的格式,并允许机器人随着学习过程自行编辑它们。它将一份杂乱的人类手册变成了一个能够自我完善的机器人剧本。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →