← 最新论文
🤖 AI

MMSkills: Towards Multimodal Skills for General Visual Agents

本文介绍了 MMSkills,这是一个旨在解决基于文本的技能表示局限性的框架,它通过形式化并实现可复用的多模态程序性知识——将文本程序与状态条件化的视觉证据相结合——来增强通用视觉智能体的运行时决策能力。

原作者: Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对论文《MMSkills: Towards Multimodal Skills for General Visual Agents》(MMSkills:迈向通用视觉智能体的多模态技能)的解释。

核心理念:教机器人像人类一样“看”

想象一下,你正在教机器人使用电脑。

  • 旧方法(仅文本技能): 你给机器人一份书面食谱:“点击‘文件’菜单,然后‘新建’,再‘工作表’。”
    • 问题: 如果机器人处于错误的屏幕,或者弹出窗口遮挡了菜单,机器人仍会盲目地遵循文本指令。它会点击“文件”,尽管菜单根本不在那里,结果卡住并失败。它知道要做什么,但不知道何时做,也不知道完成时看起来是什么样
  • 新方法(MMSkills): 你给机器人一份“智能指南”。这份指南不仅包含文本,还包含每一步屏幕应有的样子的照片,以及用于验证机器人是否走在正确轨道上的检查清单

这篇论文介绍了MMSkills,这是一个将此类“智能指南”转化为可重用工具的系统,供 AI 智能体(使用电脑或玩游戏的机器人)使用。


他们解决的三大主要问题

作者指出了让这些“智能指南”生效所面临的三大障碍:

  1. 包裹里装什么?

    • 类比: 如果你教人烤蛋糕,光有文字食谱是不够的。你需要一张面糊的照片(以此判断何时准备好)、一张烤箱的照片(以此判断是否已热),以及一份检查清单(确保你没有忘记放鸡蛋)。
    • 解决方案: 一个 MMSkill 包裹包含三样东西:
      • 文本: 分步说明。
      • 状态卡(State Cards): 一套“交通灯”系统。它告诉智能体:“只有当你看到蓝色按钮时才继续”,或者“停止!如果你看到红色错误信息,不要点击”。
      • 视觉证据: 照片(关键帧),精确展示关键时刻屏幕应有的样子(例如“之前”和“之后”的对比图)。
  2. 我们从哪里获取这些指南?

    • 类比: 你不想为每一块蛋糕都雇佣一个人来写新食谱。你希望观察人们烤蛋糕,找出通用步骤,然后自己写出一份通用食谱。
    • 解决方案: 他们构建了一个自动化的“生成器”。它观看成千上万个公开的人类使用电脑的视频(轨迹),将相似的任务分组,并自动生成这些“智能指南”。它不仅仅是复制视频,而是提取其中的逻辑视觉线索
  3. 机器人如何在不混淆的情况下使用它们?

    • 类比: 想象一下在开车时试图阅读一本厚厚的、有 50 页的相册。这既分心又危险。机器人可能会过于专注于旧照片,以至于在现实世界中“撞车”。
    • 解决方案: 他们发明了**“分支加载”(Branch Loading)**。
      • 不是把整本相册塞进机器人的主大脑,而是让机器人打开一个临时的侧边窗口(分支)。
      • 在这个侧边窗口中,它快速查看当前做出决策所需的特定照片。
      • 然后它关闭侧边窗口,并告诉主机器人:“好的,我检查了照片。你走在正确的轨道上。现在,点击按钮。”
      • 这让主机器人专注于实时屏幕,而不是旧的参考照片。

它在现实生活中如何运作(“图表”示例)

这篇论文使用了一个具体示例来展示为何这种方法更优:在电子表格中创建图表

  • 场景: 任务是“在第 2 个工作表上创建图表”。
  • 仅文本智能体: 读取“创建图表”。它看到一个图表正在被创建。它点击“完成”。
    • 结果: 它在第 1 个工作表(错误的工作表)上创建了图表,因为文本没有告诉它去检查哪个工作表是激活的。得分:0。
  • MMSkills 智能体:
    1. 它加载“创建图表”技能。
    2. 状态卡显示:“检查:激活的工作表名称是否为‘第 2 个工作表’?”
    3. 视觉证据显示了一张正确工作表标签的照片。
    4. 机器人看到它当前在第 1 个工作表上。“分支”提示:“等等!你在错误的工作表上。请先切换到第 2 个工作表。”
    5. 机器人切换过去,创建图表,并验证标题是否与照片匹配。
    • 结果: 在正确的工作表上完美创建了图表。得分:1。

结果展示了什么

研究人员在两类任务上测试了该方法:

  1. 桌面任务: 如使用 Excel、Chrome 或 Word(OSWorld, macOSWorld)。
  2. 游戏任务: 如玩《我的世界》(Minecraft)或《超级马里奥兄弟》(Super Mario Bros.)。

研究发现:

  • 更高的成功率: 使用 MMSkills 的机器人比没有技能或仅有文本技能的机器人解决了更多任务。
  • 帮助了较小的机器人: 即使是更小、算力较弱的 AI 模型,在获得这些视觉指南后,任务表现也大幅提升。
  • 更少的错误: 机器人减少了重复性错误(例如点击同一个按钮 10 次),并更快地完成了任务。
  • 不仅限于电脑: 该系统在电子游戏中同样表现良好,证明了无论是管理文件还是跨越障碍,“感知状态”都至关重要。

总结

MMSkills 是一种教 AI 智能体不仅做什么,而且如何识别自己是否做对的方法。通过将文本指令与“交通灯”检查清单和特定照片相结合,并利用“侧边窗口”方法来查看它们,该系统帮助机器人避免迷路、困惑或卡在错误的屏幕上。它将一个盲目服从命令的机器人,转变为一个真正理解其所处视觉世界的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →