← 最新论文
💻 computer science

VISUALSKILL: Multimodal Skills for Computer-Use Agents

本文介绍了 VISUALSKILL,这是一个多模态技能框架,通过将视觉图形保留在技能制品中而非将其转换为文本,从而增强了计算机使用智能体在长程任务上的表现,其结果是相比于基线和仅文本的技能方法,实现了显著的准确率提升。

原作者: Ziyan Jiang, Li An, Yujian Liu, Jiabao Ji, Qiucheng Wu, Jacob Andreas, Yang Zhang, Shiyu Chang

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziyan Jiang, Li An, Yujian Liu, Jiabao Ji, Qiucheng Wu, Jacob Andreas, Yang Zhang, Shiyu Chang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人如何使用一款复杂的软件,比如照片编辑器或电子表格程序。机器人可以看到屏幕并移动鼠标,但它并不“了解”这款软件。这就像是给一位游客一张城市的地图,但这张地图完全是用外语写的,而且没有任何图片。他们可能会猜测路径,但很可能会迷路,尤其是当街道发生变化,或者需要寻找某个特定的、隐藏的小巷时。

这就是 VISUALSKILL 这篇论文试图解决的问题。

问题所在:纯文本地图 vs. 视觉现实

目前的“计算机使用智能体”(即使用软件的机器人)已经做得相当不错了,但在处理长期、复杂的任务或它们从未见过的软件时,仍然显得力不从心。

为了帮助它们,研究人员构建了“技能库”——基本上就是机器人的说明书。但问题在于:这些手册仅由文本组成。

研究人员认为这样做有两个弊端:

  1. 用文字描述图片很难: 想象一下,如果你仅通过说“那个蓝色的画笔工具”来告诉机器人点击哪个图标。如果附近有五个蓝色的工具,机器人可能会点错。而一张图片可以瞬间展示出精确的形状和位置。
  2. 检查进度很难: 在多步骤任务中,机器人需要检查:“我是否真的打开了正确的菜单?”如果手册里写着“你应该会看到一个小窗口弹出”,机器人必须去猜那个窗口长什么样。如果手册显示了该窗口的截图,机器人就可以直接将屏幕与图片进行对比,从而确定无疑。

解决方案:VISUALSKILL

作者创建了 VISUALSKILL,一种构建这些说明书的新方法。与其只使用文本,VISUALSKILL 将原始图片和截图直接保留在指令旁边。

可以这样理解:

  • 旧方法(仅限文本): 一份食谱写着:“加入红色酱料。”(机器人必须猜测哪瓶酱料是红色的)。
  • VISUALSKILL: 一份食谱写着:“加入红色酱料,”并在其下方紧接着展示一张货架上那瓶特定红色酱料的照片。

如何构建(两阶段流水线)

团队并非仅仅手工编写这些手册;他们构建了一个自动生成这些手册的系统,分为两个步骤:

  1. 第一阶段:官方手册挖掘机。
    他们提取软件官方用户指南(公司制作的 PDF 或网站)并将其转化为结构化的技能。他们保留了指南中所有的原始图表和截图。这为机器人打下了坚实的基础。

  2. 第二阶段:实时探索者。
    官方指南往往过时,或者会遗漏那些只有在实际操作软件时才会出现的奇怪、微小的弹出窗口。因此,系统会派出一个“机器人探索者”去实际操作软件。

    • 自由探索: 探索者在闲置状态的屏幕上四处游走,点击按钮观察会发生什么,并为每一个新出现的窗口拍摄照片。
    • 针对性探索: 系统会查看机器人之前失败的任务。它会分析:“啊,机器人在这个特定的菜单上卡住了,”然后专门派探索者前往该处,拍照并记录说明。

这些新的照片和笔记随后会被缝合回手册中,使其成为一份与真实软件完美匹配的“动态”指南。

机器人如何使用它

机器人不会一次性阅读整本 100 页的手册(那信息量太大了)。相反,它有一个名为 load_topic 的特殊工具。

  • 机器人查看其当前任务。
  • 它查看一个简短的索引(类似于目录)以确定哪些主题是相关的。
  • 它向工具发出请求:“显示关于这个主题的指令。”
  • 工具会立即调取该时刻所需的文本以及特定的截图。

实验结果

研究人员在两个主要的基准测试(一系列困难的计算机任务)上使用了一款强大的 AI 智能体对该系统进行了测试。

  • 无技能(No Skill): 机器人没有任何帮助。它的成功率约为 30%
  • 仅限文本技能(Text-Only Skill): 他们给了机器人一份由相同来源制作的纯文本手册。成功率上升到了 37%
  • VISUALSKILL(多模态): 他们给了机器人带有图片的手册。成功率跃升至 45%

核心发现: 图片发挥了巨大的作用。机器人变得更擅长于:

  1. 寻找正确的按钮: 它可以通过观察图标而不是根据描述进行猜测。
  2. 检查进度: 它可以将屏幕与参考照片进行对比,以确认自己是否走在正确的轨道上。

为什么这很重要

论文得出结论:对于使用计算机的机器人来说,视觉不仅仅是“锦上添花”——它们是必不可少的。 试图仅用文字来描述一个图形界面,就像试图向一个从未见过画作的人描述一幅画一样。通过在指令手册中保留图片,机器人可以真正“看到”它应该做什么,就像人类一样。

作者还发现,机器人获取信息的方式至ில்重要。如果只是让机器人像人类读书一样去阅读文件,它往往会跳过图片。通过使用一个能将文本和图片同时交付的特殊工具(load_topic),机器人才能有效地利用视觉线索。

简而言之:不要只告诉机器人做什么;要展示给它看。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →