← 最新论文
💬 NLP

Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining

本文介绍了 Video2GUI,这是一个自动化框架,它从无标签互联网视频中合成包含 1200 万条 GUI 交互轨迹的大规模数据集,以克服数据稀缺问题并显著提升多模态 GUI 智能体的泛化性能。

原作者: Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想教机器人如何使用电脑、手机或网站。为此,你需要向它展示数百万个人们点击按钮、输入文本和滚动页面的示例。

问题在于,找到这些示例极其困难。通常,研究人员必须雇佣人员手动记录并标注每一次点击,这不仅缓慢、昂贵,而且使他们仅限于少数几种类型的应用程序。这就像试图只通过阅读字典的几页来学习一门语言。

Video2GUI 是一个新系统,它通过将整个互联网变成一个巨大、免费的课堂来解决这一问题。以下是其工作原理,借助一些简单的比喻:

1. 大过滤器(寻找合适的视频)

互联网上充满了视频,但大多数对教机器人毫无用处(例如烹饪节目或猫咪视频)。研究人员从 5 亿 个 YouTube 视频开始。

  • 粗略筛选:首先,他们使用智能 AI 扫描标题和描述。这就像图书管理员在打开书籍之前,快速检查书脊,看它们是否关于“计算机”。这将数量缩减至 2000 万。
  • 精细筛选:接下来,他们使用更先进的 AI 实际“观看”这些视频的前一分钟。它检查:屏幕是否清晰?语音是否清晰地解释了步骤?它是否真正展示了如何使用软件?这就像一位严格的老师对视频进行评分,以确保它们是高质量的教学教程。
  • 结果:他们最终获得了 420 万 个高质量的教学视频。

2. 翻译器(将视频转化为指令)

现在他们拥有了视频,但机器人无法像人类那样仅仅“观看”视频并理解它。视频需要被翻译成结构化的指令列表。

  • 过程:他们使用强大的 AI(如同一位超级聪明的翻译员)来观看视频并将其分解。它识别目标(例如,“购买鞋子”)、所采取的步骤以及每次点击发生的确切时刻。
  • 神奇之处:AI 并非仅仅猜测;它查看视频帧,以找到被点击按钮的确切坐标。它将一段 10 分钟的在线购物视频转化为精确的、逐步的地图:“在 0:05,点击搜索栏。在 0:10,输入‘运动鞋’。”

3. 图书馆(WildGUI)

所有这些翻译后的指令被收集到一个名为 WildGUI 的全新大型图书馆中。

  • 规模:该图书馆包含 1200 万 条交互路径(轨迹),涵盖超过 1500 种不同的应用程序和网站
  • 多样性:它包括从 Windows 桌面到 Android 手机和 Mac 电脑的一切。这就像拥有一个图书馆,其中包含了人类曾经使用计算机的所有可能方式,全部经过整理,随时可供机器人学习。

4. 训练(教导机器人)

研究人员选取了两个现有的 AI 模型(Qwen2.5-VL 和 Mimo-VL),并将这个新图书馆“喂”给它们。

  • 结果:在研究了这一庞大的数据集后,机器人的表现显著提升。在各项测试中,它们的性能提高了 5% 到 20%
  • 证明:它们现在能够比之前更好地找到按钮、点击正确的内容并导航复杂的网站,其表现达到或超越了目前存在的最佳机器人。

核心结论

该论文声称,通过自动化将互联网视频转化为训练数据的过程,他们创建了一个庞大、多样化的数据集,使 AI 代理在使用计算机方面变得更加聪明。他们并没有发明一种新型机器人;他们只是为现有的机器人提供了一本更好、更大、更多样的教科书供其学习。

他们已发布该数据集以及用于构建它的工具,以便其他研究人员能够利用它们在未来构建更优秀的 AI 代理。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →