← 最新论文
💻 computer science

ScreenParse: Moving Beyond Sparse Grounding with Complete Screen Parsing Supervision

本文介绍了 ScreenParse,这是一个包含 77.1 万张截图、密集标注了 2100 万个 UI 元素的大规模数据集,以及 ScreenVLM,这是一个在该数据上训练的紧凑模型,其在屏幕解析任务上显著优于更大的基础模型,并通过可迁移的结构先验增强了定位能力。

原作者: A. Said Gurbuz, Sunghwan Hong, Ahmed Nassar, Marc Pollefeys, Peter Staar

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: A. Said Gurbuz, Sunghwan Hong, Ahmed Nassar, Marc Pollefeys, Peter Staar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《通过完整屏幕解析监督超越稀疏定位》的通俗解释,辅以生动的类比。

核心难题:“聚光灯”与“整个房间”

想象一下,你正在教一个机器人如何在一个繁忙的客厅里导航。

  • 旧方法(稀疏定位): 目前大多数 AI 训练就像只把聚光灯打在某个物体上。如果指令是“拿起遥控器”,机器人只学习遥控器长什么样。它忽略了咖啡桌、台灯、地毯和电视。如果你随后让它“坐在沙发上”,它可能会困惑,因为它从未学习过沙发在哪里或长什么样。它只知道被明确告知要寻找的特定事物。
  • 新方法(ScreenParse): 这篇论文认为,要打造真正智能的计算机代理,我们需要打开天花板灯,让机器人一次性看到整个房间。我们需要同时教会它每一个物体、它的位置、它的名称以及它显示的内容。

解决方案:ScreenParse(“超级地图”)

作者创建了一个名为ScreenParse的大型新数据集。你可以把它想象成一张互联网的巨型超精细地图。

  • 里面有什么? 它包含 77.1 万张网站截图。
  • 有多详细? 与以往只标记“重要”按钮的地图不同,这张地图标记了所有内容。它识别了 2100 万个独立元素(如按钮、文本框、图片、徽标),并将它们标记为 55 种不同类型之一。
  • 规模: 这就像拥有一张地图,它不仅显示主干道,还显示整个城市中的每一栋房子、每一个邮箱、每一棵树和每一个路牌。

制作过程:"Webshot"工厂

你可能会问:“他们是如何标记 2100 万个项目的?难道雇佣了一百万人吗?”
没有。他们建立了一个名为Webshot的自动化工厂。

  1. 爬虫: 它访问了 100 万个不同的网站(就像游客拍摄每一条街道的照片)。
  2. 扫描仪: 它使用计算机程序自动查找页面上的每一个可见元素(就像扫地机器人能看到每一团灰尘)。
  3. 编辑器(“裁判”): 由于计算机可能会犯错(例如将阴影标记为按钮),他们使用了一个智能 AI(视觉语言模型)充当“质量裁判”。它检查计算机的工作,修正标签,并剔除任何混乱或令人困惑的截图。

明星选手:ScreenVLM(“紧凑型专家”)

利用这张新的“超级地图”,他们训练了一个名为ScreenVLM的新 AI 模型。

  • 类比: 想象一个图书馆。大型基础模型(如 Qwen 或 InternVL)就像巨大且厚重的百科全书。它们知识渊博,但携带缓慢且使用成本高昂。
  • ScreenVLM则像一本袖珍的、高度专业化的野外指南。它要小得多(仅 3.16 亿参数),但由于是在“超级地图”上训练的,它在理解屏幕布局方面极其出色。
  • 秘诀: 他们教导 ScreenVLM 特别关注页面的“结构”(事物在哪里以及是什么),而不仅仅是阅读文本。这就像教学生背诵建筑物的平面图,而不仅仅是记住标志上的文字。

结果:为何重要

该论文通过三种方式测试了这种新方法:

  1. 测试: 他们要求模型描述整个屏幕。与那些巨大且沉重的模型(准确率仅约 30%)相比,ScreenVLM 在发现所有内容方面表现好得多(准确率达到 60%)。
  2. 迁移: 他们利用 ScreenParse 地图对其他大型模型进行了“速成培训”。突然间,这些大型模型在理解屏幕方面也变得强大多了。这证明学习“整个房间”是一项能帮助任何机器人的技能,而不仅仅是他们构建的那一个。
  3. 速度: 由于 ScreenVLM 体积小巧,它的运行速度比大型模型快 4 倍。这意味着它有可能在普通笔记本电脑或手机上运行,而不仅仅是在庞大的数据中心中运行。

核心结论

该论文声称,要构建更好的计算机使用代理,我们需要停止教导它们一次只寻找一件事。相反,我们应该教导它们一次性看到全貌。通过创建一个标记屏幕上每个像素和元素的大型数据集,他们构建了一个小型、快速且极其智能的 AI,其对计算机屏幕的理解能力超过了当前的巨头模型。

该论文并未声称:

  • 它并未声称这目前在移动应用或桌面软件上完美运行(它主要关注网站)。
  • 它并未声称这解决了所有机器人问题,只是改进了机器人在行动之前如何“看见”和“理解”屏幕。
  • 它未提及医疗或临床用途;其重点严格限于计算机界面(GUI)和网页。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →