← 最新论文
🤖 AI

DragOn: A Benchmark and Dataset for Drag-Based GUI Interactions

该论文介绍了 DragOn,这是一个包含四个领域内 28.6 万张截图和 350 万个任务的全面基准测试和数据集,旨在解决拖拽式图形用户界面(GUI)交互数据的稀缺问题,并证明了在该数据集上进行微调能显著提升最先进的视觉语言模型在复杂计算机使用任务上的性能。

原作者: Nathan Bout, Maxime Langevin, Ronan Riochet

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Nathan Bout, Maxime Langevin, Ronan Riochet

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何使用电脑。到目前为止,我们非常擅长教机器人如何“点击”按钮。这就像教一个孩子指着一张图片并说:“摸摸那个!”我们已经有了数百万个这样的例子,而且机器人在处理这类任务时已经做得相当不错了。

但还有一个更难的技能:拖拽(dragging)

把拖拽想象成拿起一个沉重的箱子并把它移动到一个新位置,或者用手指滑动页面向下滚动,或者抓住照片的角落来放大它。这些动作不仅要求机器人理解要触摸哪里,还要求它理解如何从 A 点移动到 B 点。目前,机器人在这一领域表现得很糟糕。它们就像蹒跚学步的幼儿,虽然能指着玩具,却不知道如何把它捡起来并带过房间。

这篇论文介绍了一个名为 DragOn 的新工具来解决这个问题。以下是它的工作原理,通过简单的拆解来呈现:

1. 问题所在:缺乏“拖拽”练习

作者注意到,虽然我们有庞大的数据库来教机器人如何点击,但用于教它们如何拖拽的数据却极小——大约只有点击数据的十分之一到百分之一。正因如此,即使是最智能的 AI 模型(如来自 OpenAI 或 Anthropic 的模型)在处理诸如高亮文本、调整窗口大小或移动滑块等任务时也会感到吃力。它们会感到困惑并经常失败。

2. 解决方案:“以渲染作为监督”

为了构建一个庞大的拖拽示例库,而不是雇佣成千上万的人类手动点击和拖拽,作者发明了一个他们称之为**“以渲染作为监督”(Rendering-as-Supervision)**的聪明技巧。

  • 传统方式: 想象一个真人看着屏幕,在单词周围画一个框,并记录下坐标。这既慢又贵。
  • DragOn 方式: 想象你有一个文档的“神奇蓝图”(比如 PDF 或电子表格)。计算机完全知道每一个字母和单元格的具体位置,因为它本身就是这个文档的“构建者”。与其观察图像并进行猜测,计算机只需询问蓝图:“‘Hello’这个词在哪里?”蓝图会回答:“它就在这些精确的坐标上。”

然后,计算机通过“渲染”(绘制)图像,并根据该蓝图自动标记出拖拽动作的起点和终点。这就像拥有一个 GPS,在你在路上开车之前,就已经知道每一个路标的确切位置。这使得他们能够非常快速且廉价地创建了 350 万个训练任务。

3. 数据集:四个全新的“游乐场”

他们不仅仅制作了一种类型的拖拽任务;他们构建了四个不同的“游乐场”,让机器人进行练习:

  • 文本高亮: 拖动经过一个句子以选中它(就像在教科书中高亮一个单词)。
  • 单元格选择: 在电子表格的网格上拖动以选择一个数字块。
  • 元素缩放: 抓住图片或窗口的角落并拉动它,使其变大或变小。
  • 滑块操作: 抓住一个滑块条(如音量控制)并向左或向右滑动。

总共,他们创建了 28.6 万张截图供机器人学习。

4. 结果:熟能生巧

作者在世界上最智能的 AI 模型上测试了这个新数据集。

  • 基准线: 最好的“现成”AI 模型(如 GPT 和 Claude)在这些任务上的得分低于 30%。它们基本上是失败的次数多于成功的次数。
  • 突破: 作者采用了一个开源 AI 模型,并专门针对他们的全新 DragOn 数据集进行了训练。
  • 结果: 这个经过训练的模型准确率跃升至 35.3%。虽然这听起来可能不是一个巨大的数字,但相比基础模型(仅为 2.3%)来说是一个巨大的进步,并且它在四项任务中的三项上实际上击败了最昂贵的专用模型。

核心结论

该论文声称,通过给 AI 模型提供一个大规模、高质量的“拖拽”示例库——利用一种聪明的自动化蓝图方法创建——我们可以让它们更好地处理复杂的计算机任务。它证明了数据是关键:如果是在正确类型的练习数据上进行训练,即使是一个标准的开源模型也能超越最昂贵的商业模型。

作者希望这个新的基准测试和数据集能帮助未来的机器人成为可靠的“电脑使用者”,让它们不仅能点击,还能像人类一样学会拖拽、放下、缩放和滑动。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →