ReVision: Scaling Computer-Use Agents via Temporal Visual Redundancy Reduction
本文介绍了 ReVision,这是一种通过选择性地移除连续截图中的冗余图块来减少计算机使用代理轨迹中视觉令牌冗余的方法,从而在降低令牌成本的同时提高成功率,并使代理能够有效利用更长的历史上下文。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个非常聪明但略显健忘的机器人助手如何导航电脑屏幕以完成复杂任务,例如预订航班或清理浏览器历史记录。
每当机器人迈出一步,它就会拍摄一张屏幕照片。为了理解这张照片,机器人将其分解为成千上万个被称为“令牌”(tokens)的微小拼图碎片。它看到的照片越多,需要处理的拼图碎片就越多。
问题:“便利贴”过载
该论文指出了一个主要低效之处:当你移动鼠标或点击按钮时,90% 的屏幕通常保持完全不变,只有极小的角落发生变化。
然而,当前的 AI 助手就像这样一个人:在每一步之后,即使新贴上的便利贴中 95% 的内容与刚刚贴上的那张完全相同,他仍然会在墙上贴上一张全新的、整页的便利贴。
- 结果:他们的墙壁(即计算机内存)很快就被便利贴覆盖。他们再也没有空间来记录新的、重要的信息。
- 后果:由于他们忙于反复查看相同的旧背景,无法记住足够的过往信息以在长期任务中做出良好决策。他们撞上了一堵“墙”,此时增加更多历史数据实际上会降低其表现,因为他们正淹没在冗余数据中。
解决方案:ReVision(“智能橡皮擦”)
作者们引入了 ReVision,这是一种新方法,充当这些数字便利贴的“智能橡皮擦”。
ReVision 不再每次粘贴整页新内容,而是查看新照片并询问:“自上一张照片以来,实际发生了什么变化?”
- 如果背景、菜单栏和文本没有移动,ReVision 就会擦除新照片中的这些部分。
- 它只保留代表新动作的微小拼图碎片(例如出现新按钮或文本发生变化)。
- 至关重要的是,它保持屏幕的形状完整,以免机器人对物品的位置感到困惑。
类比:电影与幻灯片
想象一下,标准 AI 助手观看电影的方式就像每秒观看 60 张完全相同的照片组成的幻灯片。这既令人疲惫又浪费。
ReVision 则像实时观看电影:它只关注移动的演员和变化的场景,忽略静态背景。
论文发现
研究人员在三个不同的计算机代理“障碍赛道”(OSWorld、WebTailBench 和 AgentNetBench)上测试了这种方法。结果如下:
- 巨大节省:通过使用 ReVision,AI 完成相同任务所使用的“令牌”(拼图碎片)减少了约 46%。这就像为旅行打包行李箱,结果发现可以扔掉一半的衣物,因为你只是在重复穿同一件衬衫。
- 性能提升:令人惊讶的是,AI 不仅节省了资源,还变得更聪明。其成功率提高了约 3%。
- 原因是什么? 因为它没有将脑力浪费在静态背景上,所以有更多的“思维空间”来记住任务早期采取的重要步骤。
- 突破“饱和”点:通常,如果你给 AI 过多的过往照片,它会感到困惑并停止进步。论文发现,这并不是因为过往照片无用,而是因为 AI 淹没在冗余数据中。一旦 ReVision 清理了噪音,AI 实际上可以利用更多的历史数据,从而在长期复杂任务中表现得更好。
核心结论
ReVision 教导计算机代理成为高效的观察者。它们不再每秒记忆整个屏幕,而是学会只关注新出现的内容。这使得它们能够记住更长的故事,做出更好的决策,解决更难的问题,而无需超级计算机来处理数据负载。
注:该论文严格专注于改进计算机使用代理(即控制鼠标和键盘的软件)。它未讨论医疗应用、临床用途,或超出使这些特定代理更高效之外的未来影响。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。