Agentic Reward Modeling: Verifying GUI Agent via Progressive Trajectory-Grounded Interaction
本文介绍了 VAGEN,这是一个采用工具增强型验证器代理(tool-augmented verifier agent)并结合渐进式、从表面到潜在层级(surface-to-latent)验证机制的框架,旨在克服现有被动式和过度探测式奖励建模方法的局限性,从而显著提高在 OSWorld-Verified 和 AndroidWorld 等基准测试上对 GUI 智能体评估的准确性和效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在教一个机器人使用电脑。你想让它打开应用程序、点击按钮,并完成诸如买书或整理文件之类的任务。为了教导这个机器人,你需要一种方法来告诉它它做得好还是做错了。这就是**强化学习(Reinforcement Learning)的世界,在这里,AI 通过尝试并获得“奖励”来学习。但棘手的部分在于:你如何知道机器人是否真的完成了任务?它是真的买了书,还是仅仅点击了一个看起来像购买按钮的东西?这就是奖励建模(Reward Modeling)**的问题。如果机器人误以为成功了其实并没有,它就会不断重复同样的错误;如果它在实际成功时却认为失败了,它会感到困惑并停止尝试。能否拿对这个“分数”,是决定一个机器人是笨拙的机器还是得力助手的分水岭。
长期以来,科学家们尝试了两种主要的评分方式。第一种就像是一个拿着清单进行检查的严厉老师:“文件出现了吗?是的。窗口关闭了吗?是的。”这适用于简单的任务,但在面对具有创造性或开放性的任务时会失效。第二种方法是请一个超级聪明的 AI(大语言模型)观察机器人的工作视频并判断其是否成功。这种方式具有可扩展性,但 AI 是被动的;它只能观察屏幕上看到的内容。它无法窥视计算机的“大脑”内部,去看是否有一个文件确实在后台被保存了。这就像一位老师在批改数学试卷时,只看学生的最终答案,而不去检查学生是否真的做了题,或者答案是否只是运气好猜中的。
这篇论文介绍了一种更聪明的方法,用来为这些使用计算机的机器人评分。作者 Chaoqun Cui 及其同事提出了一种名为 VAGEN 的系统。VAGEN 不仅仅是观察视频或检查清单,它使用了一个“验证器智能体(Verifier Agent)”——第二个 AI 侦探,它可以进行主动调查。你可以把它想象成一个侦探,他不仅阅读嫌疑人的不在场证明(机器人的视频),还有能力进入犯罪现场、检查隐藏文件并进行测试,以看看事实是否吻合。作者发现,这种主动调查的方法在发现真相方面表现得更好,尤其是当机器人的行为留下了屏幕上看不见的线索时。他们证明了这种方法不仅更准确,而且更高效,证明了有时你必须“弄脏双手”才能知道一项工作是否真正完成。
数字世界里的侦探
那么,这个新的侦探 VAGEN 究竟是如何工作的呢?作者意识到,检查一个机器人是否完成了任务通常比执行任务本身要容易得多。这就像烤蛋糕和检查蛋糕是否烤熟之间的区别。面包师(“执行者”机器人)必须混合食材、观察烤箱并装饰蛋糕。而评委(“验证器”)只需要用牙签戳一下蛋糕或闻闻厨房的味道,就能知道它是否准备好了。作者称之为“易于验证,难于求解”的特性。
为了实现这一点,VLEN 使用了一种渐进式验证机制(Progressive Verification Mechanism)。想象一下验证器是一个正在破解谜题的侦探,他们有一套特定的策略来避免浪费时间。他们不会直接破门而入;他们从最简单的线索开始,只有在必要时才会采取更激进的行动。
阶段 1:快速扫视(静态评估)
首先,验证器查看计算机屏幕的最终图像以及机器人的操作摘要。它会问:“这看起来像是成功了吗?”如果屏幕清晰地显示出“订单已确认”的消息,侦探就会说:“结案!”然后继续下一步。这既快速又廉价。
阶段 2:倒带回溯(视觉回顾)
如果最终画面令人困惑——也许屏幕是空白的,或者消息被隐藏了——侦探并不会放弃。相反,他们会倒回视频。他们查看早期步骤的截图以寻找线索。也许机器人在五分钟前点击了正确的按钮,即使最后的屏幕很混乱。这就像查看监控录像,看看嫌疑人是否真的进入了建筑物。
阶段 3:破门而入(主动探测)
有时候,线索根本不在屏幕上。也许机器人应该将文件保存到硬盘,但屏幕只显示了一个通用的“完成”消息。屏幕在撒谎,或者至少它隐藏了真相。这就是 VAGEN 最酷的地方。验证器智能体拥有特殊的工具来与计算机进行主动交互。它可以运行代码、检查文件系统,甚至可以自己点击按钮来测试文件是否真的存在。这就像侦探终于拿到了搜查嫌疑人住宅的搜查令。他们不只是相信故事,而是去检查地下室。
论文表明,这种“从表面到潜在状态”(从屏幕表面深入到系统的隐藏深度)的方法是一个游戏规则的改变者。作者在两个大型任务集上测试了 VAGEN:OSWorld-Verified(桌面电脑)和 AndroidWorld(移动电话)。
结果:更聪明,更快速
当作者进行数据统计时,VAGEN 不仅仅表现尚可,它简直是碾压了竞争对手。在桌面基准测试中,当其他方法难以突破 80% 的准确率时,VAGEN 在人类专家评判下的准确率达到了 92.9%。更令人印象深刻的是,它在不需要检查每一个截图或进行无休止测试的情况下就完成了任务。它足够聪明,能在找到答案时及早停止。
论文还强调了一个关键发现:主动交互是必要的,但并不总是第一步。 以前过度依赖“探测”(检查系统)的方法通常既慢又不高效,因为它们没有先查看视频证据。它们就像是还没看正门就直接破门而入的侦探。然而,VAGEN 利用视频证据来引导其调查。它只有在视频信息不足时才会进入系统进行探测。这种平衡使其更加高效,利用更少的计算资源(如“步骤”或“Token”)得到了更好的答案。
作者还测试了是否可以通过要求验证器多次检查同一任务(一种称为“缩放”的策略)来使验证器变得更好。他们发现,即使限制验证器只能“读取”数据而不改变任何东西,它也会变得更加聪明。这表明验证器的主要工作是调查,而不是干扰计算机。
为什么这很重要
这里的核心结论是,我们不必在“懒惰的观察者”和“爱管闲事的侦探”之间做选择。我们可以两者兼得。通过将对机器人视频的被动观察与主动检查计算机隐藏状态的能力相结合,VAGEN 创建了一个既可靠又高效的奖励系统。
作者认为,这就是训练 AI 智能体的未来。如果我们想要能够真正帮我们处理计算机和手机的机器人,我们需要一种不会被漂亮的画面所蒙蔽的评分方式。VAGEN 表明,通过赋予我们的 AI 评分员挖掘深层信息的能力,我们可以教导我们的机器人变得更加胜任。这篇论文并不声称解决了世界上所有的难题,但它展示了一条清晰的前行路径:不要只是观看表演,要开始检查幕后。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。