← 最新论文
🤖 AI

SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents

该论文介绍了 SeekJudge,这是一个实用的基于模型的奖励框架,它利用四个角色分化的智能体和一个经过蒸馏的 9B 主干网络,在训练计算机使用智能体方面,其表现达到或超过了基于规则的监督,同时提供了步级判断、更低的成本以及针对长程任务的可扩展性。

原作者: Yang Wan, Zhenhao Zhang, Jierui Wang, Linchao Zhu

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Yang Wan, Zhenhao Zhang, Jierui Wang, Linchao Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何在电子游戏中导航,但它不是通过按游戏手柄,而是像人类一样在真实的电脑屏幕上进行点击、打字和滚动。这就是“计算机使用智能体”(computer-use agents)的世界。长期以来,科学家们一直试图通过向机器人展示一个目标(例如“预订酒店”)并检查它是否成功来教导它。旧的检查方式就像使用一份僵化的清单:如果机器人在正确的时间点击了正确的按钮,它就会得到一分;如果它点错了,就得零分。但计算机是混乱且不断变化的。一份清单可能会因为机器人点击了一个看起来与清单上略有不同的按钮,即便机器人实际上完美地完成了任务,却依然判定它“失败”。这就像老师因为学生在优秀的文章中把“color”写成了“colour”而给不及格一样。

为了解决这个问题,研究人员开始使用 AI 模型来充当评委,希望它们能理解任务的“精神实质”,而不仅仅是死板的规则。然而,这些 AI 评委在需要同时观察一段完整的机器人动作视频时经常会感到困惑。这就像试图在一秒钟内读完一整本 500 页的小说,并从中找出某个特定的拼写错误;重要的细节会在噪音中丢失。核心问题变成了:我们如何构建一个既能理解人类目标,运行成本又足够低(以便在机器人学习时进行成千上万次测试),且速度足够快(能够处理长篇复杂故事而不产生“头痛”)的评委?


于是,SeekJudge 登场了。它不像是一个试图包揽一切的过度劳累的侦探,而更像是一个由四名专业侦探组成的团队,通过协作来破解谜题。研究人员发现,当你强迫一个 AI 同时观察过多的电脑屏幕截图时,它会开始产生幻觉或遗漏最重要的线索。这就像是你要求某人在 100 人的群众中识别嫌疑人;他们可能会被一个陌生人的鲜艳帽子分散注意力,从而错过了真正的罪犯。但如果你只给他们看一张嫌疑人的照片,他们就能瞬间识别出来。

SeekJudge 通过拆分工作来解决这个问题。首先,两个“侦察兵”(被称为 CondenseGround 智能体)会快速浏览机器人的漫长旅程,并按步骤写出一份简短、易读的摘要。然后,一名“侦探”(Seek 智能体)阅读这份摘要并做出判断:“嗯,我需要看第 42 步的那张照片才能确定。”随后,它会调用第四个智能体——Analyze 智能体,让它仅观察那一张特定的截图,并回答关于该截图的一个精确问题。这种往复循环的过程会一直持续,直到侦探对给出最终判决感到足够自信。

论文表明,这种“寻找并分析”(seek and analyze)的方法是一个游戏规则的改变者。在测试中,SeekJudge 是第一个在帮助机器人学习新任务方面,表现得与旧有的僵化规则检查器一样好、甚至更好的 AI 评委。事实上,当使用 SeekJudge 来训练机器人时,机器人学习得更快,且成功率更高。

最酷的一点在于它的效率。由于 AI 每次只看一张图像而不是一叠图像,它不需要运行极其昂贵的大型计算机。研究人员发现,该系统的成本仅为其他 AI 评委成本的一小部分——比使用闭源巨型模型要便宜数百倍。这就像是雇佣一群了解情况的当地专家,每人只需几美元查看一个线索,而不是雇佣一位名声显赫的明星侦探,支付巨额费用去阅读整个案卷。

团队还构建了一个新的“训练场”,名为 CUAStepBench,这是一个包含 278 个不同计算机任务的集合,其中人类已经仔细标注了机器人旅程中的每一个步骤。这有助于训练他们的“侦探”团队变得异常敏锐。他们证明了通过将问题分解为“寻找正确时刻”(定位)和“读取细节”(提取),他们可以处理比以往方法更长、更复杂的任务。

简而言之,SeekJudge 并不试图成为一只全知全能的“天眼”;相反,它像是一个聪明的、高效的团队,知道何时该放大观察最重要的线索。这使得在现实世界中训练使用计算机的机器人成为可能——在现实中,任务很长,屏幕在变,且严格的规则手册并不适用。论文指出,这种方法可能是实现真正能协助我们处理日常电脑琐事(从订机票到整理文件)的 AI 助手之关键,而且不需要依靠超级计算机来为它们的作业评分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →