← 最新论文
🤖 AI

Task-Adaptive Rubrics for GUI Reward Modeling

本文介绍了 AdaptRubric,这是一个由粗到精的框架,它通过类别级检索和实例级细化来动态构建任务自适应的评判标准,从而增强了 GUI 奖励建模,并与现有方法相比,显著提高了奖励评估准确度和任务成功率。

原作者: Tao Xiong, Xavier Hu, Wenkai Wang, Qinzhuo Wu, Changqiao Wu, Pengzhi Gao, Wei Liu, Jian Luan, Shengyu Zhang

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Tao Xiong, Xavier Hu, Wenkai Wang, Qinzhuo Wu, Changqiao Wu, Pengzhi Gao, Wei Liu, Jian Luan, Shengyu Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个能够观察屏幕、理解人类请求并点击正确按钮来完成工作的计算机程序。这就是现代图形用户界面(GUI)智能体的愿景——一个能够驾驭手机和电脑复杂界面的数字工作者。但为了让这些智能体学习并改进,它们需要一位老师。在人工智能的世界里,这位老师是一个观察智能体行为并判定其成功或失败的奖励系统。如果智能体成功设置了定时器或发送了电子邮件,老师会给予一个“做得好”的信号;如果智能体点错了按钮或未改变某项设置,老师必须说“再试一次”。这种反馈的质量至关重要;一个过于模糊或过于严苛的老师会让学生感到困惑,导致它永远无法学会正确的行为方式。

长期以来,这些数字老师一直面临着一个特定的问题:它们经常忽略人类实际要求的细节。它们可能会看到屏幕上的某个数字发生了变化,便假设任务已完成,即便改变的是错误的数字;或者它们可能会忽略关于将一段文本放置在何处的具体指令。由 Tao Xiong 和 Shengyu Zhang 领导的研究团队意识到,这些老师判断成功的方式过于僵化。它们要么使用适用于每项任务的通用清单,要么依赖于计算机对重要事项的自我猜测。这两种方法都会导致错误,即计算机认为自己成功了,而实际上却失败了,反之亦然。

为了解决这个问题,该团队开发了一种名为 ADAPTRUBRIC 的新方法。可以将它想象成一个为每一项任务创建定制评分标准的两步走过程。首先,系统查看用户的请求,并确定该请求属于哪种广泛的工作类别,例如“发送消息”、“更改设置”或“删除文件”。对于这些类别中的每一个,系统都有一套预先编写的规则,涵盖了常见的陷阱和标准要求。这是“粗粒度”阶段,它提供了一个坚实的基础,确保老师了解任务的一般边界。

但系统并未止步于此。在第二步“细粒度”阶段,它会仔细观察当前请求的具体细节。如果用户要求将设置更改为恰好五十,系统会增加一条特定规则来检查这个数字。如果用户要求将文件移动到特定文件夹,系统会增加一条规则来验证目的地。这使得老师能够针对当下的独特约束进行即时调整。研究人员在包括 Windows、macOS、Android 和 Web 在内的不同操作系统上的各种任务中测试了这种新方法。他们发现,通过将广泛的类别规则与具体的、任务自适应的细节相结合,系统在判断成功方面变得显著更好。

结果是清晰且可衡量的。在对超过 1,400 次不同任务尝试的基准测试中,新方法正确识别任务成功或失败的准确率达到了 86.7%。这比以往经常出现较大偏差的方法有了明显的进步。更重要的是,研究人员利用这个更聪明的老师在真实环境中训练了一个 AI 智能体。当智能体从 ADAPTRUBRIC 提供的反馈中学习时,它独立完成任务的能力变得更强,其成功率比使用旧的、不够精确的奖励系统训练时高出了 4.23 个百分点。

这项研究还强调了旧方法失效的具体之处。在一个特定的例子中,用户要求智能体在数字笔记的最顶端添加一段问候语。智能体确实添加了问候语,但它将其放在了文本的底部。旧的老师由于只关注文本是否出现,便将其标记为成功。然而,新系统识别出指令明确要求文本必须在顶部,因此正确地将该尝试标记为失败。这种区分“发生了某事”与“以正确的方式完成了正确的事”的能力,正是其区别所在。通过构建一个既能覆盖通用任务又足够敏锐以捕捉特定细节的评判系统,研究人员为 AI 智能体如何从错误中学习并精通数字世界提供了一种更可靠的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →