← 最新论文
🤖 AI

Beyond Success and Failure: Length-Aware Contrastive Learning for GUI Agents

本文提出了 LACL-GUI,一种长度感知的对比学习框架,通过引入细粒度的轨迹级质量信号来增强 GUI 智能体训练,从而克服现有方法中存在的奖励梯度失配和结果级监督局限性问题。

原作者: Chengyang Gu, Le Zhang, Jingbo Zhou, Yize Chen, Yu Shi, Siqi Bao, Zheng-Fan Wu, Hua Wu, Hui Xiong

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Chengyang Gu, Le Zhang, Jingbo Zhou, Yize Chen, Yu Shi, Siqi Bao, Zheng-Fan Wu, Hua Wu, Hui Xiong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字世界中,计算机正越来越多地被要求承担更多职责,而不仅仅是执行简单的指令;它们正被要求充当自主助手,能够像人类一样导航复杂的软件、点击正确的按钮并填写表格。这些被称为 GUI 智能体(GUI agents)的数字员工依赖于先进的人工智能模型,这些模型能够“看见”计算机屏幕并理解屏幕上正在发生的事情。多年来,教导这些智能体最有效的方法一直是一种被称为强化学习的方法。在这个过程中,智能体会尝试完成一项任务,在最后接收到一个表示成功或失败的简单“是”或“否”信号,然后调整其行为以再次尝试。虽然这种试错法已经取得了令人瞩目的成果,但研究人员发现,计算机从这些最终的“是/否”答案中学习的方式存在缺陷。标准方法往往会对哪些具体动作导致了成功或失败感到困惑,导致学习过程变得不稳定或低效。这有点像一个学生试图从一位只在漫长练习结束时说“做得好”或“再试一次”的老师那里学习复杂技能,而没有指出哪些步骤是有帮助的,哪些是浪费时间的。

来自香港、北京和埃德蒙顿的一个研究小组开发了一种解决这一问题的新方法,称为面向 GUI 智能体的长度感知对比学习(LACL-GUI)。该方法不再将每一次成功的尝试都视为同样优秀,也不再将每一次失败的尝试都视为同样糟糕,而是更深入地观察任务执行的具体细节。他们意识到,并非所有的成功都是等同的:一个智能体可能通过五次快速、精准的点击解决一个问题,而另一个可能需要走二十步,在屏幕上徘徊并进行不必要的移动,最后才终于成功。同样,失败也不总是彻底的灾难;一个智能体可能在第一步就卡住了,而另一个可能在正确路径上走了大部分路程,最后才犯了一个错误。研究人员的新系统教导智能体去偏好那些更短、更高效的成功路径,并识别出那些“差一点就成功”的失败实际上比那些一开始就出错的失败具有更高的学习价值。

为了实现这一点,研究人员构建了一个能够将不同尝试进行并排比较的系统。当智能体尝试完成一项任务时,系统会收集一组尝试,其中包含成功和失败的案例。对于成功的尝试,系统会识别出最短的一次,并将其作为参考。然后,它会温和地鼓励智能体变得更像那个高效的范例,奖励它采取更少的步骤,并惩罚它的冗余动作。对于失败的尝试,系统会观察智能体在偏离轨道前走了多远。如果一个智能体在很长一段时间内都遵循正确路径后才出错,系统会将其视为“差一点就成功”,并给予较轻的惩罚,承认它学到了有用的东西。如果一个智能体立即偏离了轨道,它则会受到更重的惩罚。这创造了一个比以往方法中简单的通过/失败评分更加细致入微的学习信号。该系统还维护着一个特殊的成功尝试记忆库,允许它将新的失败案例与目前为止见过的最佳成功范例进行比较,从而确保智能体始终有一个明确的目标可以瞄准。

该团队在名为 OSWorld 的综合基准测试上测试了这种新方法,该测试涉及广泛的现实世界计算机任务,如编辑文档、管理电子邮件和使用图像编辑软件。他们使用强大的 AI 模型作为智能体的核心架构,并训练它们解决数百个不同的任务。结果表明,这种新方法始终优于之前的最佳技术。在较大的 AI 模型上,新方法相比标准方法将成功率提高了近三个百分点,这在这一领域是一个显著的进步。更重要的是,使用这种新方法训练的智能体不仅成功率更高,而且效率也更高。当它们成功时,它们采取的步骤更少,减少了不必要的动作。当它们失败时,系统能更好地区分“彻底失败”与“差一点就成功”,从而让智能体能更有效地从错误中学习。

这项工作表明,构建更好的数字助手的关键在于超越最终的结果。通过教导 AI 去欣赏旅程的质量,而不只是终点,研究人员为这些智能体创造了一种更稳定且有效的方法来学习。该方法不需要人类教师盯着每一个动作,它只是利用尝试本身的结构来引导学习。这种方法可以带来更可靠、更高效的未来 AI 智能体,使它们能够以以往难以实现的精确度和经济性来处理复杂的数字任务。研究结果表明,即使在一个只有二进制成功与失败的世界里,也存在着丰富的质量与细微差别,如果能正确理解这些,就能显著提升机器学习行动的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →