← 最新论文
💻 computer science

Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning

本文介绍了 HyperClick,这是一个新颖的框架,它利用自我批判的强化学习来同时优化 GUI 定位的准确性和置信度对齐,从而使得自主 GUI 代理更加可信和可靠。

原作者: Shaojie Zhang, Pei Fu, Ruoceng Zhang, Jiahui Yang, Anan Du, Xiuwen Xi, Shaokang Wang, Ying Huang, Bin Qin, Zhenbo Luo, Jian Luan

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Shaojie Zhang, Pei Fu, Ruoceng Zhang, Jiahui Yang, Anan Du, Xiuwen Xi, Shaokang Wang, Ying Huang, Bin Qin, Zhenbo Luo, Jian Luan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明但略显过度自信的机器人助手。它的工作是观察你的手机或电脑屏幕,并精确地点击你指示的位置。如果你说“点击隐私按钮”,机器人就需要找到那个按钮并点击它。

问题在于,即使错了,这个机器人也常常认为自己是个天才。它可能会点错位置,但却自信地告诉你:“我有 99% 的把握那是正确的按钮!”这很危险,因为如果机器人错了却充满信心,它可能会点击错误的地方,导致整个任务失败。

本文介绍了一种名为HyperClick的新训练方法来解决这个问题。以下是其工作原理,通过一些简单的类比来说明:

问题所在:“过度自信的学生”

将当前的 AI 模型想象成正在参加考试的学生。他们回答每一个问题,但经常给出错误答案,同时大喊:“我绝对确定我是对的!”

  • 问题所在:研究人员发现,这些 AI 模型极不擅长判断自己何时不确定。它们是“过度自信”的。即使它们错了,仍然声称自己有 90% 的把握。这使得人类难以信任它们,或者不知道何时该介入提供帮助。

解决方案:通过双重奖励进行“自我批评”

作者创建了一个名为HyperClick的新系统,教导机器人诚实地表达自身的信心。他们使用了一种称为**自我批评强化学习(SCRL)**的技术。

想象一位老师用两条特定规则(奖励)来训练学生:

  1. “你是否命中目标?”奖励

    • 如果机器人点击了正确的按钮,它就获得一分;如果点击了错误的按钮,就得零分。这是训练机器人的标准方式。
    • 类比:这就像篮球教练说:“如果球进了篮筐,你就得一分。”
  2. “诚实”奖励(新部分)

    • 这是关键要素。机器人现在必须在点击之前说出它有多确定。
    • 如果机器人点击了正确的位置,它应该说:“我非常确定(高置信度)。”
    • 如果机器人点击了错误的位置,它应该说:“我不太确定(低置信度)。”
    • 转折:如果机器人点击了错误的位置,却说“我有 100% 的把握!”,它将受到惩罚。如果它点击了正确的位置,却说“我在猜”,它也会得到较低的分数。
    • 类比:老师现在说:“只有当你的信心与表现相匹配时,你才能获得满分。如果你投丢了,你必须承认你在猜;如果你投进了,你可以说你有把握。”

实际运作方式

该系统为每个屏幕生成一张“置信度地图”。

  • 目标:想象正确的按钮是一个靶心。靶心的中心代表"100% 的置信度”。随着你远离中心,置信度分数会下降。
  • 训练:机器人学会审视自己的点击。如果它点击靠近中心的位置,它就学会说:“高置信度!”如果它点击远离中心的位置,它就学会说:“低置信度。”

结果

研究人员在许多复杂的屏幕(如高分辨率计算机界面和移动应用)上测试了这种方法。

  • 准确性:机器人获得正确答案的频率与现有最佳机器人一样高。
  • 诚实度:最大的突破在于,机器人在将其置信度与实际表现相匹配方面变得好得多。
    • 之前:它错了,却声称自己有 90% 的把握。
    • 之后:当它错了,它会承认:“我只有 40% 的把握。”当它对了,它说:“我有 90% 的把握。”

为什么这很重要

这并不意味着机器人已经完美,但它使其变得值得信赖

  • “弃权”功能:因为机器人现在可以说“我不确定这次点击”,人类(或安全系统)就可以介入说:“好的,先别点那个,让我检查一下。”
  • 不再盲目信任:与其盲目信任一个可能自信地犯错的机器人,你现在可以信任它的“不确定性”。如果它表示不确定,你就知道需要小心。

总结

本文提出了HyperClick,这是一种训练方法,教导 AI 屏幕点击者保持诚实。它迫使 AI 不仅要找到正确的按钮,还要准确报告它有多确定。这防止了 AI 自信地犯错,使其成为自动化你的电脑和手机任务时更安全、更可靠的助手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →