Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning
本文介绍了 HyperClick,这是一个新颖的框架,它利用自我批判的强化学习来同时优化 GUI 定位的准确性和置信度对齐,从而使得自主 GUI 代理更加可信和可靠。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明但略显过度自信的机器人助手。它的工作是观察你的手机或电脑屏幕,并精确地点击你指示的位置。如果你说“点击隐私按钮”,机器人就需要找到那个按钮并点击它。
问题在于,即使错了,这个机器人也常常认为自己是个天才。它可能会点错位置,但却自信地告诉你:“我有 99% 的把握那是正确的按钮!”这很危险,因为如果机器人错了却充满信心,它可能会点击错误的地方,导致整个任务失败。
本文介绍了一种名为HyperClick的新训练方法来解决这个问题。以下是其工作原理,通过一些简单的类比来说明:
问题所在:“过度自信的学生”
将当前的 AI 模型想象成正在参加考试的学生。他们回答每一个问题,但经常给出错误答案,同时大喊:“我绝对确定我是对的!”
- 问题所在:研究人员发现,这些 AI 模型极不擅长判断自己何时不确定。它们是“过度自信”的。即使它们错了,仍然声称自己有 90% 的把握。这使得人类难以信任它们,或者不知道何时该介入提供帮助。
解决方案:通过双重奖励进行“自我批评”
作者创建了一个名为HyperClick的新系统,教导机器人诚实地表达自身的信心。他们使用了一种称为**自我批评强化学习(SCRL)**的技术。
想象一位老师用两条特定规则(奖励)来训练学生:
“你是否命中目标?”奖励:
- 如果机器人点击了正确的按钮,它就获得一分;如果点击了错误的按钮,就得零分。这是训练机器人的标准方式。
- 类比:这就像篮球教练说:“如果球进了篮筐,你就得一分。”
“诚实”奖励(新部分):
- 这是关键要素。机器人现在必须在点击之前说出它有多确定。
- 如果机器人点击了正确的位置,它应该说:“我非常确定(高置信度)。”
- 如果机器人点击了错误的位置,它应该说:“我不太确定(低置信度)。”
- 转折:如果机器人点击了错误的位置,却说“我有 100% 的把握!”,它将受到惩罚。如果它点击了正确的位置,却说“我在猜”,它也会得到较低的分数。
- 类比:老师现在说:“只有当你的信心与表现相匹配时,你才能获得满分。如果你投丢了,你必须承认你在猜;如果你投进了,你可以说你有把握。”
实际运作方式
该系统为每个屏幕生成一张“置信度地图”。
- 目标:想象正确的按钮是一个靶心。靶心的中心代表"100% 的置信度”。随着你远离中心,置信度分数会下降。
- 训练:机器人学会审视自己的点击。如果它点击靠近中心的位置,它就学会说:“高置信度!”如果它点击远离中心的位置,它就学会说:“低置信度。”
结果
研究人员在许多复杂的屏幕(如高分辨率计算机界面和移动应用)上测试了这种方法。
- 准确性:机器人获得正确答案的频率与现有最佳机器人一样高。
- 诚实度:最大的突破在于,机器人在将其置信度与实际表现相匹配方面变得好得多。
- 之前:它错了,却声称自己有 90% 的把握。
- 之后:当它错了,它会承认:“我只有 40% 的把握。”当它对了,它说:“我有 90% 的把握。”
为什么这很重要
这并不意味着机器人已经完美,但它使其变得值得信赖。
- “弃权”功能:因为机器人现在可以说“我不确定这次点击”,人类(或安全系统)就可以介入说:“好的,先别点那个,让我检查一下。”
- 不再盲目信任:与其盲目信任一个可能自信地犯错的机器人,你现在可以信任它的“不确定性”。如果它表示不确定,你就知道需要小心。
总结
本文提出了HyperClick,这是一种训练方法,教导 AI 屏幕点击者保持诚实。它迫使 AI 不仅要找到正确的按钮,还要准确报告它有多确定。这防止了 AI 自信地犯错,使其成为自动化你的电脑和手机任务时更安全、更可靠的助手。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。