Faithful Mobile GUI Agents with Guided Advantage Estimator
本文介绍了 Faithful-Agent,这是一个两阶段框架,通过将基于证据的监督微调与引导优势估计器(GuAE)相结合,显著减少了幻觉并提高了任务成功率,同时保持了通用的指令遵循能力,从而增强了视觉 - 语言 GUI 代理的可靠性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一个非常聪明、博览群书的机器人助手,它可以查看你的手机屏幕并执行你的指令,比如“给我买一部 iPhone 17"或“重置我的密码”。这个机器人利用一个强大的大脑(视觉 - 语言模型)来理解它所看到的内容以及你的话语。
然而,这篇论文指出了一个重大缺陷:这个机器人经常是一个“自信的骗子”。
问题所在:不观察而靠猜测的机器人
作者将这种行为称为“不忠实”。以下是它在现实生活中的表现:
- “记忆”陷阱:想象你让机器人“重置你的密码”。机器人看到的屏幕实际上是空白的,或者被弹窗广告遮挡。它没有说“我看不到按钮”,而是记住了“通常”重置按钮位于右上角。即使按钮根本不在那里,它也会盲目地点击那个位置。它依赖的是记忆中的捷径,而不是观察实际证据。
- “白日梦”陷阱:想象你让机器人“在亚马逊上买一部 iPhone",但屏幕当前显示的是 Apple Music。机器人忽略了它正处于错误应用中的事实,继续试图在音乐应用内购买手机。因为它没有关注上下文,所以偏离了你的实际指令。
这个机器人本质上是在通过“幻觉”来完成任务,猜测那里“应该”有什么,而不是检查那里“实际”有什么。
解决方案:“忠实代理”(Faithful-Agent)
研究人员创造了一种名为Faithful-Agent的新训练方法。你可以将其想象为一位严格的教练,正在教机器人一条新规则:“如果看不见,就不要碰。”
训练分为两个阶段,就像学习开车一样:
第一阶段:“暂停思考”课程(SFT)
首先,他们教导机器人学会克制。
- 类比:想象一个学生在参加考试。如果不知道答案,普通学生可能会胡乱猜测。而“忠实”的学生被教导举手说:“我没有足够的信息来回答这个问题。”
- 运作方式:机器人被训练去识别屏幕被遮挡、令人困惑或与指令不匹配的情况。它不再猜测,而是学会点击“返回”、回到“主页”或完全停止任务。这阻止了它做出毫无根据的胡乱猜测。
第二阶段:“智能教练”(带有 GuAE 的 RFT)
这是最技术性的部分,但以下是简化版。
机器人通过尝试多种不同的动作并观察哪个动作能获得“奖励”(高分)来学习。但在现实世界中,奖励往往是稀疏的(只有完成整个任务才能获得奖励)且二元的(要么对,要么错;没有“差不多对”)。
- 问题:当机器人尝试了 8 种不同的猜测,而它们看起来都“错”了(或者看起来都“对”了)时,训练系统就会感到困惑。因为它无法分辨哪个猜测稍好一些,毕竟它们看起来都一样。作者将这种现象称为**“优势崩溃”(Advantage Collapse)**。这就像一位老师试图给全班打分,而每个学生的成绩都是 50/50;老师无法判断谁需要更多帮助。
- 修复方案(GuAE):研究人员发明了一种新的“引导优势估计器”(GuAE)。
- 类比:想象一位教练,他拒绝仅仅因为全队表现相似就让团队的整体得分降为零。教练在评分系统中加入了一个“安全锚点”。即使团队陷入停滞,教练也能确保仍有一个微小但清晰的信号告诉队员:“继续尝试,但要更加小心。”
- 这防止了机器人陷入一种循环,即因为反馈看起来过于平淡而停止学习。
结果
这篇论文在“陷阱”数据集(旨在欺骗机器人的场景,如隐藏按钮或错误应用)上测试了这个新机器人与其他机器人的表现。
- 之前:旧机器人在这些陷阱中失败的概率约为86%(成功率仅为约 14%)。它们不断猜测并失败。
- 之后:Faithful-Agent在这些陷阱中的成功率达到了80%。
最重要的是,机器人并没有失去执行正常任务的能力。它在变得更加可靠的同时,并没有变得“愚蠢”或过度谨慎。它学会了说“我现在做不到”,而不是用错误的猜测搞垮系统。
总结
这篇论文提出了一种训练 AI 代理的方法,使其在缺乏证据时停止猜测。通过教导它们在情况看起来不对时暂停并退出,并通过使用更智能的评分系统确保即使在反馈模糊时也能持续学习,机器人变得更加值得信赖,也更少会编造自己的现实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。