Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation
本文提出了一种用于计算机使用智能体的强化学习框架,该框架利用自主视觉语言模型生成噪声奖励信号,随后通过噪声感知估计器对这些信号进行修正,从而显著提高在多种桌面环境中的任务成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何使用电脑。你想让机器人打开一个电子表格,找到一个特定的数字,然后把它通过电子邮件发送给老板。研究人员将这种机器人称为计算机使用智能体(Computer-Use Agent, CUA)。
这里存在一个巨大的问题:如何告诉机器人它做得好不好?
在电子游戏中,计算机能立即知道你是赢了还是输了。但在真实的桌面系统(如 Windows 或 macOS)上,并没有“游戏结束”的提示界面。机器人可能点击了正确的按钮,但窗口可能并没有弹出,或者它输入的电子邮件地址是错误的。通常情况下,需要一个人盯着屏幕并说:“是的,成功了,”或者“不,再试一次。”但你不可能雇佣一个人来盯着机器人每一次尝试,那样太慢也太贵了。
解决方案:“机器人老师”
该论文的作者提出了一个聪明的变通方法。他们没有使用人类,而是使用了一个超级智能的 AI(视觉语言模型)来充当机器人老师。
系统的运作方式如下:
- 学生: 计算机使用智能体尝试执行任务。
- 老师: 任务完成后,机器人老师会观察屏幕的最终截图和原始指令。然后,它会给出一个简单的评分:“通过”(1) 或 “失败”(0)。
- 循环: 学生利用这个评分进行学习并再次尝试。
陷阱:老师也会犯错
问题在于,机器人老师并不完美。有时它会将失败的任务误判为成功(假阳性/误报),有时它会将成功的任务误判为失败(假阴性/漏报)。
如果你盲目信任老师,机器人就会学到错误的经验。
- 类比: 想象一位教练,当球员把球踢进错误的球门时,他竟然错误地鼓掌喝彩。球员心想:“做得好!”于是继续这样做。最终,这个球员变得非常擅长向错误的球门进球。
妙招:“噪声修正”评分
这篇论文的核心贡献是一个数学上的“修正过滤器”。
研究人员意识到,我们可以衡量老师犯错的频率。他们在已知正确答案的测试集上进行了测试,并将结果与老师的判断进行了对比。他们计算出:
- 老师在应该判定为“失败”时,判定为“通过”的频率是多少?
- 老师在应该判定为“通过”时,判定为“失败”的频率是多少?
利用这些数据,他们创建了一个公式,在将成绩交给机器人之前,先对老师的评分进行**“清理”**。
- 类比: 如果已知老师过于慷慨(过于宽容)了 20%,系统会自动从每一个“通过”的评分中减去一点点“慷慨度”,然后再让机器人看到。这确保了机器人是从“真相”中学习,而不是从老师的偏见中学习。
结果如何?
他们在三个不同的操作系统上进行了测试:macOS、Windows 和 Linux。
- 没有修正时: 机器人的进步很小,表现不稳定,并且由于受到老师错误判断的干扰,在处理通用任务时有时甚至会退步。
- 有了修正后: 机器人的表现显著提升。平均而言,其成功率比从零开始提高了 12.6%,并且比使用未经修正的老师提高了 5.1%。
核心结论
这篇论文证明了,你可以在不需要人类全程监督的情况下,教会机器人使用电脑。你只需要第二个 AI 来评分,只要你能通过数学手段修正第二个 AI 的错误即可。
这使得在海量数据上训练机器人成为可能,让它们在处理不同操作系统上的现实世界计算机任务时变得更加出色。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。