PreAct: Computer-Using Agents that Get Faster on Repeated Tasks
PreAct 是一个通过将成功的执行过程编译为可验证的状态机程序,从而加速计算机使用型智能体执行重复任务的系统,它实现了 8.5–13 倍的加速回放,并内置了安全检查以确保正确性并防止错误脚本的累积。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个非常聪明但非常昂贵的机器人助手。这个机器人可以观察你的电脑屏幕,弄清楚该点击哪些按钮,并输入文本来完成任务——比如预订会议或添加联系人。
问题在于,这个机器人非常浪费。每次你让它做同样的任务时,它都会忘掉之前所做的一切。它必须重新观察屏幕,从头开始思考每一个步骤,并且每次都要支付高昂的“思考费”(使用昂贵的 AI 计算资源)。这就像雇佣了一名导游,即便他已经带你参观过一次博物馆,第二天带你参观完全相同的博物馆时,你还得为请一位全新的导游而付费,尽管他们其实都对布局了如指掌。
PreAct 是一个让机器人从“健忘”变得“流利”的新系统。以下是它的工作原理,我们使用一些日常类比来解释:
1. “食谱”与“厨师”
通常情况下,机器人的行为就像一位厨师,每做一顿饭都要重新品尝每一种食材,并重新发明一遍食谱。
PreAct 改变了这一局面。当机器人第一次成功完成一项任务(例如添加联系人)时,它不仅仅是完成了任务,还会写下一份完美的、分步骤的食谱(一个“状态机程序”)。
- 第一次执行时: 机器人使用它昂贵的“思考大脑”来解决任务并编写食谱。这需要时间和金钱。
- 第二次执行时: 机器人不再使用昂贵的思考大脑,而是直接阅读食谱并遵循指令。它不需要思考,只需行动。这使得它运行速度提升了 8.5 到 13 倍,且几乎是免费运行。
2. “安全检查”(并非盲目跟随)
你可能会担心:“如果屏幕看起来不一样了怎么办?如果弹出了一个窗口怎么办?”
如果机器人只是盲目地遵循食谱,它可能会点错按钮并搞砸事情。
PreAct 非常聪明。在执行食谱中的每一个步骤之前,它都会扫一眼屏幕,以确保屏幕看起来与食谱预期的完全一致。
- 如果匹配: 它会立即点击按钮(无需思考)。
- 如果不匹配: 它会立即停止,说“等等,情况不对”,然后再次召唤昂贵的机器人大脑来应对新的情况。
这就像一名司机遵循 GPS 路线行驶,但会时刻盯着路面。如果道路封闭了,他们不会盲目地撞墙,而是会停下来寻求新的路线指导。
3. “质量控制门”(最关键的部分)
这里有一个棘手的问题:如果机器人写了一份看起来很完整、但实际上失败了的食谱怎么办?
示例: 食谱说“输入姓名,点击保存”。但也许机器人忘了输入姓名,所以当它点击“保存”时,什么也没发生。如果机器人保存了这份错误的食谱,那么以后每次尝试使用它时都会失败。
PreAct 设置了一个严格的质量控制门。
在将新食谱放入其库中之前,它会重置计算机,并从头开始运行该食谱,以观察它是否真的有效。
- 如果食谱有效: 它会被添加到库中。
- 如果食谱失败(即使它一直运行到了最后): 它会被扔进垃圾桶。
研究发现,如果没有这个“门”,机器人的库会充斥着“错误的食谱”,导致它在执行任务时表现反而越来越差。有了这个“门”,机器人每重复一次任务,就会变得更加出色。
结果
研究人员在手机、台式电脑和网站上进行了测试。
- 速度: 重复执行任务的速度提升了 8.5 到 13 倍。
- 成本: 机器人停止了在重复任务中支付昂贵的“思考费”。
- 可靠性: 通过在每一步检查屏幕并过滤掉错误的食谱,该系统不仅变得更快,而且随着时间的推移变得更加准确。
简而言之: PreAct 将一个每次都要重新发明轮子的机器人,变成了一个能够学习技能、记录技能,并能完美且即时地执行该技能的机器人——直到情况发生变化,届时它会再次学习。这就像是一个学生仅仅通过一次就记住了数学题,而不是每天都忘记并被迫重新学习。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。