← 最新论文
🤖 AI

Executable Agentic Memory for GUI Agent

本文提出了可执行智能体记忆(EAM),这是一种基于结构化知识图谱的框架,它利用价值引导的图搜索,以稳健的检索与执行流程取代了脆弱的逐步大语言模型交互,从而在长视野图形用户界面自动化任务中实现更优的性能、更低的成本和更低的延迟。

原作者: Zerui Qin, Sheng Yue, Xingyuan Hua, Yongjian Fu, Ju Ren

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Zerui Qin, Sheng Yue, Xingyuan Hua, Yongjian Fu, Ju Ren

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和富有创意的类比,对论文《面向 GUI 智能体的可执行代理记忆(Executable Agentic Memory for GUI Agent)》的解释。

问题所在:“健忘”的机器人

想象一下,你雇佣了一个机器人来帮你使用智能手机。每当机器人看到一个新的屏幕(比如打开设置菜单)时,它都必须忘记刚才所做的一切,从头重新阅读屏幕,并猜测下一步该做什么。

这就是目前大多数 AI 智能体的工作方式。它们就像在巨大而混乱的城市中患有失忆症的游客

  • 它们看到路牌(屏幕)。
  • 它们猜测该往哪个方向走。
  • 它们迈出一步。
  • 然后,它们看到新的路牌,忘记了之前的路牌,再次进行猜测。

如果它们在早期犯了一个小错误,就会迷路。它们可能会走进死胡同(错误的 App 界面),并继续猜测,浪费时间和金钱。这被称为“脆弱”的系统,尤其是对于像“打开蓝牙,然后找到一张特定照片,再将其通过邮件发送”这样的长任务而言。

解决方案:EAM(“活地图”)

作者提出了一种名为可执行代理记忆(Executable Agentic Memory, EAM)的新系统。机器人不再猜测每一步,而是构建一个手机界面的结构化、动态的地图

不要把 EAM 想象成一份文本笔记列表,而要把它想象成一张巨大的、交互式的地铁地图

  • 站点:这些是你手机上的不同屏幕。
  • 轨道:这些是你可点击的按钮和操作。
  • 连接:地图确切地知道哪个按钮通向哪个屏幕。

一旦这张地图构建完成,机器人就不需要“猜测”点击按钮后会发生什么。它只需查看地图,看到轨道,然后跟随它即可。

如何构建地图(离线阶段)

在机器人可以使用地图之前,必须先有人绘制它。论文描述了一种聪明的方法,可以在不浪费时间的前提下完成这项工作:

  1. 探索者(DFS):想象派出一位非常有条理的探索者进入手机的应用程序中。他们不是随机游荡,而是使用“深度优先搜索”策略。他们沿着一条路径尽可能深入,标记死胡同,然后回溯以尝试下一条路径。这确保了他们在不陷入死循环的情况下找到所有可能的路线。
  2. 压缩器(动作组挖掘):有时,一个任务需要连续点击五个按钮(例如,“打开设置” -> “网络” -> "Wi-Fi" -> “扫描”)。逐个执行这些操作非常缓慢。系统会寻找这些频繁出现的模式,并将它们粘合成一个单一的“超级按钮”(就像地铁的快车一样)。这使得地图更小,导航速度更快。

机器人如何使用地图(在线阶段)

当你给机器人一个任务(例如“打开 Wi-Fi")时,它不会只是猜测。它会使用GPS 导航仪在地图上找到最佳路线。

  1. GPS(Q 模型):机器人拥有一个小型、智能的大脑(一个轻量级 AI 模型),它充当 GPS。它查看地图并说:“如果我走这条轨道,有 90% 的几率到达目标。如果我走那条,只有 10% 的几率。”
  2. 搜索(MCTS):机器人在脑海中模拟几条可能的路线(就像在谷歌地图上查看交通状况一样),以挑选绝对最佳的路径。
  3. 执行:一旦选定路径,机器人就会执行步骤。由于路径来自经过验证的地图,因此它保证是有效的。它不会意外点击不存在的按钮或导致屏幕损坏。

为什么这很重要

该论文声称,这种方法解决了三个主要问题:

  • 可靠性:因为机器人遵循预先验证的地图,所以它不会迷路或产生幻觉(编造内容)。这就像遵循地铁地图,而不是向可能正在猜测的陌生人问路。
  • 速度:机器人快得多。它不需要让一个庞大、缓慢的 AI(如 GPT-4)思考每一个步骤,而是使用一个小型、快速的 AI 来读取地图。论文指出,其计算成本降低了 6 倍,每一步仅需2.8 秒
  • 长任务:它可以处理漫长而复杂的任务,而不会忘记起点。地图将整个旅程保持在视野之中。

结果

研究人员在真实的 Android 手机任务上测试了该系统。

  • 成功率:他们的系统以显著优势(最高提升 19.6%)击败了当前最佳的 AI 模型(如 UI-TARS-7B)。
  • 效率:与大型云端模型相比,它使用的计算机资源(tokens)要少得多。

总结类比

  • 旧方法:一个游客试图通过在每个路口向不同的陌生人问路来穿越城市。他们感到疲惫、困惑,并且经常走到错误的街区。
  • EAM 方法:一个拥有完美预绘地铁地图和智能 GPS 的游客。他们确切地知道该乘哪趟车、在哪一站下车,并且永远不会迷路。他们快速、廉价且可靠地到达目的地。

该论文得出结论,通过将手机界面视为结构化机器(即地图),而不是一系列需要猜测的随机图像,我们可以使 AI 智能体在长期自动化任务中变得更加可靠和高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →