← 最新论文
💻 computer science

AndroTMem: From Interaction Trajectories to Anchored Memory in Long-Horizon GUI Agents

本文提出了 AndroTMem 诊断框架及其基准,揭示了长程 GUI 代理性能下降主要源于任务内记忆失效,并据此设计了锚定状态记忆(ASM)机制,通过紧凑的因果中间状态锚点显著提升了代理在长序列任务中的完成率和记忆效率。

原作者: Yibo Shi, Jungang Li, Linghao Zhang, Zihao Dongfang, Biao Wu, Sicheng Tao, Yibo Yan, Chenxi Qin, Weiting Liu, Zhixin Lin, Hanqian Li, Yu Huang, Song Dai, Yonghua Hei, Yue Ding, Xiang Li, Shikang Wang
发布于 2026-03-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Yibo Shi, Jungang Li, Linghao Zhang, Zihao Dongfang, Biao Wu, Sicheng Tao, Yibo Yan, Chenxi Qin, Weiting Liu, Zhixin Lin, Hanqian Li, Yu Huang, Song Dai, Yonghua Hei, Yue Ding, Xiang Li, Shikang Wang, Chengdong Xu, Jingqi Liu, Xueying Ma, Zhiwen Zheng, Xiaofei Zhang, Bincheng Wang, Nichen Yang, Jie Wu, Lihua Tian, Chen Li, Xuming Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

1. 背景:为什么现在的 AI 助手容易“断片”?

想象一下,你给一个实习生布置了一个任务:

“去京东和淘宝比价,把便宜的那个加入购物车,然后生成一个链接发给微信上的 Alice,并附上‘发现更便宜的了’这句话。”

这个任务看起来简单,但中间有30 到 60 个步骤:打开 APP、搜索、翻页、截图、记价格、切换 APP、复制链接、打开微信、找联系人、发消息……

现在的 AI 助手(就像那个实习生)遇到了什么麻烦

  • 记不住重点:它可能记得第一步打开了京东,但到了第 30 步要发消息时,它完全忘了第 10 步在京东看到的具体价格是多少。
  • 信息过载:如果让它把每一步都“背”下来(比如把 30 张截图和 30 句操作全读一遍),它的大脑(内存)会爆炸,而且全是废话,找不到重点。
  • 总结太粗糙:如果让它只记“摘要”(比如“我查了价格”),它又忘了具体是哪个价格,导致后面决策错误。

结果就是:任务步骤越长,AI 犯错率越高。它不是看不懂屏幕,而是记不住中间的关键信息


2. 解决方案:AndroTMem(给 AI 装上“记忆锚点”)

作者们提出了一个叫 AndroTMem 的框架,核心思想是**“锚定记忆”(Anchored Memory)**。

🧠 核心比喻:从“流水账”到“关键路标”

  • 以前的做法(全量回放)
    就像让实习生把过去 30 分钟说的每一句话、做的每一个动作都原封不动地复述一遍给老板听。老板听得头昏脑涨,根本抓不住重点。

    • 缺点:废话太多,关键信息被淹没。
  • 以前的做法(粗略总结)
    就像让实习生只写一句总结:“我查了价格,买了东西,发了消息。”

    • 缺点:太模糊了!老板问“哪个东西?多少钱?发给谁?”实习生答不上来。
  • AndroTMem 的做法(锚定记忆 ASM)
    就像给实习生发了一张**“关键路标地图”。它不需要记流水账,只需要记住几个“锚点”(Anchors)**:

    1. 锚点 A:京东价格 = $1249(这是关键数据)。
    2. 锚点 B:淘宝价格 = $1329(这是关键数据)。
    3. 锚点 C:决定买京东的(这是因果逻辑)。
    4. 锚点 D:Alice 的微信号已复制(这是关键状态)。

    这个“锚点”系统的好处

    • 只记干货:只存那些决定下一步行动的关键信息。
    • 有逻辑链条:它知道“锚点 C"是建立在“锚点 A"和“锚点 B"之上的。如果忘了 A 和 B,C 就没意义了。
    • 随时调用:当需要发消息时,AI 直接去查“锚点 D",而不是去翻 30 步前的聊天记录。

3. 他们做了什么实验?(AndroTMem-Bench)

为了证明这个方法有效,作者们造了一个**“魔鬼训练场”**(Benchmark):

  • 1069 个长任务:平均每个任务有 32 步,最难的有 65 步。
  • 跨 APP 协作:必须同时操作京东、淘宝、微信等多个软件。
  • 强依赖:后面的步骤必须依赖前面的结果(比如:不记住价格,就无法决定买哪个)。

测试结果
他们测试了 12 种不同的 AI 模型(包括 GPT-4o, Gemini, Qwen 等)。

  • 发现:随着任务变长,所有 AI 的表现都大幅下降。
  • 原因:不是因为 AI 变笨了,而是因为**“记不住中间状态”**。
  • 改进:一旦给这些 AI 装上“锚定记忆(ASM)”,它们的成功率提升了 5% 到 30%!这就像给实习生配了一个智能笔记本,让他随时能查到关键数据,不再靠死记硬背。

4. 总结:这篇论文告诉我们什么?

这篇论文就像是在说:

“想要 AI 真正帮人类处理复杂的日常琐事(比如网购、订票、处理报销),光靠‘大眼’(看得清屏幕)和‘大脑’(能推理)是不够的,还得给它配一个**‘好记性’**。

以前的 AI 像是一个过目不忘但记不住重点的“复读机”,或者一个只会写大纲的“摘要员”。
AndroTMem 给 AI 装上了一个‘关键路标系统’,让它知道在漫长的任务中,哪些信息是必须死死抓住的‘锚’,从而不再在复杂的步骤中迷路。

一句话总结
让 AI 从“死记硬背全过程”转变为“只记关键路标”,它就能更靠谱地完成那些需要几十步操作的复杂任务了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →