← 最新论文
🤖 machine learning

Mem-W: Latent Memory-Native GUI Agents

Mem-W 引入了一类新型图形用户界面智能体,将历史记忆和工作记忆直接作为紧凑令牌整合到模型的潜在上下文中,从而消除了外部符号记忆与内部表征之间的不匹配,显著提升了在网页和移动基准测试中的长程任务性能。

原作者: Guibin Zhang, Yaohui Ling, Fanci Meng, Kun Wang, Shuicheng Yan

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Guibin Zhang, Yaohui Ling, Fanci Meng, Kun Wang, Shuicheng Yan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于Mem-W论文的解析,将其拆解为简单概念并辅以日常类比。

核心难题:“笔记本”与“大脑”

想象一下,你正在教一个机器人导航复杂的视频游戏世界(比如一个网站或手机应用)。机器人需要记住一些事情:“我三个屏幕前点错了按钮”,或者“我在之前的游戏中见过一个长得像这样的菜单”。

旧方法(笔记本):
大多数当前的 AI 智能体就像一个带着实体笔记本的学生。当它们需要回忆某事时,会停下来,在笔记本上写下摘要(例如:“用户想买鞋,但购物车是空的”),读回这些内容,然后尝试利用这段文字来决定下一步做什么。

  • 缺陷: 这就像把想法从英语翻译成法语,写下来,再翻译回英语,然后才开始思考。这既缓慢又笨拙,而且你可能会丢失原始情感的细微差别。机器人在利用其历史之前,必须不断将其翻译成“人类可读的笔记”。

Mem-W 解决方案(大脑):
这篇论文的作者Mem-W提出:“为什么要翻译呢?”
Mem-W 不再写笔记,而是将机器人的整个历史转化为原始的、连续的电信号(称为“潜在令牌”),这些信号直接融入机器人的大脑。这就像机器人不需要笔记本;它只是将记忆作为当前思维过程的一部分直接感受到。


Mem-W 如何工作:“记忆编织者”

将 Mem-W 想象成一位大师级织工,它将两种不同类型的线纺成一块单一的、无缝的织物,供机器人穿戴。

1. 两种类型的线

机器人需要两种记忆:

  • 工作记忆(“当下”的线): 这是当前任务中过去几秒钟发生的事。(例如:“我刚向下滚动,看到了一个红色按钮。”)
  • 经验记忆(“过往经验”的线): 这是机器人在之前的其他任务中发生的事。(例如:“上次我看到红色按钮时,它是‘删除’按钮,所以我应该小心。”)

2. 魔法压缩器(“纺车”)

过去,这两条线被保存在不同的盒子里。Mem-W 引入了一种压缩器

  • 想象一台机器,它将一段冗长、杂乱的任務视频缩小成一个微小的、致密的“记忆芯片”。
  • 它不是将视频总结成文字,而是将视频转化为机器人大脑能瞬间理解的压缩信号
  • 关键在于,它使用同一台机器压缩了“当下”的线和“过往经验”的线。这意味着它们说着同一种语言。

3. 编织(“无缝织物”)

一旦这些线被压缩成这些微小的芯片,Mem-W 就将它们与机器人当前的屏幕视图编织在一起。

  • 结果: 机器人看着屏幕,看到的是一条单一、连续的信息流。它看到的不是“当前屏幕”加上“旧笔记”。它看到的是“当前屏幕 + 过往教训 + 当前进度”全部混合在一起,形成一个流畅的思维。

它是如何学习的:“在做中学”

该论文描述了一个两步训练过程,以教导这位织工如何工作:

  1. 第一阶段:“影子”导师(自蒸馏)

    • 机器人观看一段人类执行任务的漫长、完美的视频。
    • 机器人尝试仅使用压缩后的记忆芯片来模仿人类。
    • 如果机器人犯错,它会学习调整“压缩”方式,以便最重要的细节(如“不要点击红色按钮”)被保留在微小的芯片中。这就像学生试图只记住关键情节来背诵整本书,然后检查自己是否搞对了故事。
  2. 第二阶段:“结果”教练(结果感知监督)

    • 现在,机器人尝试独立解决任务。
    • 如果它成功了,系统会说:“太棒了!保持这些记忆芯片原样不变。”
    • 如果它失败了,系统会说:“糟糕!这些记忆芯片没能帮你避开陷阱。改变它们。”
    • 这教导机器人专门记住什么导致成功以及什么导致失败,从而过滤掉噪音。

结果:为何它至关重要

该论文在四个不同的“世界”(网站和移动应用)上测试了 Mem-W。以下是发生的情况:

  • 更快、更聪明: 通过跳过“翻译成文字”的步骤,机器人减少了错误,并更频繁地完成任务。
  • 在小大脑上也能工作: 即使使用更小、功能较弱的 AI 模型,添加 Mem-W 也能使其表现与(或优于)没有此记忆系统的更大模型相当。
  • “甜蜜点”: 他们发现,检索大约 5 个过往经验并压缩当前历史是完美的平衡。过多的记忆会拖慢速度;过少则会导致遗忘。

总结

Mem-W 是 AI 智能体记忆的一种新方式。与其记录它们做过什么的日记,它们将整个历史转化为其大脑能流利掌握的原生语言。这使得它们能够同时从过去的错误和当前的进步中学习,从而在导航互联网和智能手机等复杂的数字世界时表现得更加出色。

简而言之: Mem-W 阻止 AI 写日记,转而让它用自己的原生语言去做梦

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →