← 最新论文
🤖 AI

Unified Agent: Managing Interactions across Devices

该论文介绍了“统一智能体”(Unified Agent),这是一个通过维护一个紧凑且可直接执行动作的状态,从而有效管理跨设备和跨时间交互的有状态系统,并通过一个新构建的基准测试,证明了其相对于现有智能体设计的卓越且稳健的性能。

原作者: Xinshuang Liu, Runfa Blark Li, Shaoxiu Wei, Xin Lin, Truong Nguyen

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinshuang Liu, Runfa Blark Li, Shaoxiu Wei, Xin Lin, Truong Nguyen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位指挥着一支非常繁忙且非常聪明的管弦乐团的指挥家。在这个乐团里,乐手们不仅仅是在演奏乐器;他们是你的手机、笔记本电脑、平板电脑,甚至是一个扫地机器人。这就是 AI 智能体(AI agents) 的世界——这些计算机程序不只是回答问题,它们还能为你真正地“做事”,比如预订餐桌或发送消息。

通常情况下,这些智能体就像只能听到站在自己面前的人说话的乐手。如果你向你的手机低声请求,你笔记本电脑上的智能体并不知道你说了什么。但如果想要一个能像真正的指挥家一样,能够倾听整个房间,并记住你在十分钟前用手机做了什么,即使你现在手里拿着的是平板电脑呢?这就是**跨设备交互(cross-device interaction)**的挑战。核心问题在于:我们如何教会 AI 去记住你这一天在所有设备上的“故事”,而不至于被过多的信息压垮?如果 AI 忘记了你当时正在使用哪个设备,它可能会问:“刚才是在哪部手机上?”而不是直接完成任务。这篇论文探讨了如何构建一个能够保持完美、精简记忆的智能体,使其无论你下一步拿起哪个设备,都能实现无缝衔接。


问题所在:具有“失忆症”的智能体

想象一下这个场景:你正在寻找一家新餐厅。你在手机上浏览菜单,然后切换到笔记本电脑阅读评论,最后查看平板电脑上的位置。稍后,你拿起手机说:“帮我预订一下我刚才看的那家餐厅。”

如果你今天向一个标准的 AI 智能体求助,它可能会陷入恐慌。它现在只能看到你的手机。它不知道五分钟前你还在笔记本电脑上查看餐厅。它可能会问:“你刚才是在哪个设备上?”或者“哪家餐厅?”这就像一个服务员只记得你刚刚下的订单,却忘记了你走进餐厅时说的所有话。

本文作者认为,目前的 AI 系统缺少一个关键要素:一个紧凑且可携带的状态(compact, carried state)。大多数智能体要么试图记住所有事情(这太沉重且缓慢),要么在时刻过去后就忘得一干二净。它们需要一种方式来携带一个容量恰到好处的“背包”——既能记住你在做什么,又足够轻便以便快速移动。

解决方案:“统一智能体”(The Unified Agent)

研究人员构建了一种新型 AI,称为统一智能体(Unified Agent)。把这个智能体想象成一位超级组织有序的私人助理,随身带着一本特殊的笔记本。

这个智能体并不试图记住你说过过的每一个字或你看过的每一个屏幕,它只会在笔记本上记录三件具体的事情:

  1. 参与证据(Engagement Evidence): “用户在操作谁?用户盯着哪个设备的时间最长?”(例如:“用户在手机上停留了 5 分钟。”)
  2. 陈述事实(Stated Facts): “用户提到了哪些事实?”(例如:“他们提到了一个具体的晚餐时间。”)
  3. 当前请求(The Standing Request): “用户目前正在尝试做什么?”(例如:“他们想预订一张桌子。”)

每当你观察一个屏幕或说一句话时,智能体都会更新这个笔记本。当你稍后说“预订我刚才看的那家餐厅”时,智能体不需要猜测。它会打开笔记本,看到你刚才主要在使用手机,因此准确知道你指的是哪家餐厅。它不需要问“是哪个设备?”,因为答案已经在它的口袋里了。

实验:一个 3D 视频游戏世界

为了测试这个想法是否真的奏效,研究人员并没有仅仅靠猜测;他们构建了一个名为 UA-BENCH 的类视频游戏世界。想象一个虚拟的 3D 房屋,里面有电脑、笔记本电脑、手机,甚至还有一个机器人。他们创建了 100 个不同的场景,让一个虚拟人物以不同的顺序与这些设备进行交互。

在这些场景中,“用户”可能会看笔记本电脑,然后切换到平板电脑,最后在没有说明使用哪个设备的情况下要求智能体执行某项任务。研究人员随后让他们的统一智能体与四种其他类型的 AI 设计进行对决:

  • 无状态智能体(Stateless agents): 只关注当下时刻。
  • 多智能体系统(Multi-agent systems): 由不同的 AI 尝试投票决定该做什么。
  • 重记忆系统(Memory-heavy systems): 试图记住每一个细节。

结果:紧凑的背包胜出

结果非常明确。统一智能体的表现显著优于所有其他系统。在默认测试中,它的综合得分达到了 0.668,而排名第二的系统(一个试图记住一切的“全上下文/Full Context”系统)仅得分为 0.613

其中的奥秘在于:统一智能体之所以获胜,不仅是因为它更聪明,更是因为它更高效

  • “全上下文”系统的记忆像滚雪球一样,随着对话的进行变得大了 11 倍。
  • 统一智能体的记忆始终保持精简且有界限,无论交互持续多久,它都只保留重要的事实。

研究人员使用不同的“大脑”(不同的 AI 模型)和不同的思考能力水平进行了测试。在每种情况下,统一智能体都保持领先。它证明了拥有一个组织良好、精简的状态,比拥有一个更大、更复杂的记忆更为重要。

这为什么重要

这篇论文表明,AI 的未来不在于构建更大、更重、试图记住一切的“大脑”。相反,在于构建更好的组织者

通过保留一份关于你做了什么以及在哪里做的“紧凑且随时待命”的摘要,AI 终于可以成为你在所有设备间穿梭的真正伙伴。它不再询问“刚才是在哪部手机上?”,而是开始说“明白了,正在通过您的手机预订桌位。”它将一系列互不相连的设备变成了一个单一、无缝的体验,而这一切都归功于一点点聪明的组织力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →