← 最新论文
🤖 AI

Workspace Models: Lightweight Robotic Memory via Saliency-Driven Supervision

本文引入了“工作空间标记”(workspace tokens),这是一种通过来自视觉语言模型(VLM)的显著性驱动监督进行训练的轻量级潜在记忆表示,它使机器人策略能够在部署时高效解决长期记忆任务,且无需在回路中进行 VLM 推理,同时还能提升整体性能。

原作者: Nitish Dashora, Douglas Chen, Idan Shenfeld, John Marangola, Pulkit Agrawal, Max Simchowitz

发布于 2026-09-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Nitish Dashora, Douglas Chen, Idan Shenfeld, John Marangola, Pulkit Agrawal, Max Simchowitz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

能够在现实世界中操纵物体的机器人面临着一个根本性的挑战:它们需要记住刚才发生的事情,甚至是几分钟前发生的事情,才能在当下做出正确的决策。如果机器人正在堆叠积木,它必须回想起自己已经放置了多少块。如果它正在打开抽屉,它必须记得哪一个抽屉里装有它正在寻找的物体。过去,工程师们试图通过将机器人电脑所见过的每一帧视频都喂给它来解决这个问题,但这种方法往往会让机器感到困惑,导致它过度关注无关的细节并最终失败。最近,研究人员尝试使用庞大且强大的人工智能模型来充当记忆,不断扫描机器人的历史记录以总结出重要信息。虽然这行得通,但速度缓慢且成本高昂,就像每次你询问一页书的内容时,都要要求一位人类图书管理员去阅读图书馆里的每一本书一样。机器人专家们核心的问题在于,如何在不降低速度或不需要超级计算机运行的情况下,赋予机器人可靠的记忆。

来自麻省理工学院(MIT)和卡内基梅隆大学的研究团队提出了一种他们称之为“工作空间模型”(workspace model)的解决方案。他们不再依赖强大的、缓慢的计算机在机器人工作时去总结历史,而是在训练阶段教导一个小型、轻量级的记忆系统。他们只在机器人学习的过程中使用强大的人工智能模型,而不是在机器人执行任务时使用。这个强大的模型充当老师的角色,指出视频中哪些时刻是重要的——例如,机器人夹爪抓起积木的时刻,或是抽屉关闭的时刻。研究人员随后训练一个紧凑且高效的系统,将这些重要的时刻压缩成一个微小的、隐藏的摘要。一旦训练完成,机器人就可以利用这个小巧的摘要瞬间记住过去,而无需再次调用那个缓慢且强大的老师。

研究人员在几个需要长期记忆的困难任务上测试了这种方法。在一个模拟环境中,机器人必须向碗中准确地放入五个立方体,由于立方体进入碗中后会从视野中消失,这迫使机器人必须在记忆中进行计数。在另一个任务中,机器人必须打开一个被另一个机器人先前关闭的特定抽屉,这要求它回忆起哪个抽屉里装有物体。他们还在一个硬件设置上测试了一个真实的机器人,该机器人需要将立方体放入高度过高而无法看到内部的箱子里,这同样要求机器人保持连续计数。在这些测试中,新的工作空间模型在 91.5% 的尝试中取得了成功。这明显优于其他方法。一个仅观察最后几帧画面的标准机器人因为忘记了过去而经常失败。而一个试图在任务期间使用强大的 AI 模型来筛选过去关键时刻的机器人则要慢得多,且成功率仅为 66.8%。工作空间模型不仅是最准确的,也是最快的,它允许机器人快速反应,而不会产生等待大型计算机处理历史记录所导致的延迟。

这种方法的成功源于一种巧妙的构建记忆方式的转变。在之前的尝试中,研究人员会让大型 AI 模型在机器人移动时从视频流中挑选出重要的帧。这个过程引入了延迟,即滞后,使得机器人的动作变得生硬且不够精准。新方法将这些繁重的工作转移到了训练阶段。在训练期间,强大的 AI 模型会回顾整个任务的视频,并识别出关键事件。然后,它教会小型的工作空间模型去重建这些重要视觉细节的列表。小型模型学会将这些信息压缩成一个单一的、稠密的标记(token)——这是一个持有过去本质的微小数据片段。当机器人在现实世界中部署时,它只需观察这个标记即可。它不需要重新分析过去,也不需要等待大型模型进行思考;记忆已经被提炼并准备就绪。这使得机器人能够保持清晰、连续的行动流,而不会受到早期方法中那些干扰的影响。

研究人员发现,这种方法不仅提高了速度,实际上还让机器人变得更聪明了。当他们分析其他方法为何失败时,他们发现仅仅向机器人喂入更多的帧,甚至是有选择性的帧,往往会使其产生困惑。机器人会开始模仿错误的动作,或者无法精确地抓取物体,因为额外的信息引入了噪声。相比之下,工作空间模型提供了一个平滑、连续的过去表征。由于小型模型经过训练,能够重建整个历史中最显著的细节,因此它学会了忽略干扰性的噪声,并专注于对任务真正重要的部分。这使得机器人能够正确计数、找到正确的抽屉,并以其他方法无法比拟的精准度进行抓取。

这项研究表明,机器人记忆的未来可能不在于让机器人本身变得更大或更强大,而在于如何教导它们去记忆。通过使用强大的工具来训练更简单、更高效的系统,研究人员可以创造出既快速又具备复杂长期推理能力的机器人。工作空间模型充当了一个桥梁,将用于记忆的沉重推理过程压缩成一种机器人可以实时使用的形式。这种方法为需要在动态、不可预测的环境中运行的机器人提供了一条前进的道路,在这些环境中,记住过去与看见现在同样重要。这项工作证明,通过正确的训练策略,机器人可以携带一个丰富的经验历史,并以轻量化的形式,随时准备以清晰度和速度进行行动。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →