← 最新论文
🤖 AI

Budget-Constrained Embodied Perception: Four Resource Walls and a Pre-Registered Evaluation of Access-Structured Perception on Open Models at less than 31B

这项预注册研究引入了 ASP,一种无需训练的封装机制,通过查询条件访问机制显著提高了预算受限的具身智能体在情景检索中的准确性,同时证明了在固定 Token 预算下,提示式在线压缩和完整的架构复杂度并不一定会增强开源权重模型的性能。

原作者: Defu Lin, Wenhui Chen, Ziyao Lin, Jianlin Chen, Peiji Long, Chi Man Vong

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Defu Lin, Wenhui Chen, Ziyao Lin, Jianlin Chen, Peiji Long, Chi Man Vong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你的家里住着一个机器人助手,它的任务是帮你找到你今天早上用过的一个特定杯子。它已经在你的房子里走动了几个小时,记录下了一段连续的视频流。为了回答你的问题,它不能仅仅查看最后几秒钟的画面;它必须在数百分钟的录像历史中进行搜索。然而,机器人的大脑有一个严格的限制:在它需要做出决策的那个瞬间,它只能处理极少量的固定信息。它无法将整个视频存储在活跃记忆中,也无法在每次你提问时都重新观看一整天的内容。这就是具身智能(embodied intelligence)的基本瓶颈:无穷无尽的观察流与有限的思考预算之间的差距。

多年来,研究人员一直希望通过单纯扩大人工智能模型的规模来解决这个问题。主流观点认为,如果模型足够大,它自然会学会记住它看到的一切。但最近的实验表明,即使是最先进的模型,在面对长期的连续视频流时也会感到吃力。它们可以在单张照片中识别出一只猫,但往往无法追踪这只猫一小时前去了哪里。问题不在于模型缺乏视觉能力,而在于它们缺乏一种策略,即在时间紧迫且内存已满时,知道该看什么。

一组研究人员决定测试一种不同的方法。他们并没有尝试构建一个更大的大脑,而是探讨了机器人访问记忆的方式是否比大脑本身的大小更为重要。他们提出,一个成功的智能体需要两个协同工作的不同工具:一个关于发生过什么的压缩摘要(就像一本随笔日记),以及一个精确、可搜索的每一刻的存档(就像一个照片库)。至关重要的是,智能体必须能够根据提出的具体问题,选择在阅读日记和搜索档案之间如何分配其预算。他们构建了一个系统来测试这一点,在现有的机器人大脑之上增加了一个新的逻辑层,用于管理这些资源,且无需任何重新训练。

研究人员在一个合成环境中测试了他们的系统,该环境旨在模拟在建筑内进行的长距离行走,其中机器人必须回答关于它在数小时前看到的物体的问题。他们将这个新系统与几种标准方法进行了对比,包括仅查看随机选择的帧的模型、试图将一切总结为简短文本的模型,以及在没有运行摘要的情况下搜索库的模型。他们在七个不同的开源模型(从小型到大型不等)上进行了这些测试,所有模型都在相同的严格限制下——即每次决策仅限 4,096 个“标记”(token,即信息单位)。

结果令人震惊,但也很有层次感。这个通过智能路由机器人注意力的新系统,表现远优于所有未根据特定问题进行条件化访问的方法。当被要求在 300 帧的流中寻找一个隐藏的特定物体(即情景检索任务)时,新系统的成功率达到了 75%–94%,而表现最好的替代方法成功率不足 20%。研究人员发现,提出正确的问题并随后获取正确的帧,是决定性的因素。事实上,给一个标准模型四倍的内存,对它的帮助竟然还不如给新系统一个聪明地使用有限内存的方法。拥有小预算的聪明系统击败了拥有巨大预算的笨拙系统。

然而,故事并未以完美的胜利告终。研究人员设计了由三个部分组成的系统:摘要、档案以及决定如何使用它们的智能路由器。当他们分别测试每个部分时,发现了一个令人惊讶的缺陷。智能路由器和档案是英雄,它们承担了主要工作。但原本应该维持事件运行计数(running count)的摘要组件,实际上却让系统变得更糟了。当他们移除摘要后,系统在复杂任务上的表现显著提升。事实上,在所有七个模型测试中,完整的系统表现甚至没有超过仅靠档案的基准线。原因在于,机器人的大脑并不擅长在数百个步骤中维持一个完美的运行计数;摘要中的微小误差会不断累积并使系统产生混乱。一个依赖离线文本索引而非实时摘要的更好性能系统,实际上击败了研究人员自己的设计。

这次失败并非是对核心理念的挫败,而是一次关键的改进。这项研究证明,在严格的时间和内存限制下,访问的结构比模型的规模或可用内存的数量更重要。机器人不需要看到一切;它需要知道确切地该看哪里。研究人员得出结论,具身智能体的未来不在于构建更大的大脑,而在于构建更聪明的信息访问方式。最有效的策略是将预算花在寻找正确的证据片段上,而不是试图同时将整个世界都装进记忆中。虽然他们针对运行摘要的具体设计失败了,但核心原则依然成立:在一个数据无穷无尽且时间有限的世界里,知道忽略什么与知道记住什么同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →