← 最新论文
🤖 machine learning

FlexLAM: Resolving the Bottleneck Trade-off in Latent Action Learning

FlexLAM 通过使用通过嵌套 Dropout 训练的、具有变长且满足前缀有效性的潜在动作来取代固定容量的瓶颈,从而解决了潜在动作学习中固有的权衡问题,使单个模型能够在无需架构更改或重新训练的情况下,动态地平衡信息保留与细节表现。

原作者: Takanori Yoshimoto, Yang Hu, Naruya Kondo, Tatsuya Matsushima

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Takanori Yoshimoto, Yang Hu, Naruya Kondo, Tatsuya Matsushima

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人通过观察人们做事的视频来理解世界是如何运作的,而从未见过机器人自身的“肌肉指令”(动作)与这些视频相连。

这就是**潜在动作模型(Latent Action Models, LAMs)**所面临的挑战。它们试图将一段视频的过渡过程(即两帧画面之间发生了什么)压缩成一个微小的、秘密的代码——即“潜在动作”——以便机器人稍后可以利用这个代码来决定该做什么。

FlexLAM 这篇论文指出,目前创建这些代码的方式是破碎的,因为它使用的是一个**“一刀切”的行李箱**。

问题所在:僵硬的行李箱

想象一下,你有一个正好能装下 10 件物品的行李箱。

  • 场景 A: 你需要装一只牙刷。如果你强行把它塞进一个 10 件物品容量的行李箱,你会剩下 9 个空位。机器人会被所有的空白空间和多余的噪声搞糊涂。
  • 场景 B: 你需要为一周的旅行打包一整个衣柜。如果你强行把它塞进一个 10 件物品容量的行李箱,你就不得不扔掉一半的衣服。机器人会因此错过发生的关键细节。

在 AI 世界中,这就是瓶颈权衡(Bottleneck Trade-off)

  • 如果代码太小(行李箱太紧),你会丢失机器人判断动作所需的线索。
  • 如果代码太大(行李箱太松),机器人会被过多的信息淹没,尤其是在它没有足够示例(标签)进行学习时。

现有的模型强迫每一个视频过渡都进入同一个固定大小的行李箱,而不论那个动作是简单的(如摄像机平移)还是复杂的(如手抓取杯子)。

解决方案:神奇的可扩展行李箱 (FlexLAM)

作者创建了 FlexLAM,它用一个神奇的、可扩展的行李箱取代了僵硬的行李箱。

FlexLAM 并没有强迫 AI 在预先设定好固定大小,而是教会 AI 采用分层打包的方式:

  1. 核心层(The Core): 它总是先打包最重要、最本质的细节(即“前缀”)。
  2. 细节层(The Details): 只有当情况足够复杂、确实需要时,它才会添加额外的细节层。

这就像是俄罗斯套娃压缩文件(Zip-File)

  • 如果你只解开第一层,你会得到发生事情的大致轮廓。
  • 如果你解开更多层,你会得到更具体的细节。
  • 至关重要的是,AI 会在训练期间学习如何这样做。它学会了前几个“标记”(tokens,即代码的组成部分)对于理解动作是最重要的,而后面的标记只是额外的细节。

他们是如何测试的

研究人员通过两种主要方式测试了 FlexLAM:

1. “稀缺标签”测试(DMLab 游戏)
他们给了 AI 非常少的“正确动作”示例来学习(就像给一个学生只给 5 道练习题而不是 50 道)。

  • 结果: 僵硬的模型(Fixed-K)在标签稀缺或任务棘手时表现得一塌糊涂。它们要么忘记了动作,要么被噪声搞混了。
  • FlexLAM 的胜利: 由于 FlexLAM 学会了优先处理最重要的信息,即使在拥有相同“空间”的情况下,它的表现也优于任何僵硬的模型。这就像是一个学生学会了先学习最重要的章节,而不是试图一次性背下整本书。

2. “现实世界”测试(Ego4D)
他们在现实世界的视频上测试了 FlexLAM(例如人们在厨房里走动或机器人移动物体)。

  • 结果: 与旧的僵硬模型相比,FlexLAM 能更清晰地重建视频过渡。它可以用极少的标记显示出动作的模糊低细节版本,也可以用更多的标记显示出清晰高细节的版本,而且都是由同一个模型完成的。

核心启示

FlexLAM 证明了你不需要构建一个新的、复杂的机器人大脑来解决这个问题。你只需要改变行李箱的打包方式

通过使用一种被称为**“嵌套丢弃”(Nested Dropout)**的技术(这是一种高级说法,意指在训练期间随机隐藏行李箱的后半部分),AI 学会了前半部分必须完美,而后半部分可以稍后填充。

简而言之:

  • 旧方法: 为所有事物准备一个固定大小的盒子。对简单事物不好,对复杂事物也不好。
  • FlexLAM 方法: 一个聪明的盒子,从小开始,仅在需要时增长。它先学习“大意”,然后再学习“细节”。
  • 益处: 它在数据较少时表现更好,能更好地处理复杂场景,并且让你在实际使用时可以选择想要多少细节,而无需重新训练整个系统。

论文结论指出,这种“可变长度”的方法是一种简单的、即插即用的升级,它能让 AI 模型变得更聪明、更高效,而无需改变其架构。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →