← 最新论文
💻 computer science

Latent Actions from Factorized Transition Effects under Agent Ambiguity

本文介绍了观测转换分解(Observed Transition Factorization, OTF)及其变体 OTF-LAM 和 OTF-LAM-Dino,这些方法将模糊的观测转换分解为可重用的原语,以学习鲁棒的类动作潜层表示,从而在无需监督的情况下,在复杂的、充满干扰的环境中超越基准模型。

原作者: Heejeong Nam, Chandradithya S Jonnalagadda, Harshit Aggarwal, Eric Xu, Randall Balestriero

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Heejeong Nam, Chandradithya S Jonnalagadda, Harshit Aggarwal, Eric Xu, Randall Balestriero

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文《Latent Actions from Factorized Transition Effects under Agent Ambiguity》的通俗易懂版解释,采用了日常生活的类比。

核心问题: “嘈杂的厨房”

想象一下,你正试图通过观看一位厨师的视频来学习烹饪。然而,这段视频非常混乱。当厨师正在切洋葱(这是你关注的核心动作)时,摄像机在晃动,一只狗正从地板上跑过,风还在吹动窗帘。

在人工智能领域,这被称为智能体歧义(Agent Ambiguity)

  • 智能体(The Agent): 厨师(你想要控制的对象)。
  • 动作(The Action): 切洋葱。
  • 歧义(The Ambiguity): 视频同时展示了所有的变化(洋葱在动、狗在动、窗帘在晃)。

旧的 AI 模型试图通过观察整个混乱的视频来猜测“切菜”这个动作。它们经常会产生混淆,误以为狗的奔跑也是烹饪食谱的一部分,或者无法分辨出是厨师在移动还是摄像机在晃动。

解决方案:将视频拆解为“乐高积木”

作者提出了一种名为 OTF-LAM 的新方法。与其试图一次性猜出整个动作,不如将视频的变化拆解成一个个小的、可复用的碎片,就像是在整理一堆混杂在一起的乐高积木。

他们称这些碎片为观测到的转换原语(Observed Transition Primitives)

  • 与其看到“厨师在切菜”,AI 看到的是:“一小块像素向左移动”、“一个边缘向下偏移”以及“背景模糊”。
  • 这些就是乐高积木。它们是简单且可复用的运动模式,无论出现在厨师、机器人还是卡通人物身上,这些模式都适用。

它是如何工作的:两步走的过程

第一步:“积木分类器”(OTF)
首先,AI 观看成千上万个视频,学习将图像中的每一次微小变化归类到其词汇表中的特定“积木”中。

  • 类比: 想象一位图书管理员,他并不关心书的内容是什么,只关心书页是如何翻动的。他将每一次翻页都归入一个类别:“快速翻动”、“缓慢滑动”或“撕裂”。
  • AI 学习到,“快速翻动”看起来既像人类手部翻书,也像机器人手臂转动旋钮。这使得这些“积木”具有可复用性

第二步:“厨师助手”(OTF-LAM)
一旦积木被分类好,AI 就需要弄清楚哪些积木是由厨师(智能体)引起的,哪些是由狗或风引起的。

  • 类比: AI 查看当前的场景(厨房),并问道:“既然厨师手里拿着刀,那么这些‘运动着的积木’中,哪些很可能是由厨师造成的?”
  • 它挑选出相关的积木,忽略噪声(狗),并将它们组合成一个单一的“动作信号(Action Signal)”。这个信号告诉 AI:“厨师正在切菜。”

“冻结的 DINO”技巧(OTF-LAM-Dino)

论文还介绍了一个更聪明的版本,叫做 OTF-LAM-Dino

  • 类比: 想象你在预测一段视频的下一帧。通常,AI 会尝试重绘每一个像素(洋葱的颜色、桌子的纹理)。这很难,因为光照可能会变,或者桌子看起来会有所不同。
  • 技巧: 这个版本不再尝试重绘像素,而是使用一个已经理解物体“形状”和“结构”的“冻结”专家(DINOv2)。AI 只需要预测结构如何变化,而不是精确的颜色。
  • 这就像是通过观察棋盘上的位置(结构)来预测下一步棋,而不是试图重新画出那些木质棋子的样子(像素)。这让 AI 能够更好地忽略干扰。

他们证明了什么?

作者在两个主要方面测试了该方法:

  1. Moving MNIST(“数字”测试): 他们向 AI 展示了数字移动的视频。他们在 0–4 的数字上进行训练,然后在它从未见过的 5–9 数字上进行测试。

    • 结果: 因为 AI 学习的是运动模式(积木)而非具体的数字外观,所以它在处理新数字时表现完美。这证明了“积木”是可复用的。
  2. DCS(“机器人”测试): 他们使用了一个复杂的机器人模拟环境,其中机器人在背景移动时需要跑步或行走。

    • 结果: 新方法(OTF-LAM)比旧方法能更好地学习如何控制机器人。它成功地忽略了干扰性的背景,专注于机器人的运动。

总结

这篇论文的核心观点是:“不要试图从混乱的视频中猜测整个动作。相反,要将视频的变化拆解成小的、可复用的‘运动积木’。先对这些积木进行分类,然后再找出哪些属于你想要控制的智能体。”

通过这种方式,AI 在存在大量干扰的复杂现实世界环境中,能够更好地学习如何行动。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →