← 最新论文
🤖 machine learning

OnDeFog: Online Decision Transformer under Frame Dropping

本文提出了 OnDeFog,一种在线强化学习方法,该方法通过整合用于处理丢帧机制的决策 Transformer(Decision Transformer)与直接环境交互,旨在高丢帧率和低奖励数据环境下超越现有的离线及在线方法。

原作者: Daiki Yotsufuji, Kenta Nishihara, Shoma Shimizu, Kento Uchida, Shinichi Shirakawa

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Daiki Yotsufuji, Kenta Nishihara, Shoma Shimizu, Kento Uchida, Shinichi Shirakawa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人走路、开车或玩电子游戏。通常,你会给机器人提供稳定的信息流:“这是你现在的位置,这是你刚才做的动作,以及你做得有多好。”

但在现实世界中,事情总会出错。有时摄像头会闪烁,互联网会延迟,或者传感器会失效。这被称为丢帧(Frame Dropping)。这就像在你阅读说明书时,有人突然抽走了其中的几页。机器人不知道自己在哪里,也不知道刚才发生了什么,于是开始踉跄跌倒。

现有解决方案的问题

科学家们曾尝试解决这个问题,但遇到了两个主要问题:

  1. “图书馆学生”(DeFog): 一种被称为 DeFog 的方法,就像是一个只从过去庞大游戏库中学习的学生。他们通过记忆来处理缺失的页面,但前提是这些缺失的页面必须出现在库中。如果机器人遇到一个库中从未出现过的新情况,这个“学生”就会陷入僵局,因为他们从未见过这种情况。此外,收集这样一个库既昂贵又困难。
  2. “实况玩家”(ODT): 另一种被称为 ODT 的方法,就像是一个通过实况游戏进行学习的玩家。由于他们在实时探索,因此可以应对新情况。然而,如果他们在玩游戏时网络延迟(丢帧),他们就会感到困惑并表现不佳,因为他们并未针对信息缺失的情况进行过训练。

新的解决方案:OnDeFog

论文的作者创建了一种名为 OnDeFog 的新方法。把 OnDeFog 想象成一个混合型学生,它结合了两者的优点:

  • 训练阶段: 首先,他们像 DeFog 一样学习“图书馆”(离线数据)。但诀窍在于:在学习过程中,他们会假装页面丢失了。他们练习在有漏洞的说明书下进行阅读,从而学会如何根据之前的信息来推测缺失的内容。
  • 实况练习: 然后,他们像 ODT 一样去实况玩游戏(在线学习)。因为他们在学习阶段已经练习过处理“缺失页面”,所以当网络延迟发生时,他们不会惊慌。他们能够平稳地继续前进。

工作原理(比喻)

想象你在开车,但 GPS 信号有时会丢失。

  • 旧的 ODT: 你完全依赖 GPS。如果信号中断,你会停下来或原地打转,因为你不知道自己在哪里。
  • 旧的 DeFog: 你背下了所有可能的路线图。如果 GPS 掉线了,你会查看地图。但如果你走了一条地图上没有显示的捷径,你就会迷路。
  • OnDeFog: 你既背下了地图,又练习过在随机关闭 GPS 的情况下开车。所以,当信号丢失时,你会本能地依靠地标以及对过去几秒钟记忆的判断,从而在新的道路上也能安全驾驶。

实验结果显示

研究人员在三个不同的“模拟世界”(跳跃、行走和奔跑任务)中,并在不同的“信号丢失”程度(丢帧情况)下测试了这个新的机器人驾驶员。

  1. 高信号丢失: 当信号非常糟糕(丢帧严重)时,OnDeFog 是明显的赢家。它能保持良好的表现,而“实况玩家”(ODT)则表现崩溃。
  2. 糟糕的数据集: 当他们使用一个充满低奖励示例(比如一本写满错误的练习册)的“图书馆”时,OnDeFog 比“图书馆学生”(DeFog)表现得更好。这是因为 OnDeFog 会进行实况练习,从而找到比库中教导的更好的移动方式。
  3. 代价: OnDeFog 并非在所有地方都完美。如果图书馆本身已经非常优秀(充满了高奖励的示例),OnDeFog 有时很难找到比现有路径更好的路径。这就像一个学生过于忙于探索新路径,以至于忽略了原本的地图其实才是最佳路线这一事实。

核心结论

OnDeFog 是为混乱的现实世界环境训练 AI 智能体的一种更聪明的方法。通过教导 AI 在从实况经验中学习的同时,预见并处理缺失的信息,它变得比以往的方法更加鲁棒(稳健)。它不仅仅是关于记忆过去,更是关于如何在未来充满不确定性时,学会如何继续前行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →