← 最新论文
💻 computer science

Video-Based Optimal Transport for Feedback-Efficient Offline Preference-Based Reinforcement Learning

本文介绍了 VOTP,这是一个利用视频基础模型(Video Foundation Models)和最优传输(optimal transport)来从极少的人类反馈中生成高保真伪标签的半监督框架,从而为离线基于偏好的强化学习实现高效且鲁棒的奖励学习。

原作者: Tung M. Luu, Hwanhee Kim, Younghwan Lee, Chang D. Yoo

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Tung M. Luu, Hwanhee Kim, Younghwan Lee, Chang D. Yoo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人完成一项复杂的任务,比如打开抽屉或在行走时不绊倒。在机器人领域,机器人需要一个“奖励系统”来让它知道自己做得对不对。通常,人类工程师必须费力地编写代码来告诉机器人:“做得好,你的手臂向上移动了,”或者“做得不好,你掉落了物体。”这就像是在尝试为一个从未烹饪过的菜肴编写食谱;这很难,而且你可能会写错指令。

为了解决这个问题,科学家们使用了基于偏好的强化学习 (Preference-Based Reinforcement Learning, PbRL)。与其编写代码,不如给机器人看两段它执行任务的视频,然后问人类:“哪一个看起来更好?”机器人会从这些选择中学习。

问题所在:
要求人类观看视频并挑选出“更好”的一个既缓慢又昂贵。为了教好一个机器人,你可能需要进行数千次这样的比较。这就像是通过不断在孩子骑自行车每晃动一下就停下来问他们,“刚才那样好吗?”来教孩子骑车一样。这太慢了。

解决方案:VOTP
这篇论文介绍了一种名为 VOTP(基于视频的最优传输偏好)的新方法。把 VOTP 想象成一个聪明的教学助手,它能帮助你在极少的人类提问下教会机器人。

它是如何工作的,我们用一个简单的类比来说明:

1. “智能之眼”(视频基础模型)

首先,VOTP 使用了一个预训练的“智能之眼”(视频基础模型)。想象一下,这只眼睛已经观看了数百万小时的人类视频——人们跳舞、烹饪、奔跑和玩耍。因为它见过这么多,所以它理解什么是“好的动作”,即使它从未见过机器人。它可以将一段机器人运动的视频转化为一个数学上的“指纹”,捕捉动作的本质。

2. “媒人”(最优传输)

这是神奇的部分。

  • 设定: 你提供极少量的示例(例如 10 对视频),在这些示例中,人类已经说过:“视频 A 比视频 B 好。”
  • 海量数据: 你同时还拥有大量的未标记视频(数千对),这些视频还没有人对它们发表过看法。
  • 媒人工作: VOTP 使用了一个名为最优传输 (Optimal Transport) 的数学工具。想象一下,你有一堆来自 10 个人类示例的“好”指纹,和一堆来自“坏”示例的指纹。现在,你还有一大堆来自未标记视频的“未知”指纹。
  • 连接: 最优传输充当了一个超级高效的媒人。它观察一个“未知”视频,并询问:“这个视频看起来最像我那 10 个经人类认可的视频中的哪一个?”它不仅仅是猜测;它会计算出将未知视频与已知视频进行连接的最佳方式,其依据是它们指纹之间的相似程度。

3. “推理”(伪标签)

一旦媒人将一个未知视频与一个已知的“好”视频连接起来,VOTP 就会说:“如果这个未知视频看起来像人类喜欢的那个,那么这个未知视频也一定是好的!”它会自动为那些你没时间观看的数千个视频分配一个标签(即“伪标签”)。

4. 结果

现在,与其通过仅有的 10 个人类示例来教机器人,机器人可以同时从 10 个人类示例加上数千个自动标记的示例中学习。机器人学习得更快、更好,尽管你只请人类帮了极小的忙。

这篇论文的发现

作者在机器人行走(运动控制)和机器人移动物体(操控)的任务上测试了该方法。他们还在实验室里用一个真实的机器人手臂进行了测试。

  • 更少的人力工作: VOTP 仅需极少量的人类标签(有时仅需 10 个)就能达到顶尖水平。
  • 优于其他方法: 它击败了其他试图实现相同目标的算法,这些算法通常需要数百或数千个标签才能达到类似的结果。
  • 鲁棒性: 即使光照发生变化,或者背景中有干扰物(比如机器人身后正在播放电视节目),VOTP 仍然能分辨出什么是好的,什么是坏的。
  • 现实世界: 当他们尝试用真实的机器人手臂去拿起香蕉或打开抽屉时,VOTP 帮助机器人成功的频率远高于那些仅依赖少量人类标签的方法。

简而言之: VOTP 是一种教机器人的方法,通过向它们展示一些人类喜欢的例子,然后利用“智能之眼”和“数学媒人”,让它们在剩下的视频中自行领悟应该做什么。它让人们免于从事标记数千个视频这种枯燥、重复的工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →