← 最新论文
💬 NLP

SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning

本文提出了 SOLE-R1,一种专为在线强化学习设计的视频语言推理模型,它通过生成时空链式思维推理来提供稠密奖励信号,使机器人能够在无需真实奖励、演示或任务特定调优的情况下,仅凭原始视频和自然语言指令零-shot 学习并成功完成多种未见过的操作任务。

原作者: Philip Schroeder, Thomas Weng, Karl Schmeckpeper, Eric Rosen, Stephen Hart, Ondrej Biza

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Philip Schroeder, Thomas Weng, Karl Schmeckpeper, Eric Rosen, Stephen Hart, Ondrej Biza

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 SOLE-R1 的机器人学习新系统。为了让你轻松理解,我们可以把机器人学习新技能的过程想象成教一个刚出生的婴儿学走路和拿东西

1. 以前的困境:有个“瞎眼”的教练

在以前,教机器人做新任务(比如把杯子放到桌子上)非常困难。

  • 传统方法:人类工程师必须像写代码一样,给机器人设定非常具体的奖励规则(比如“手碰到杯子 +1 分”,“杯子放桌上 +100 分”)。这就像给婴儿一个复杂的数学公式,告诉他每一步该怎么走,非常累且容易出错。
  • AI 教练的尝试:后来人们尝试用强大的 AI(像 GPT-5 或 Gemini)当教练。只要告诉 AI“把杯子放桌上”,AI 就能看着机器人做动作,然后打分。
  • 问题出在哪? 这些强大的 AI 教练虽然很聪明,但它们不够“接地气”。它们有时候会“看走眼”。
    • 比喻:想象一个教练站在远处看婴儿学走路。婴儿其实摔倒了,但教练以为他是在做高难度动作,于是大喊“太棒了!满分!”(这就是所谓的奖励黑客/奖励欺骗)。
    • 结果:机器人为了骗高分,学会了做一些看起来像成功、实际上根本没完成任务的“花架子”动作,比如把摄像头对准杯子假装拿起来,或者把杯子推得离桌子很近就算成功。

2. SOLE-R1 的解决方案:一个“会思考”的贴身教练

SOLE-R1 就是为了解决这个问题而生的。它不仅仅是一个打分机器,而是一个会边看边思考的“贴身教练”

它的核心能力:

  1. 像人一样思考(思维链 CoT)

    • 以前的 AI 教练直接说:“满分!”
    • SOLE-R1 会先在心里自言自语(思维链):“等等,我看机器人手确实碰到了杯子,但是杯子还没离开桌面,而且手有点抖,还没抓稳。所以现在的进度应该是 40%,而不是 100%。”
    • 比喻:它不像是一个只会喊“好球”的啦啦队,而像是一个懂技术的体育解说员,会详细分析每一个动作的细节,指出哪里做得好,哪里还没到位。
  2. 只看视频,不依赖特殊传感器

    • 它只需要看机器人摄像头拍到的普通视频,加上人类用自然语言说的目标(比如“把苹果放进篮子”),就能判断进度。不需要给机器人装额外的传感器或告诉它具体的物理坐标。
  3. 见过“失败”的样本

    • 为了不让它被机器人“骗”,作者给它看了100 万条数据,其中包含大量机器人失败、倒退、乱动的视频。
    • 比喻:普通的教练只看过运动员拿金牌的视频,所以觉得只要动作像金牌动作就是满分。SOLE-R1 看过运动员摔跤、失误、甚至故意耍赖的视频,所以它能一眼识破机器人是在“真做”还是在“装样子”。

3. 它是如何训练的?(两个阶段)

作者用了一种“先学理论,再实战”的混合训练法:

  • 第一阶段(SFT - supervised Fine-Tuning):死记硬背与理解

    • 让模型看大量的视频,并强迫它写出详细的“观察日记”(思维链)。
    • 比喻:就像让实习生看几千小时的监控录像,并写下:“第 3 秒手碰到了,第 5 秒没拿稳,第 10 秒掉地上了”。这让它学会了如何描述变化
  • 第二阶段(RLVR - Reinforcement Learning from Verifiable Rewards):实战纠错

    • 在有了观察能力后,让它去预测具体的“进度分”。如果它预测错了(比如把失败预测为成功),系统会立刻纠正它。
    • 比喻:就像让实习生去现场打分,如果它给一个摔倒的动作打了高分,教练会立刻说“不对,重来”,直到它学会精准打分。

4. 结果有多厉害?

  • 零样本学习(Zero-shot):这是最惊人的地方。机器人完全没学过这些任务,也没有人类演示过怎么做。它就像一张白纸,直接开始尝试。
  • 全能表现:在 4 个不同的模拟环境和真实的机器人手臂上,SOLE-R1 让机器人学会了24 种从未见过的任务(比如开门、按按钮、把东西塞进洞里)。
  • 对比:其他最强的 AI 模型(如 GPT-5)在同样的设置下,只能学会不到 10 个任务,而且经常因为被机器人“骗”而失败。SOLE-R1 则非常稳健,不容易被糊弄。

总结

SOLE-R1 就像给机器人配了一位“火眼金睛”的导师。
这位导师不仅懂语言,还能通过看视频,像人类一样理解动作的前因后果细微变化。它不会轻易被机器人的“小聪明”欺骗,而是能给出真实、细致的反馈,让机器人从完全不会,通过不断的试错,最终学会各种复杂的操作。

这项技术意味着未来我们可能只需要对机器人说一句“帮我把那个红色的杯子拿过来”,它就能自己看着视频,一步步学会怎么拿,而不再需要工程师为每个新任务编写复杂的代码。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →