← 最新论文
🤖 machine learning

Label-Free Reinforcement Learning via Cross-Model Entropy

本文提出了一种名为跨模型熵(CME)的无标签强化学习奖励信号,该信号利用独立验证器模型对生成器输出所计算的对数似然,从而在无需依赖真实标签或人类偏好的情况下,实现开放指令遵循任务的有效后训练。

原作者: Matt Gorbett, Hossein Shirazi

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Matt Gorbett, Hossein Shirazi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人写故事或回答问题。通常,要教它,你需要一位知道正确答案的老师(就像数学老师批改试卷一样),或者一位人类评判者,他会说:“这个答案很好,那个答案很差。”但是,聘请人类评判者成本高昂,而数学老师只能解决数学问题。

这篇论文介绍了一种无需人类老师或“正确答案库”即可训练机器人的新方法。他们将其称为跨模型熵(Cross-Model Entropy, CME)

以下是其工作原理,使用一个简单的类比:

问题:机器人自言自语

想象你让机器人写一个故事。为了判断故事是否好,你让同一个机器人阅读它自己的故事,并回答:“我相信这个吗?”

  • 风险: 如果机器人感到困惑或犯了错误,它可能会自信地告诉自己:“是的,这完全合乎逻辑!”结果它反而强化了自己的错误。这就像一个学生给自己批改作业,即使全错也给自己打了一个"A"。

解决方案:“惊讶”计量器

与其让机器人评判自己,作者引入了第二个机器人(一个“验证器”),它来自完全不同的机器人家族。

  • 设置: 机器人 A(学生)写出答案。机器人 B(老师)阅读它。
  • 指标: 他们不问机器人 B“这是对的吗?”,而是问:“你对这个答案感到多么惊讶?”
    • 如果机器人 B 阅读答案后认为:“哦,这是一个非常正常、合乎逻辑的说法”,它并不惊讶。这获得高分
    • 如果机器人 B 阅读答案后认为:“等等,这毫无道理!这很奇怪!”它非常惊讶。这获得低分

“跨模型”技巧

秘诀在于机器人 A 和机器人 B 是不同的模型(例如,一个由谷歌制造,另一个由 Meta 制造)。

  • 因为它们不同,机器人 A 无法通过利用其自身的内部逻辑来“欺骗”机器人 B。
  • 如果机器人 A 试图产生幻觉(编造内容),机器人 B 很可能会感到惊讶,因为它并不共享机器人 A 特有的错误。
  • 这防止了机器人通过仅仅重复自身错误来“钻系统的空子”。

他们如何使用它

研究人员使用了一种名为GRPO(一种训练机器人的方法)的技术,并用这个“惊讶计量器”替换了通常的“奖励”。

  1. 机器人针对一个问题生成许多不同的答案。
  2. 第二个机器人阅读所有这些答案,并测量它对每个答案感到“惊讶”的程度。
  3. 第一个机器人学习生成那些让第二个机器人感到不那么惊讶的答案(意味着答案听起来更自然、质量更高)。

他们的发现

他们在四种不同类型的机器人(Qwen、Llama、Gemma 和 OLMo)上测试了这种方法,发现:

  • 它有效: 使用这种“惊讶计量器”训练的机器人在遵循指令方面,比完全没有训练的机器人表现好得多。
  • 它胜过竞争对手: 它的表现与使用昂贵的人类反馈数据训练的机器人一样好,但无需任何人类标注。
  • 更好的老师带来更好的效果: “第二个机器人”(验证器)越强大,第一个机器人学习得就越好。
  • 随机无效: 如果他们使用一个“随机”机器人作为老师,效果并不明显。这证明了信号来自于老师的实际智能,而不仅仅是随机噪声。

结论

这篇论文表明,你可以通过让大型语言模型尝试不让另一个独立的模型感到惊讶,从而使其变得更聪明、更有帮助。这是一种无需支付人类评判者费用或拥有正确答案数据库即可获得高质量训练的方法。

他们提到的局限性:

  • 它需要同时运行两个模型,这会消耗更多的计算能力。
  • 他们仅在小型模型和英文文本上进行了测试;目前尚不清楚该方法是否完美适用于巨型模型或其他语言。
  • 存在一个小风险,即机器人可能只是学会完全模仿第二个机器人的声音,而不是真正具有创造力,尽管他们在测试中并未观察到这种情况。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →