想象一下,你正在教一个机器人写故事或回答问题。通常,要教它,你需要一位知道正确答案的老师(就像数学老师批改试卷一样),或者一位人类评判者,他会说:“这个答案很好,那个答案很差。”但是,聘请人类评判者成本高昂,而数学老师只能解决数学问题。
这篇论文介绍了一种无需人类老师或“正确答案库”即可训练机器人的新方法。他们将其称为跨模型熵(Cross-Model Entropy, CME)。
以下是其工作原理,使用一个简单的类比:
问题:机器人自言自语
想象你让机器人写一个故事。为了判断故事是否好,你让同一个机器人阅读它自己的故事,并回答:“我相信这个吗?”
- 风险: 如果机器人感到困惑或犯了错误,它可能会自信地告诉自己:“是的,这完全合乎逻辑!”结果它反而强化了自己的错误。这就像一个学生给自己批改作业,即使全错也给自己打了一个"A"。
解决方案:“惊讶”计量器
与其让机器人评判自己,作者引入了第二个机器人(一个“验证器”),它来自完全不同的机器人家族。
- 设置: 机器人 A(学生)写出答案。机器人 B(老师)阅读它。
- 指标: 他们不问机器人 B“这是对的吗?”,而是问:“你对这个答案感到多么惊讶?”
- 如果机器人 B 阅读答案后认为:“哦,这是一个非常正常、合乎逻辑的说法”,它并不惊讶。这获得高分。
- 如果机器人 B 阅读答案后认为:“等等,这毫无道理!这很奇怪!”它非常惊讶。这获得低分。
“跨模型”技巧
秘诀在于机器人 A 和机器人 B 是不同的模型(例如,一个由谷歌制造,另一个由 Meta 制造)。
- 因为它们不同,机器人 A 无法通过利用其自身的内部逻辑来“欺骗”机器人 B。
- 如果机器人 A 试图产生幻觉(编造内容),机器人 B 很可能会感到惊讶,因为它并不共享机器人 A 特有的错误。
- 这防止了机器人通过仅仅重复自身错误来“钻系统的空子”。
他们如何使用它
研究人员使用了一种名为GRPO(一种训练机器人的方法)的技术,并用这个“惊讶计量器”替换了通常的“奖励”。
- 机器人针对一个问题生成许多不同的答案。
- 第二个机器人阅读所有这些答案,并测量它对每个答案感到“惊讶”的程度。
- 第一个机器人学习生成那些让第二个机器人感到不那么惊讶的答案(意味着答案听起来更自然、质量更高)。
他们的发现
他们在四种不同类型的机器人(Qwen、Llama、Gemma 和 OLMo)上测试了这种方法,发现:
- 它有效: 使用这种“惊讶计量器”训练的机器人在遵循指令方面,比完全没有训练的机器人表现好得多。
- 它胜过竞争对手: 它的表现与使用昂贵的人类反馈数据训练的机器人一样好,但无需任何人类标注。
- 更好的老师带来更好的效果: “第二个机器人”(验证器)越强大,第一个机器人学习得就越好。
- 随机无效: 如果他们使用一个“随机”机器人作为老师,效果并不明显。这证明了信号来自于老师的实际智能,而不仅仅是随机噪声。
结论
这篇论文表明,你可以通过让大型语言模型尝试不让另一个独立的模型感到惊讶,从而使其变得更聪明、更有帮助。这是一种无需支付人类评判者费用或拥有正确答案数据库即可获得高质量训练的方法。
他们提到的局限性:
- 它需要同时运行两个模型,这会消耗更多的计算能力。
- 他们仅在小型模型和英文文本上进行了测试;目前尚不清楚该方法是否完美适用于巨型模型或其他语言。
- 存在一个小风险,即机器人可能只是学会完全模仿第二个机器人的声音,而不是真正具有创造力,尽管他们在测试中并未观察到这种情况。
技术摘要:基于跨模型熵的无标签强化学习
问题陈述
通过强化学习(RL)对大型语言模型(LLM)进行后训练,目前受限于对可靠奖励信号的需求。现有方法面临一种二元困境:
- 真值验证器:PPO 和 GRPO 等方法依赖于可自动验证的正确性(例如在数学或代码执行中)。这将 RL 训练限制在具有客观答案的领域,排除了开放式指令遵循。
- 人类偏好标签:RLHF 和 DPO 等方法需要昂贵的人工标注,且容易受到奖励黑客攻击。
- 无标签自指信号:最近的替代方案(例如 TTRL、Evol-RL、RENT)利用生成器自身的输出来通过多数投票或令牌熵推导奖励。然而,这些方法对于开放式任务存在结构性缺陷:如果模型系统性地错误但内部一致,自指信号会强化错误而非纠正它们。此外,多数投票需要标准答案,使其无法应用于开放式生成。
方法:跨模型熵(CME)
作者提出了跨模型熵(CME),这是一种无标签奖励信号,旨在无需真值标签或人类偏好的情况下,将强化学习扩展到开放式指令遵循。
- 核心概念:CME 不是要求生成器评估其自身的输出,而是衡量生成器的响应对于一个独立的验证器模型(πϕ)而言有多“令人惊讶”。
- 奖励定义:奖励定义为验证器模型下生成器响应的负对数似然。
ri,t=−CMEi,t=logπϕ(yaligned,i,t∣x,yaligned,i,<t)
其中 yaligned 表示与验证器令牌空间对齐的生成器令牌。
- 理论基础:最大化期望 CME 在数学上等价于最小化反向 KL 散度 DKL(πθ∥πϕ)(至多相差一个生成器熵项)。这有效地将生成器的策略蒸馏至验证器的分布。如果验证器在领域内比生成器更胜任,这将推动生成器产生更高质量的输出。
- 实现细节:
- 集成:CME 被集成到GRPO(组相对策略优化)框架中。它用令牌级连续信号取代了标准的标量奖励。
- 令牌对齐:为处理生成器和验证器分词器之间的不匹配(例如 Qwen 与 Gemma),作者采用字符级对齐程序。验证器的对数概率根据与生成器令牌的字符重叠比例进行加权,确保无论分词器粒度如何,总对数似然均得以保留。
- 训练循环:该设置对验证器而言是无训练的;验证器权重被冻结。生成器使用源自 CME 分数的组归一化优势进行更新。
主要贡献
- 新颖的奖励信号:引入 CME 作为一种连续的、无训练的、无标签的奖励,它依赖于跨模型评估而非自指信号。
- 扩展到开放式 RL:成功将无标签 RL 扩展到开放式指令遵循,这是一个自一致性和多数投票失效的领域。
- 实证验证:证明了 CME-GRPO 在四个模型系列(Qwen、Llama、Gemma、OLMo)和三种训练范式(预训练、SFT、指令微调)中提升了性能,且未使用任何偏好标注。
- 信号验证:通过显示随机初始化的验证器产生的性能显著低于真实加权的验证器,证明了该信号源于跨模型评估而非通用正则化。
实验结果
作者在 AlpacaEval 2.0 基准(805 个提示)上使用 LLM-as-Judge(GPT-5.2 和 Claude Sonnet 4.6)评估了 CME-GRPO。
- 与基线模型的性能对比:在所有模型系列的直接对比中,CME-GRPO 均优于未训练的基线模型。经平局调整后的胜率范围为 52.5% 至 71.4%。
- 与 SFT/DPO 的性能对比:在 SFT 骨干网络上,CME-GRPO 的性能与使用完整 UltraFeedback 数据集(包括偏好标注)在同一基座上训练的 DPO 模型相当,尽管 CME-GRPO 仅使用了提示词而未使用任何偏好标签。
- 验证器能力:性能随验证器能力的提升而增长。较大的验证器(Gemma-4-E4B-it)比较小的验证器产生更高的胜率。关键在于,随机初始化的验证器表现不及所有真实验证器,证实该信号并非通用正则化的伪影。
- 与自指方法的比较:CME-GRPO 始终优于 RENT(一种自指熵最小化方法),特别是在预训练骨干网络上,自指信号容易强化错误。
意义与主张
该论文主张,CME 提供了一条可行的路径,用于对 LLM 进行开放式任务的后训练,而无需付出人类偏好数据的高昂成本或自指奖励的结构性风险。通过利用独立且胜任的模型的“惊讶”程度,该方法使生成器与高质量分布对齐,而无需真值正确性。
作者指出,虽然该方法有效,但它依赖于验证器在目标领域比生成器更胜任的假设。他们还承认了局限性,包括运行验证器与生成器并行带来的计算开销、向验证器风格漂移(模式崩溃)的潜在风险,以及评估依赖于 LLM 裁判而非人类评分的事实。这项工作表明,在缺乏显式标签的情况下,对胜任模型而言“不令人惊讶”的响应是高质量的一个强有力的代理指标。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。