Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward
本文介绍了 VIGOR,一种无需验证器的强化学习方法,该方法利用源自策略模型本身的内在梯度范数奖励,在不依赖外部验证器或黄金标签的情况下,有效提升大语言模型在数学推理和代码生成方面的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教导一位非常聪明但缺乏经验的学生(即人工智能)如何解决复杂的谜题,比如数学问题或编写计算机代码。
通常,为了教导这位学生,你需要一位严格的老师(即“验证器”),由他检查每一个答案。如果答案正确,学生就会得到一颗金星;如果错误,则会得到一个红色的叉。这种方法在数学和编程领域非常有效,因为那里有明确的对错之分。
问题所在:
当你希望学生写一首诗、提供建议,或解决一个没有唯一“正确答案”的问题时,会发生什么情况?你无法为每一项任务都聘请一位严格的老师,因为你事先并不知道答案。如果没有老师,学生就不知道自己的工作做得好不好,他们可能会开始随机猜测,或者陷入停滞。
解决方案:VIGOR(“自我感觉”奖励)
这篇论文介绍了一种名为VIGOR的新方法。VIGOR 不等待外部老师来评分,而是要求学生倾听自己内心的感受,判断他们的答案感觉有多“顺畅”。
以下是其工作原理,使用一个简单的类比:
1. “陡峭的山坡”与“平坦的山谷”
想象学生的头脑是一片由山丘和山谷组成的景观。
- 糟糕的答案就像站在陡峭、多岩石的悬崖上。如果学生试图稍微调整思路,他们就会剧烈地滑落。用数学术语来说,这就是“大梯度”(巨大且不稳定的变化)。
- 好的答案就像站在平坦、宁静的山谷中。如果学生稍微调整思路,他们就会停留在原地。这就是“小梯度”(平滑且稳定的变化)。
VIGOR 的规则: 人工智能被指示偏好那些感觉像平坦山谷(小梯度)的答案,而不是陡峭悬崖。其逻辑是:“如果我的答案感觉稳定,不需要巨大的思维冲击就能讲得通,那它很可能就是一个好答案。”
2. “长度陷阱”(为什么论文需要修正)
研究人员发现了一个狡猾的伎俩。如果学生只是写一个非常长的答案,悬崖的“陡峭程度”自然会显得更小,仅仅是因为坡度被分散在很长的距离上。学生可能会试图通过撰写冗长、啰嗦的文章来“作弊”,从而获得高分,即使内容毫无意义。
修正方案( 校正):
论文在系统中加入了一把简单的数学“尺子”。它规定:“我们将测量陡峭程度,但会根据答案的长度调整分数。”这阻止了学生通过单纯增加字数来作弊。它确保了分数反映的是思维的质量,而不仅仅是文本的长度。
3. “课堂投票”(排序)
有时,不同问题之间的“稳定性感觉”差异巨大。一个问题可能感觉非常稳定,而另一个问题则感觉摇摇欲坠,这使得直接比较它们变得困难。
修正方案(排序):
VIGOR 不给原始分数,而是要求人工智能为同一个问题生成几个不同的答案,然后将它们相互进行排名。
- “这 8 个答案中,哪一个感觉最稳定?” -> 那个答案获得最高奖励。
- “哪一个感觉最不稳定?” -> 那个答案获得最低奖励。
无论具体问题的难度如何,这都能保持训练的公平性和稳定性。
尝试后的结果如何?
研究人员在流行的 AI 模型Qwen2.5上测试了这种方法。
- 数学与代码: 他们仅使用这种“自我感觉”奖励(不允许使用答案密钥)在数学问题上训练了人工智能。人工智能在数学方面取得了显著进步。
- 跨领域训练: 令人惊讶的是,当他们仅使用这种方法在数学上训练人工智能时,它在编程方面也变得更好了,尽管它在训练期间从未见过任何编程问题。
- 稳定性: 其他试图猜测“置信度”的方法往往会导致人工智能发疯,过一段时间后开始重复自己或胡言乱语。而 VIGOR 让训练保持平滑和稳定,就像一条平静的河流,而不是一场狂暴的风暴。
总结
VIGOR 是一种无需老师即可教导人工智能的方法。它告诉人工智能:“不要只是猜测;在你自己的头脑中,找到那个感觉最稳定和顺畅的答案。”通过修复几个技术漏洞(如长度作弊),他们使这种“自我检查”变得足够强大,能够将一个基础的人工智能转变为更聪明的推理者,而这一切都不需要事先知道正确答案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。