From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
该论文提出了具有自验证奖励的强化学习(RLSVR)范式,该范式将开放式任务转化为可验证的代理环境——以受社交推理游戏启发的 SpyRL 方法为例——旨在使大型语言模型能够超越数学和编程等传统可验证领域,实现可扩展且无偏见的自我提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:计算机就像是才华横溢的学生,能够精准地解决数学问题或编写代码,因为那里有一个清晰的答案解析。如果他们答错了,老师能立刻发现,学生也会从中学习。这就是当今许多最聪明的 AI 模型被训练的方式:他们在那些答案显而易见且可检查的任务上进行练习。但如果老师要求写一首诗、讲一个有趣的故事或总结一篇长篇新闻报道时,情况会怎样呢?对于创意而言,并不存在唯一的标准答案。如果没有人类老师来为每一篇论文评分,计算机如何知道自己的故事写得是否“好”?这正是研究人员试图解决的大谜题:如何教会 AI 在处理开放式、创造性任务时不断进步,而不需要人类在它每次练习时都在一旁监督。
你即将阅读的这篇论文通过借鉴另一个科学分支——“自监督学习”(self-supervised learning)中的技巧来解决这个问题。你可以把这想象成一个学生,他并没有等待老师给他出测验,而是自己发明了一个小游戏来进行练习。他们可能会遮住句子中的一个词,然后尝试猜出那个词是什么。尽管这个游戏并不是最终考试,但玩这个游戏的行为本身有助于他们更好地理解语言。这篇论文的研究人员提出了这样一个问题:“我们能否让 AI 玩一个类似的逻辑游戏,从而在没有标准答案的情况下,提高其写作和推理能力?”他们提出了一种名为 RLSVR(具有自我验证奖励的强化学习)的新型 AI 训练方法。与其试图去猜测一个故事是否“好”(这很难且具有主观性),不如将任务转化为一个可以通过严格的内置规则来检查自身工作的游戏。
间谍游戏:AI 如何学会写得更好
研究人员构建了这个想法的一个特定版本,称为 SpyRL。为了理解它,请想象五位朋友围坐成一圈,正在玩“谁是卧底?”(灵感来自流行的聚会游戏《谁是卧底》)。
以下是这个游戏在 AI 世界中的运作方式:
- 设置: 这一组人会被给出一个写作提示,例如“写一个关于机器人坠入爱河的故事”。四名玩家(“平民”)会得到完整、完整的提示。一名玩家(“间谍”)得到的则是破碎、不完整的提示版本——也许有一半的词语缺失或被打乱了。
- 表现: 每个人都要根据他们看到的内容进行创作。平民拥有全部信息,因此他们可以写出精彩、详尽的故事。然而,间谍却缺少部分信息。为了避免被识破,间谍必须猜测缺失的部分是什么,并写出一个看起来符合主题的故事,尽管他们是在盲目摸索。
- 检测: 在每个人完成写作后,小组会阅读所有的故事,并投票选出谁是间谍。
- 奖励: 这是神奇之处。因为运行游戏的计算机完全知道谁是间谍(因为它分配了角色),所以它可以立即检查投票结果。
- 如果小组正确识别出了间谍,投票者会获得奖励。
- 如果间谍被投出局,间谍会受到“惩罚”(低分)。
- 如果平民被误投出局,他们也会得到较低的分数。
这创造了一个完美的自我检查循环。AI 不需要人类来评价“这个故事很无聊”。相反,游戏规则提供了反馈。如果间谍的故事太模糊或不符合主题,其他玩家就会发现并将其投出局。如果平民写的文章令人困惑或离题,他们可能会被误投出局,这会教导他们要表达得更清晰。
他们的发现
研究人员在三种非常不同的任务类型上测试了这个“间谍游戏”:
- 总结长篇报告(例如将一份 20 页的政府文件缩减为简短摘要)。
- 创意写作(根据提示编写故事)。
- 数学推理(解决复杂的数学问题)。
结果非常令人惊喜。通常,依赖于“猜测”作品好坏的方法(使用其他 AI 模型作为评委)很难取得显著进步。但 SpyRL 通过将任务转化为一个具有明确规则的游戏,成功教会了 AI 编写更好的故事和摘要。
在实验中,使用 SpyRL 训练的 AI 击败了其他先进的自我改进方法。例如,在创意写作任务中,与未经训练的同类模型相比,经过 SpyRL 训练的模型胜率约为 77.3%。在数学问题上(其答案通常是可检查的),SpyRL 仍然显著提高了分数,在某些困难基准测试中将模型的数学准确率提升了近 9%。
论文指出,这种方法之所以奏效,是因为它迫使 AI 关注其输出的质量。为了赢得游戏(或者至少不输掉),AI 必须写出连贯、有创意且逻辑严密的文章。如果它写出的内容乏味或混乱,就会被游戏中的其他玩家“抓个正着”。
为什么这很重要
核心结论是,你不需要人类教师或完美的标准答案来教会 AI 如何进行创作。通过将一个模糊的任务(如“写一个好故事”)转化为一个带有隐藏角色和明确胜负条件的结构化游戏,AI 可以实现自我提升。研究人员表明,这种方法不仅适用于数学(答案易于检查),也适用于写作和摘要(其中“正确性”通常是一种观点问题)。
他们发现,参与游戏的玩家越多(在一定限度内),训练信号就越好,这表明由一群 AI 进行辩论和投票有助于过滤掉糟糕的想法。虽然这篇论文并未声称解决了 AI 的所有问题,但它提供了一条充满希望的新路径:将人类创造力那混乱、主观的世界,转化为一个计算机可以独自玩耍、获胜并从中学习的游戏。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。