Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
本文提出了“上下文展开多臂老虎机”,这是一种统一的神经调度框架,它将展开视为上下文多臂老虎机的臂,以自适应地选择和重用高价值历史数据,从而提升大语言模型在可验证奖励强化学习(RLVR)中的样本效率和性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在训练一位非常聪明但略显混乱的学生(一个大语言模型)来解决高难度的数学问题。你给学生一道题目,他们写下长长的思维链以得出答案。这条思维链被称为“展开(rollout)”。
在当前的 AI 训练状态下,教师(训练算法)通常将学生做出的每一次尝试都视为同等重要。如果学生尝试了 8 种不同的解题方法,教师会审视所有这 8 种尝试,即使其中 5 种是胡言乱语,2 种是碰巧猜对的猜测,只有 1 种是精彩且合乎逻辑的解法。此外,教师在一次性使用完学生的过往尝试后,会立即将其丢弃,从不回头再看。
你提供的论文《情境展开老虎机(Contextual Rollout Bandits)》提出了一种更智能的方式来管理这一训练过程。它引入了一种名为 CBS(情境老虎机调度器)的系统。以下是其工作原理,辅以简单的类比:
1. 问题:“嘈杂的课堂”
目前的训练过程就像这样一个课堂:无论作业尝试的质量如何,教师都以同样的方式给每一次尝试打分。
- 噪声:有些学生的答案属于“猜对”(答案数字正确但逻辑错误)或“冗余”(绕圈子)。这些就像“坏苹果”,会混淆教师并拖慢学习进度。
- 浪费:教师在查看一次后就将优秀的作业丢弃。如果学生在周二写出了完美的解法,教师在周三就会忽略它,尽管它仍然很有用。
2. 解决方案:“智能教练”(CBS)
作者将选择哪些作业进行研究视为一种名为“情境老虎机(Contextual Bandit)”的游戏。你可以将其想象为一位智能教练,必须决定专注于学生的哪次练习尝试。
教练并非盲目地审视每一次尝试,而是为每一次尝试使用一份10 维的“成绩单”。这份成绩单追踪诸如以下的内容:
- 学生的自信度如何?(熵)
- 这个答案在多大程度上帮助提高了分数?(优势)
- 答案有多长?
- 我们之前是否查看过这个特定的尝试?(使用次数)
基于这份成绩单,教练使用一个小型、快速的 AI(神经网络)来预测:“如果我们研究这个特定的尝试,学生会进步吗?”
3. 教练的两大超能力
超能力 A:“质量过滤器”(组内选择)
当学生为一道数学题生成 8 个答案时,教练不会审视所有 8 个。相反,它会快速扫描“成绩单”,仅挑选出前 3 或 4 个最好的答案。
- 类比:想象一场选秀节目。教练不会观看并评论每一次试唱,而是瞬间挑出前 3 名歌手,并告诉评委只关注他们。这节省了时间,并防止评委被糟糕的歌手混淆视听。
超能力 B:“时间旅行者”(全局复用)
大多数训练方法只关注最新的一批作业。CBS 则不同。它维护着一个回放缓冲区——一个巨大的数字文件柜,存放着学生过去的尝试。
- 类比:想象一位教练不仅查看当天的练习,还保留着学生上周、上月甚至去年最佳表现的精彩集锦。当学生卡住时,教练会拿出一个优秀的旧案例展示给他们:“记得你以前是如何解决这类问题的吗?”这有助于学生更快地学习,因为他们不会忘记自己最出色的时刻。
4. 结果:更快、更聪明
该论文在六个不同的数学基准测试(如 AIME 和 MATH)上测试了这位“智能教练”。
- 更好的成绩:使用 CBS 训练的模型在数学问题上 consistently 获得了更高的分数。
- 更快的学习:由于教练过滤掉了“坏苹果”并复用了“好苹果”,训练过程耗时减少了约50%。计算机无需浪费能量处理无用数据。
- 稳定性:该系统防止学生因“猜测”答案或重复同样的错误而陷入困惑,保持了学习路径的平稳。
总结
简而言之,这篇论文指出:不要以同样的方式对待所有 AI 训练数据。
与其盲目地使用每一个生成的答案并立即将其丢弃,不如使用一个智能、自适应的系统来过滤噪声并复用最佳示例。这就像将一位在餐巾纸上涂鸦就给打分的教师,升级为一位策划完美精彩集锦以教导学生如何获胜的教练。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。