这篇论文介绍了一种名为 LENS(少噪声,多声音)的新方法,旨在让大型人工智能(LLM)在解决复杂问题时变得更聪明、更高效。
为了让你轻松理解,我们可以把训练 AI 的过程想象成教一个学生做数学题。
1. 核心问题:为什么学生总是做错题?
在传统的训练方法(比如论文中提到的 GRPO)中,老师(AI 模型)会尝试做很多道题(称为“采样”或"Rollout")。
- 现状:题目太难,或者题目里有些“干扰项”(比如无关的废话、错误的引导词),导致学生做对题的概率很低。
- 后果:老师发现大部分尝试都失败了(没有奖励),就像学生一直在做无用功。这时候,老师要么让学生疯狂刷题(增加尝试次数,但这很费钱、费时间),要么直接放弃这些难题(过滤掉难题,但这让学生学不到真本事)。
- 论文的发现:研究人员发现,很多时候学生做错题,并不是因为题目太难,而是因为题目里混进了几个“捣乱”的词(干扰 Token)。就像一道数学题里混进了一个错别字或者一句无关的废话,把学生的思路带偏了。
2. 解决方案:LENS(少噪声,多声音)
LENS 就像一个聪明的“题目净化器” + “因材施教”的导师。它分两步走:
第一步:给题目“去噪”(净化)
- 比喻:当学生做错题时,LENS 不会直接说“你笨”,而是拿出放大镜,仔细检查题目。它发现:“哦,原来这道题里混进了几个‘捣乱’的词(干扰 Token)。”
- 操作:它把这些捣乱的词删掉,把题目变得干干净净。
- 结果:用这个“净化后”的题目再让学生做一遍,学生居然做对了!这说明学生其实有能力,只是被题目里的“噪音”干扰了。
第二步:借题发挥(迁移学习)
- 比喻:这是 LENS 最厉害的地方。它不会只让学生做“净化后”的题目,因为真实考试里题目还是会有“噪音”的。
- 操作:
- 老师利用“净化后题目”做对的经验(成功的样本),告诉学生:“看,去掉那些废话,你是能做出来的!”
- 然后,老师把这些成功的经验“转移”回原来的、有噪音的题目上。
- 核心逻辑:老师并不是让学生只适应干净题目,而是教学生学会“无视”那些捣乱的词。就像教一个在嘈杂菜市场里练琴的人,不是把菜市场关掉,而是教他如何屏蔽噪音,专注于琴声。
3. 为什么这很牛?(效果对比)
- 以前的方法(GRPO):
- 要么让学生疯狂刷题(增加尝试次数),累死累活,效率低。
- 要么直接扔掉难题,学生永远学不会攻克难关。
- LENS 的方法:
- 不增加刷题量,而是提高“刷题质量”。
- 结果:在数学推理任务上,LENS 比传统方法快 1.6 倍以上(收敛速度更快),而且准确率平均提高了 3.88%。
- 通用性:不仅数学题做得好,在科学推理和一般逻辑题上也有提升,说明它真的学会了“抗干扰”,而不是死记硬背。
4. 总结:一句话看懂
如果把训练 AI 比作在满是噪音的房间里教人听音辨位:
- 旧方法:要么把房间里的噪音放大(让学生更努力听),要么把有噪音的房间全封了(只让在安静房间练)。
- LENS 方法:先帮学生把噪音源找出来关掉,让他听清声音,然后教他如何在噪音重新出现时,依然能听清声音。
LENS 的核心贡献:它证明了很多时候 AI 学不好,不是因为它笨,而是因为“题目”里混进了干扰项。只要学会识别并忽略这些干扰,AI 就能用更少的资源,学得更快、更好。
这是一篇关于大语言模型(LLM)推理能力强化学习的论文总结。论文提出了一种名为 LENS (Less Noise Sampling Framework) 的新框架,旨在解决基于可验证奖励的强化学习(RLVR)在复杂推理任务中探索效率低下的问题。
以下是该论文的详细技术总结:
1. 研究背景与核心问题 (Problem)
- 背景:基于可验证奖励的强化学习(RLVR,如 GRPO)显著提升了 LLM 的推理能力。然而,RLVR 高度依赖于采样出正确的推理轨迹(Rollouts)来生成有效的学习信号。
- 痛点:
- 奖励稀疏与探索低效:在复杂任务中,由于长程决策和延迟的二元反馈,正确的推理轨迹极其罕见。
- 现有方法的局限:
- 增加采样量(Scaling Exploration):虽然能增加成功样本,但计算成本极高,且未解决根本的效率问题。
- 过滤零方差提示(Prompt Filtering):直接丢弃难以处理的样本,牺牲了模型解决复杂问题的能力,限制了探索边界。
- 核心发现:作者通过细粒度的 Token 级分析发现,许多探索失败并非源于问题本身的难度,而是由提示词(Prompt)中极少量的“干扰 Token"(Interference Tokens)(通常少于 5%)引起的。这些 Token 引入了噪声,导致模型产生错误的推理路径。
2. 方法论 (Methodology)
作者提出了 LENS (Less Noise Sampling Framework),这是一个即插即用的在线选择性采样框架,包含两个关键阶段:
阶段一:干扰 Token 识别与净化 (Interference Token Identification and Purification)
- 干扰分数 (Interference Score):利用参考模型 πref 和当前策略 πθ 之间的 Token 级偏差来定义干扰分数:
SI(s,a)≜∣logπθ(a∣s)−logπref(a∣s)∣
偏差较大的 Token 被视为干扰 Token,通常由奖励过拟合或噪声信号引起。
- 净化机制:对于采样成功率低的提示词,计算所有 Token 的干扰分数,按降序排列,并移除前 k 个(例如 1%-5%)干扰 Token,生成“去噪提示词”(Denoised Prompt)。
- 效果:实验表明,仅移除少量 Token 即可使原本失败的 DeepMath 样本成功率提升超过 20%。
阶段二:校准的 Rollout 策略优化 (Calibrated Rollout Policy Optimization, CRPO)
- 核心思想:直接移除 Token 并不总是有益的(仅约 20% 的提示词在移除后表现提升)。因此,LENS 不直接丢弃原始提示词,而是利用去噪提示词生成的高质量成功轨迹来监督原始(有噪声)提示词的策略优化。
- 样本重加权 (Sample Reweighting):
- 当原始提示词采样成功率低于阈值 τ 时,若去噪提示词的成功率更高,则用去噪提示词生成的成功轨迹替换原始提示词中部分失败的轨迹。
- 引入权重因子 w~(y) 来平衡原始成功样本和替换进来的成功样本。
- 目标函数:构建一个统一的 PPO 风格目标函数,通过重要性采样比率 ρ(y;θ) 校正分布不匹配,并利用 KL 散度正则化,使模型学会在原始噪声环境下忽略干扰,进行鲁棒推理。
3. 主要贡献 (Key Contributions)
- 新视角:首次揭示了 RLVR 中许多失败是由提示词中少量的“干扰 Token"引起的,而非任务本身难度,提出了“剪枝干扰 Token"的新思路。
- LENS 框架:提出了一种两阶段框架,通过“识别净化”提取高质量信号,并通过“校准优化”将这些信号迁移回原始噪声环境,使模型学会抗干扰。
- 效率与性能的双重提升:在不增加计算预算(不增加采样数或训练轮次)的情况下,显著提升了训练效率和最终性能。
4. 实验结果 (Results)
实验在多个模型(Llama-3.2, Qwen-2.5, Qwen-3)和基准测试(MATH500, AIME, OlympiadBench, SuperGPQA 等)上进行:
- 数学推理性能:
- 相比 GRPO,LENS 在 7 个数学推理基准上平均提升了 3.88%。
- 相比 GRPO,收敛速度提升了 1.6 倍以上(即达到相同性能所需的梯度步数更少)。
- 在极具挑战性的 OlympiadBench 上,LENS 表现出更稳定的连续提升,而 GRPO 则出现波动。
- 泛化能力:
- 在科学推理(SuperGPQA, GPQA-Diamond)和通用复杂推理(BBEH, MMLU-Pro)任务上,平均提升了 1.83%,证明该方法未过拟合数学模式,而是提升了通用推理能力。
- 对比基线:
- 优于“增加采样量”的基线(如 GRPOextended),且计算成本更低。
- 优于“提示词过滤”基线(如 DAPO, GRESO),特别是在处理高难度样本时,避免了因丢弃样本导致的能力上限降低。
- 训练动态:LENS 在整个训练过程中减少了零奖励样本的比例,增加了高价值样本的比例,且策略熵和响应长度的变化更加稳定。
5. 意义与启示 (Significance)
- 重新定义 RLVR 的瓶颈:指出 RLVR 的瓶颈往往不在于模型能力不足,而在于输入提示词中的噪声干扰。
- 低成本高效率:提供了一种无需大幅增加计算资源即可显著提升 RLVR 训练效率的方法。
- 鲁棒性提升:通过让模型在训练中学会“忽略”干扰 Token,增强了模型在现实世界(通常存在噪声提示)中的推理鲁棒性。
- 未来方向:为 RLVR 研究提供了新的视角,即从“如何采样更多”转向“如何净化输入信号”,并指出了在更大规模模型和更复杂奖励场景下的应用潜力。
总结:LENS 通过识别并移除提示词中的少量干扰 Token,利用去噪后的高质量轨迹来校准原始策略,成功解决了 RLVR 中探索效率低和训练不稳定的问题,实现了性能与效率的帕累托改进。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。