← 最新论文
🤖 machine learning

Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification

该论文提出了 LENS 框架,通过识别并移除提示词中的干扰令牌来净化指令,进而利用净化后的成功样本监督原始噪声环境下的策略优化,显著提升了强化学习在数学及科学推理任务中的采样效率与模型性能。

原作者: Yiju Guo, Tianyi Hu, Zexu Sun, Yankai Lin

发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiju Guo, Tianyi Hu, Zexu Sun, Yankai Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 LENS(少噪声,多声音)的新方法,旨在让大型人工智能(LLM)在解决复杂问题时变得更聪明、更高效。

为了让你轻松理解,我们可以把训练 AI 的过程想象成教一个学生做数学题

1. 核心问题:为什么学生总是做错题?

在传统的训练方法(比如论文中提到的 GRPO)中,老师(AI 模型)会尝试做很多道题(称为“采样”或"Rollout")。

  • 现状:题目太难,或者题目里有些“干扰项”(比如无关的废话、错误的引导词),导致学生做对题的概率很低。
  • 后果:老师发现大部分尝试都失败了(没有奖励),就像学生一直在做无用功。这时候,老师要么让学生疯狂刷题(增加尝试次数,但这很费钱、费时间),要么直接放弃这些难题(过滤掉难题,但这让学生学不到真本事)。
  • 论文的发现:研究人员发现,很多时候学生做错题,并不是因为题目太难,而是因为题目里混进了几个“捣乱”的词(干扰 Token)。就像一道数学题里混进了一个错别字或者一句无关的废话,把学生的思路带偏了。

2. 解决方案:LENS(少噪声,多声音)

LENS 就像一个聪明的“题目净化器” + “因材施教”的导师。它分两步走:

第一步:给题目“去噪”(净化)

  • 比喻:当学生做错题时,LENS 不会直接说“你笨”,而是拿出放大镜,仔细检查题目。它发现:“哦,原来这道题里混进了几个‘捣乱’的词(干扰 Token)。”
  • 操作:它把这些捣乱的词删掉,把题目变得干干净净。
  • 结果:用这个“净化后”的题目再让学生做一遍,学生居然做对了!这说明学生其实有能力,只是被题目里的“噪音”干扰了。

第二步:借题发挥(迁移学习)

  • 比喻:这是 LENS 最厉害的地方。它不会只让学生做“净化后”的题目,因为真实考试里题目还是会有“噪音”的。
  • 操作
    1. 老师利用“净化后题目”做对的经验(成功的样本),告诉学生:“看,去掉那些废话,你是能做出来的!”
    2. 然后,老师把这些成功的经验“转移”回原来的、有噪音的题目上。
    3. 核心逻辑:老师并不是让学生只适应干净题目,而是教学生学会“无视”那些捣乱的词。就像教一个在嘈杂菜市场里练琴的人,不是把菜市场关掉,而是教他如何屏蔽噪音,专注于琴声。

3. 为什么这很牛?(效果对比)

  • 以前的方法(GRPO)
    • 要么让学生疯狂刷题(增加尝试次数),累死累活,效率低。
    • 要么直接扔掉难题,学生永远学不会攻克难关。
  • LENS 的方法
    • 不增加刷题量,而是提高“刷题质量”。
    • 结果:在数学推理任务上,LENS 比传统方法快 1.6 倍以上(收敛速度更快),而且准确率平均提高了 3.88%
    • 通用性:不仅数学题做得好,在科学推理和一般逻辑题上也有提升,说明它真的学会了“抗干扰”,而不是死记硬背。

4. 总结:一句话看懂

如果把训练 AI 比作在满是噪音的房间里教人听音辨位

  • 旧方法:要么把房间里的噪音放大(让学生更努力听),要么把有噪音的房间全封了(只让在安静房间练)。
  • LENS 方法:先帮学生把噪音源找出来关掉,让他听清声音,然后教他如何在噪音重新出现时,依然能听清声音

LENS 的核心贡献:它证明了很多时候 AI 学不好,不是因为它笨,而是因为“题目”里混进了干扰项。只要学会识别并忽略这些干扰,AI 就能用更少的资源,学得更快、更好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →