← 最新论文
💬 NLP

Better, Faster: Harnessing Self-Improvement in Large Reasoning Models

本文提出了HSIR,这是一个通过“先验证后退出”的采样策略和内在多样性评分来解决数据不平衡和过度思考问题,从而显著提升推理性能与推理效率的大模型增强框架。

原作者: Qihuang Zhong, Liang Ding, Juhua Liu, Bo Du, Leszek Rutkowski, Dacheng Tao

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Qihuang Zhong, Liang Ding, Juhua Liu, Bo Du, Leszek Rutkowski, Dacheng Tao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位才华横溢的学生(即人工智能模型),他正试图学习如何解决复杂的谜题,例如医学诊断或棘手的数学问题。学习的最佳途径是练习,但让老师批改每一次练习尝试既昂贵又缓慢。因此,这位学生尝试了一种新策略:自我提升。他们生成自己的练习题,解答这些问题,并利用自己的“正确”答案来教导自己。

这篇论文指出,虽然这听起来很棒,但学生目前的自我教学方法存在两个主要缺陷,实际上会让他们随着时间的推移变得更差。作者提出了一种名为HSIR的新系统来修复这些缺陷,使学生变得“更聪明”(Better)和“更快”(Faster)。

以下是问题和解决方案的分解,使用了简单的类比:

两大问题

1. “简单模式”陷阱(数据不平衡)

  • 问题: 当学生自己练习时,他们主要生成的是自己已经能够回答的简单问题。他们很少遇到那些真正困难、棘手的问题,而这些问题实际上能帮助他们成长。这就像一名篮球运动员只练习罚球,因为罚球容易投进,却忽略了能赢得比赛的困难三分球。
  • 后果: 学生变得擅长处理简单事物,但一旦面对复杂挑战就会失败。

2. “过度解释”陷阱(过度思考)

  • 问题: 有时,学生虽然得到了正确答案,但通往答案的路径却荒谬且曲折。他们可能会重复同一个想法五次,走进死胡同,然后折返,最后才说:“哦,答案是 X。”
  • 后果: 学生学会了冗长和重复。他们在冗余步骤上浪费时间和脑力,这拖慢了他们的速度并混淆了他们的逻辑。

解决方案:HSIR(利用自我提升)

作者提出了一种两步教练法来解决这些问题:

第一步:“验证后退出”策略(修复“简单模式”陷阱)

  • 工作原理: 想象学生试图解决一个难题但失败了。通常,你会将那次尝试直接丢弃。但 HSIR 教练会看得更仔细。他们发现,在失败的尝试进行到一半时,学生实际上已经得出了正确答案,但随后感到困惑并改变了主意。
  • 神奇之处: 教练没有丢弃整个尝试,而是说:“就停在这里!你在第 5 步找到了答案。让我们切掉困惑的部分,将那个正确的时刻保存为新的课程。”
  • 结果: 学生得以从难题的“几乎正确”的尝试中学习,将失败转化为有价值的训练数据,而无需从头开始。

第二步:“内在多样性”评分(修复“过度解释”陷阱)

  • 工作原理: 教练需要一种方法来识别“过度解释者”。教练不只是计算学生用了多少单词(这并不总是公平的),而是查看学生的大脑内部(模型的内部状态)。
  • 类比: 将学生的想法想象成一个播放列表。如果播放列表只是反复播放同一首歌,那既无聊又冗余。教练使用一种特殊的“多样性计”来检查学生的想法是否多样且新颖。如果想法过于重复(多样性低),教练就将该解决方案标记为“糟糕的练习”并将其丢弃。
  • 结果: 学生被迫只从简洁、独特且高效的推理路径中学习。

成果:“更聪明、更快”

通过使用这个新系统,论文表明人工智能模型:

  1. 变得更聪明: 与旧方法相比,他们在困难任务(如医学考试)上的准确率提高了高达10.9%
  2. 变得更快: 他们停止在重复的想法上浪费时间,将给出答案所需的时间减少了高达42.4%

额外升级:H-GRPO

作者还将这些理念应用到了更高级的训练风格中,称为强化学习(AI 通过获得奖励来学习)。他们创建了一个名为H-GRPO的新版本。每当 AI 快速解决问题且不重复时,该版本都会给予 AI 一个“额外奖励”,从而进一步鼓励“更聪明和更快”的行为。

总结:
这篇论文教导我们,仅仅让 AI 模型自己练习是不够的;它们需要一个聪明的教练。这位教练(HSIR)从失败的尝试中挽救了有价值的课程,并过滤掉了那些无聊、重复的部分。其结果是,AI 学习得更快,思考得更清晰,并且在不浪费时间的情况下解决更困难的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →