← 最新论文
💬 NLP

Reinforced Efficient Reasoning via Semantically Diverse Exploration

本文提出了名为 ROSE 的强化学习方法,通过结合基于语义熵的分支策略与ε\varepsilon-探索机制来增强推理的多样性,并设计长度感知的优势估计器以提升效率,从而在数学推理基准上显著提升了大语言模型的表现。

原作者: Ziqi Zhao, Zhaochun Ren, Jiahong Zou, Liu Yang, Zhiwei Xu, Xuri Ge, Zhumin Chen, Xinyu Ma, Daiting Shi, Shuaiqiang Wang, Dawei Yin, Xin Xin

发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziqi Zhao, Zhaochun Ren, Jiahong Zou, Liu Yang, Zhiwei Xu, Xuri Ge, Zhumin Chen, Xinyu Ma, Daiting Shi, Shuaiqiang Wang, Dawei Yin, Xin Xin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 ROSE 的新方法,旨在让大型语言模型(LLM,比如现在的 AI 助手)变得更聪明、更会“思考”,同时还能避免“想太多”导致的效率低下。

为了让你轻松理解,我们可以把 AI 解题的过程想象成一个人在迷宫里找出口

1. 以前的做法:要么乱撞,要么死胡同

  • 普通 AI(Vanilla GRPO): 就像让一个人同时派 8 个分身去迷宫里乱跑。如果某个分身走对了,大家就一起受表扬;走错了,就一起受批评。
    • 缺点: 这种“大锅饭”式的奖励不够精细。有时候,某个分身虽然最后没走出迷宫,但中间某几步走得很对,结果因为最后错了,那几步的功劳也被抹杀了。
  • 现有的高级 AI(基于 MCTS 的方法): 就像让一个人走迷宫时,遇到岔路口就停下来,分叉出几条路继续走,形成一棵“树”。
    • 缺点: 以前的“分叉”策略太笨了。它们只看“哪里最不确定”(比如 AI 在选词时犹豫不决),就在那里分叉。
    • 比喻: 想象你在写文章,犹豫是用“可以”还是“需要”。这两个词意思差不多,AI 在这里犹豫,分叉出来的两条路其实后面说的都是同一回事。这就好比在迷宫里,明明两条路通向同一个死胡同,你却非要分头走,浪费体力,还没找到新出路。

2. ROSE 的核心魔法:让思考更多样、更精简

ROSE 为了解决上述问题,搞了两个大动作:

动作一:语义熵分叉(Semantic-Entropy Branching)—— 寻找真正的“岔路口”

  • 以前的做法: 只要 AI 犹豫(概率分布均匀),就分叉。
  • ROSE 的做法: 它不看 AI 是否犹豫,而是看犹豫的内容是否有本质区别
    • 比喻: 还是那个迷宫。以前 AI 在“向左转”还是“向右转”犹豫时,如果这两个方向其实都是死胡同,它就不分叉。ROSE 会问:“这两个选择背后的含义真的不同吗?”
    • 如果 AI 在“用数学公式解”和“用逻辑推理解”之间犹豫,这才是真正的语义分歧。ROSE 会在这里分叉,让 AI 尝试完全不同的解题思路。
    • 结果: AI 不再在死胡同里打转,而是真正去探索不同的解题路径,找到了更多“宝藏”。

动作二:ε-探索机制(ε-Exploration)—— 偶尔“推倒重来”

  • 问题: AI 有时候太固执,一旦走上某条路,就死磕到底,不肯换思路。
  • ROSE 的做法: 设定一个概率(比如 50%),让 AI 偶尔完全忘掉之前的步骤,重新从起点开始随机生成一条新路。
    • 比喻: 就像你在迷宫里走了一半,发现前面全是墙。与其在那儿死磕,不如偶尔干脆把地图撕了,重新随机选个方向出发。这防止了 AI 陷入“局部最优解”(以为眼前的路就是全世界)。

3. 效率魔法:长度感知的奖励(Length-Aware Calibration)—— 拒绝“啰嗦”

  • 问题: 现在的 AI 有个毛病叫“过度思考”(Overthinking)。明明一句话能说清,它非要绕弯子说三页纸,最后答案还是对的。这既浪费时间,又容易出错。
  • ROSE 的做法: 它给 AI 定了一个新规矩:“答案对是好事,但越简洁越好。”
    • 如果两个 AI 分身都解出了正确答案,但一个用了 10 步,另一个用了 5 步。ROSE 会给那个用 5 步的额外加分,给那个啰嗦的扣分
    • 比喻: 就像考试,两个学生都答对了最后一道大题。老师会表扬那个解题步骤清晰、干脆利落的学生,而不是那个写了满满三页草稿纸、虽然对但拖泥带水的学生。

4. 实验结果:真的好用吗?

作者在数学题(像奥数题、高考题)上测试了 ROSE,用了不同大小的模型(从 30 亿参数到 80 亿参数)。

  • 结果: ROSE 比目前最先进的方法(GRPO 的各种变种)都要强。
  • 特点: 它不仅解题更准(能解开更难的问题),而且解题更短(生成的文字更少,速度更快)。

总结

这篇论文就像给 AI 请了一位高明的教练

  1. 教它怎么找新路: 不再在没意义的地方纠结,而是去探索真正不同的解题思路(语义熵)。
  2. 教它怎么打破僵局: 偶尔推倒重来,避免钻牛角尖(ε-探索)。
  3. 教它怎么说话简洁: 鼓励用最少的步骤解决问题,拒绝废话(长度感知奖励)。

最终,AI 变得更聪明、反应更快,而且不再是个“啰嗦”的学霸了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →