← 最新论文
💬 NLP

Hint-Guided Diversified Policy Optimization for LLM Reasoning

本文提出了提示引导的多样化策略优化(HDPO),这是一个通过模拟人类解决问题的“提议-选择-思考”轨迹来生成多样化候选解并从中选择最可靠解的过程,从而增强大语言模型推理能力的两阶段框架。

原作者: Zhiyu Cao, Kaixin Wu, Mingjie Zhong, Peifeng Li, Xiaobo Li, Can Ye, Qiaoming Zhu

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiyu Cao, Kaixin Wu, Mingjie Zhong, Peifeng Li, Xiaobo Li, Can Ye, Qiaoming Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对论文 "Hint-Guided Diversified Policy Optimization (HDPO) for LLM Reasoning" 的中文翻译,保留了原有的语言风格、类比和结构。

大问题:“单线思维”的 AI

想象一下,你正在尝试解决一个非常棘手的数学谜题。如果你要求一个标准的语言大模型(LLM)来解决它,它通常表现得像一列单轨火车。它选定了一条路径,开始沿着轨道向前奔跑,直到撞墙或到达终点。

问题在于,如果它在最开始就选错了轨道,它很难意识到自己的错误。它会一直沿着错误的路径计算下去,直到给出一个看似自信但实际上错误的答案。这就是论文中所说的“解法同质化”(solution homogenization)——模型陷入了一种思维定式,拒绝寻找其他可能性。

目前的方法试图通过只在最终答案正确时给予模型“奖励”来修复这个问题。但这就像告诉一个学生:“只有当你拿到 100 分的最终成绩时,你才能得到一颗金星”,却没告诉他们应该如何学习,也没有鼓励他们尝试不同的学习方法。如果他们失败了,他们不知道哪里出了错,而且下次可能还是会猜同一个错误的答案。

解决方案:“提议-选择-思考”策略

论文作者提出了一种名为 HDPO(提示引导的多样化策略优化)的新型训练方法。他们教会 AI 像人类专家一样思考:提议、选择并思考。

想象一位正在侦破案件的侦探。侦探不会立即跳向一个理论,而是一个优秀的侦探会:

  1. 提议(Propose): 列出几种不同的嫌疑人或理论(例如:“也许是管家干的”、“也许是园丁干的”、“也许是一场抢劫案”)。
  2. 选择(Select): 查看证据,并挑选出最有前景的一个理论进行深入调查。
  3. 思考(Think): 深入研究那个特定的理论以破解案件。

HDPO 强制要求 AI 这样做。在开始解决数学问题之前,它必须先写下一份不同的候选策略清单(即“提示”/hints)。然后,它必须从那份清单中选出最好的一个来进行数学计算。

工作原理:两个阶段的训练

论文描述了一个教导 AI 这种新思维方式的两步过程:

第一阶段:“冷启动”(学习剧本)

首先,AI 需要学习如何写出一份想法清单并从中选择一个。研究人员使用一个超级聪明的 AI(“老师”)来生成这种“提议-选择-思考”过程的示例。

  • 过滤器(The Filter): 他们并不只是使用任何示例。他们检查两件事:
    1. 正确性: 最终答案是否与真相匹配?
    2. 可靠性: AI 是否从它的清单中选对了策略?(例如:如果清单里有一个“坏”想法和一个“好”想法,AI 是否选了那个好的?)
  • 结果: AI 在这些高质量的示例上进行训练,从而学会这种新思维模式的结构

第二阶段:强化学习(探索的“游戏”)

一旦 AI 掌握了结构,他们就让它通过玩游戏来变得更好。他们给了它两个特殊的“奖励”(分数)来鼓励良好的行为:

  1. 多样性奖励(“多样性”分数):

    • 目标: 如果 AI 的所有候选想法看起来都一样,它就会受到惩罚。
    • 类比: 想象一位厨师被要求列出 5 种烹饪鸡蛋的方法。如果厨师列出的是“煎蛋”、“煎蛋”、“煎蛋”、“煎蛋”、“煎蛋”,他会得到零分。但如果他列出的是“煎蛋”、“水煮蛋”、“炒蛋”、“荷包蛋”和“欧姆蛋”,他就会获得加分。
    • 为什么? 这迫使 AI 去探索“解法空间”的不同部分,这样它就不会陷入死循环。
  2. 可靠性奖励(“信心”分数):

    • 目标: 如果 AI 从它的清单中选择了最好的想法进行研究,它就会得到分数。
    • 技巧: 在不重新解决问题的情况下,他们如何知道哪个想法最好?他们观察 AI 的置信度(它对自己所说的话有多确定)。如果 AI 对某个特定想法非常有信心,那么它很可能是一个好的想法。
    • 奖励: 如果 AI 选择了它最有信心的那个想法,它就会得到分数。这教会了 AI 在选择路径时信任自己的“直觉”。

结果:为什么它很重要

论文在困难的数学问题(如数学竞赛题目)上测试了这种方法。

  • “命中率”测试: 他们要求 AI 在有限的尝试次数内(例如只有 1 次或 2 次尝试机会)解决问题。
  • 结果: 标准的 AI 模型(如 GRPO)在只有一次或两次尝试时表现得很糟糕,因为它们被困在了错误的路径上。然而,HDPO 即使在尝试次数很少的情况下也能持续获得正确答案。
  • 为什么? 因为 HDPO 不仅仅是在瞎猜;它观察了多条路径,选出了正确的那条,然后解决了它。它具有更强的“容错性”。

一句话总结

该论文介绍了一种训练方法,教导 AI 模型列出多种可能的解决方案,挑选出最好的一个,然后进行求解,这使得它们在解决复杂问题时比那些只会盲目猜测的模型更加聪明且可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →