1. 研究背景与问题 (Problem)
核心痛点:
现代大型语言模型(LLM)通常经过强化学习(RL)微调,其训练目标往往是优化单一最佳答案(Single Best Answer)。这种训练范式导致模型在推理时倾向于“模式坍缩”(Mode Collapse),即过度集中在概率最高的单一答案上,而忽略了其他同样合理但概率稍低的答案。
现实挑战:
许多实际应用场景(如医疗诊断、模糊问答、代码生成、信息不完整场景)本质上具有多解性或不可约的不确定性(Irreducible Uncertainty)。
- 医疗诊断: 患者症状可能对应多种疾病(如结核病、肺炎、支气管炎),医生需要列出鉴别诊断列表而非单一结论。
- 代码生成: 解决同一问题可能有多种不同的算法实现。
- 信息缺失: 当上下文信息不足时,模型应表达多种可能性及其置信度,而非强行猜测一个答案。
现有方法的局限:
- 推理时采样(Inference-time Sampling): 如
Best-of-k 或多次独立采样。这种方法计算成本高(需要多次前向传播),且由于模型已被训练为“锁定”单一答案,多次采样往往产生重复或高度相似的冗余答案(熵坍缩)。
- 后处理校准: 现有的不确定性估计方法通常是在生成答案后单独进行,未能将“探索多种假设”这一能力内化到模型的生成过程中。
目标:
训练模型在单次前向传播中,直接生成一个包含多个候选答案及其置信度估计的分布,从而实现分布推理(Distributional Reasoning)。
2. 方法论 (Methodology)
作者提出了 多答案强化学习(Multi-Answer RL) 框架,旨在让模型在单次生成中输出结构化的答案集合 A={a1,...,aK} 及对应的置信度 Q={q1,...,qK}。
2.1 核心算法设计
该方法基于 GRPO(Group Relative Policy Optimization)算法,并针对多答案场景修改了奖励函数。
A. 多答案验证奖励 (Multi-Answer RLVR)
- 设定: 给定提示 x,真实答案是一个集合 Y∗(x)={y1∗,...,yN∗}(N≥1)。
- 输出: 模型生成 K 个不同的候选答案 A。
- 奖励函数:
RRLVRmulti(A,Y∗)=i=1∑KI[ai∈Y∗]
即:生成的答案中有多少个属于真实答案集合。
- 覆盖场景:
- N=1,K=1:退化为标准单答案 RLVR。
- N=1,K>1:等价于 Pass@K 目标。
- N>1:鼓励模型覆盖尽可能多的真实答案(部分或完全恢复)。
- 格式约束: 引入额外的格式奖励,强制生成的 K 个答案必须互不相同(Uniqueness)。
B. 多答案校准奖励 (Multi-Answer RLCR)
- 目标: 在生成答案集合的同时,输出每个答案的置信度 qi∈[0,1]。
- 奖励函数: 结合正确性奖励与校准奖励(基于 Proper Scoring Rules,如 Brier Score)。
RRLCRmulti(A,Q,Y∗)=RRLVRmulti(A,Y∗)−RBriermulti(A,Q,Y∗)
其中 Brier 损失衡量预测置信度与答案实际正确性之间的平方误差:
RBriermulti=K1i=1∑K(qi−I[ai∈Y∗])2
- 分布解释: 模型输出 (A,Q) 可被视为对可能答案的离散分布估计。在 N>1 时,置信度之和不必为 1(对应多变量伯努利分布);在 N=1 时,强制和 ≤1。
2.2 训练细节
- 基座模型: Qwen3-8B。
- 训练策略: 使用 GRPO,温度设为 0.7,Batch Size 1536。
- 格式控制: 强制模型使用特定标签(如
<answer1>, <confidence1>)输出结构化内容,确保答案唯一性。
3. 实验设置与数据集 (Experiments)
作者在三个不同性质的数据集上验证了该方法:
- DDXPlus (医疗诊断):
- 特点: 多标签任务。基于症状和病史,存在多个同时正确的诊断(N≥1)。
- 指标: 覆盖率(Coverage,即平均每个样本生成的正确诊断数)。
- HotPotQA-Modified (模糊问答):
- 特点: 单标签但信息缺失。通过移除关键上下文段落引入歧义,模型需推理出多个合理假设(N=1,K>1)。
- 指标: Pass@K。
- MBPP (代码生成):
- 特点: 低歧义但多解。同一任务有多种不同的算法实现(N>1 的变体,指多种正确实现)。
- 指标: 唯一正确代码数、Top-1 准确率。
对比基线:
- Base: 原始预训练模型。
- RLVR/RLCR Single: 标准单答案训练,推理时通过多次采样构建集合。
- Prompted Multi: 单答案模型被提示生成多个答案(无多答案训练)。
- Ours (Multi-Answer RL): 本文提出的多答案训练模型。
4. 主要结果 (Key Results)
4.1 正确性与多样性 (Correctness & Diversity)
- 覆盖率显著提升: 在 DDXPlus 和 MBPP 上,多答案 RL 模型生成的正确答案数量(Coverage)显著高于单答案基线。例如在 MBPP 上,多答案模型生成的唯一正确代码数量几乎是单答案采样方法的 1.5 倍。
- 多样性增强: 单答案模型在多次采样时往往产生重复或高度相似的答案(模式坍缩)。多答案 RL 模型在单次生成中即可输出结构多样、互不相同的答案。
- Pass@K 提升: 在 HotPotQA-Modified 上,多答案模型在 Pass@K 指标上表现更好,说明其能更好地覆盖潜在的正确解。
4.2 效率 (Efficiency)
- Token 效率: 多答案 RL 模型在单次生成中输出 K 个答案,而单答案模型需要 K 次独立生成。
- 在医疗任务中,多答案模型生成 3 个答案的 Token 消耗仅为单答案模型生成 3 次答案总消耗的 56%。
- 原因:单答案采样存在大量重复的推理链(Reasoning Scaffolding)和中间短语,而多答案模型在单次推理中共享上下文并直接探索不同分支。
4.3 校准性 (Calibration)
- 置信度更准确: 引入 RLCR 损失后,模型输出的置信度与答案的实际正确性高度一致(Brier Score 和 ECE 更低)。
- 避免过度自信: 标准 RLVR 模型往往过度自信(Overconfident),而 RLCR Multi 模型能更准确地反映不确定性(例如在信息不足时降低置信度)。
- Top-1 性能不降: 多答案训练并未牺牲模型生成“最佳答案”的能力,其 Top-1 准确率与单答案模型相当甚至更高。
4.4 扩展性
- 随着生成答案数量 K 的增加(从 2 到 5),多答案模型能稳定地恢复更多独特的正确答案,未见性能下降。
5. 核心贡献 (Key Contributions)
- 提出了 Multi-Answer RL 框架: 首次系统性地通过强化学习训练 LLM 在单次前向传播中直接生成答案分布(集合 + 置信度),而非依赖推理时的重复采样。
- 设计了分布感知的奖励函数: 将 Pass@K 目标和 Proper Scoring Rules(如 Brier Score)整合进 RL 目标,同时优化答案的覆盖率和置信度的校准性。
- 证明了计算效率与多样性的双赢: 实验表明,该方法在提高答案多样性和覆盖率的同时,显著降低了 Token 消耗(相比 Best-of-K 策略),解决了推理时扩展(Inference-time Scaling)的计算瓶颈。
- 揭示了单答案训练的局限性: 通过对比实验,证实了标准 RL 训练会导致熵坍缩,抑制了模型探索多解的能力,而多答案训练能有效缓解这一问题。
6. 意义与影响 (Significance)
- 高可靠性应用场景: 对于医疗、法律、科学推理等高风险领域,模型提供“多种可能性及其概率”比提供“单一确定性答案”更具实用价值,能辅助人类决策者进行风险评估。
- 推理范式转变: 推动 LLM 从“寻找唯一真理”向“表征不确定性分布”转变,使模型更符合人类在信息不完全时的认知模式。
- 计算成本优化: 为需要探索多个假设的任务提供了一种比
Best-of-K 更高效的替代方案,降低了部署成本。
- 未来方向: 为构建具有更好不确定性感知能力(Uncertainty-aware)和探索能力(Exploration)的下一代推理模型奠定了基础。
总结: 该论文通过引入多答案强化学习,成功让语言模型学会了“不把所有鸡蛋放在一个篮子里”,在保持高准确率的同时,显著提升了输出的多样性、校准性和计算效率,为处理现实世界中的模糊和多解问题提供了强有力的工具。