← 最新论文
🤖 machine learning

Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models

该论文提出了一种多答案强化学习方法,通过修改训练目标使语言模型能在单次前向传播中生成多个候选答案并内化推理搜索过程,从而在无需重复采样的情况下显著提升多样性、覆盖率和校准度,成为比“最佳 k 选”等推理时扩展策略更高效且准确的替代方案。

原作者: Isha Puri, Mehul Damani, Idan Shenfeld, Marzyeh Ghassemi, Jacob Andreas, Yoon Kim

发布于 2026-03-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Isha Puri, Mehul Damani, Idan Shenfeld, Marzyeh Ghassemi, Jacob Andreas, Yoon Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种让大型语言模型(LLM)变得更聪明、更诚实的新方法,叫做**“多答案强化学习”(Multi-Answer RL)**。

为了让你轻松理解,我们可以把语言模型想象成一位**“超级医生”“侦探”**。

1. 现状:只给一个答案的“固执医生”

目前,大多数经过训练的语言模型就像一位**“固执的专家”**。

  • 传统训练方式:当你问它一个问题(比如“病人发烧咳嗽,可能是什么病?”),它被训练成必须给出一个它认为“最正确”的答案。
  • 问题所在:在现实世界中,很多情况并没有唯一的标准答案。
    • 比如医学诊断,发烧咳嗽可能是流感,也可能是肺炎,甚至可能是过敏。
    • 但在传统训练下,这位“固执医生”会忽略其他可能性,只死死咬住它认为概率最高的那个答案(比如“流感”)。
    • 这就好比医生只告诉你“你得了流感”,却完全没提“也可能是肺炎”,这在实际应用中非常危险,因为它掩盖了不确定性。

2. 旧方法的笨拙:靠“猜”来凑数

为了解决这个问题,以前的做法是:让模型重复运行多次(比如猜 10 次),然后把这 10 个答案拼在一起,看看能不能凑出所有可能的情况。

  • 比喻:这就像让那个“固执医生”连续看 10 遍同一个病人。
  • 缺点
    1. 浪费算力:每次看病都要重新走一遍思考流程,非常慢且费钱。
    2. 重复劳动:医生每次想的思路都差不多,前 9 次可能都在纠结“是不是流感”,直到第 10 次才突然想到“哦,也可能是肺炎”。大部分时间都在做无用功。

3. 新方案:一次思考,列出所有可能

这篇论文提出的新方法,是训练模型在“一次”思考过程中,直接列出所有可能的答案,并给每个答案打分(置信度)

  • 核心比喻
    想象这位医生不再是一个“固执的独断者”,而变成了一个**“谨慎的会诊小组”**。
    • 当你问问题时,他不再只说“是流感”。
    • 他会拿出一张清单:
      • 可能性 A(流感):可能性 40%
      • 可能性 B(肺炎):可能性 30%
      • 可能性 C(过敏):可能性 20%
    • 关键点:他是一次性完成这个思考过程的,而不是重复猜了 10 次。

4. 这种方法好在哪里?

A. 更全面(不再漏掉真相)

  • 比喻:就像侦探破案。旧方法可能只盯着一个嫌疑人(因为证据最像),而新方法会列出三个嫌疑人,并告诉你谁的可能性最大。这样,即使真相是那个“不太像”的嫌疑人,你也不会漏掉它。
  • 结果:在医疗诊断、编程等需要多种解法的任务中,新方法能覆盖更多正确的可能性。

B. 更诚实(知道自己在猜什么)

  • 比喻:旧方法即使不确定,也敢拍着胸脯说“我 100% 确定”。新方法会诚实地说:“我有 60% 把握是 A,30% 把握是 B,剩下的我不确定。”
  • 结果:这种“带概率的答案”让模型在高风险领域(如医疗、法律)更可靠,因为它展示了不确定性,而不是盲目自信。

C. 更高效(省时间省电费)

  • 比喻
    • 旧方法:为了找出 3 个可能的答案,让医生跑了 3 趟医院,每次都要重新检查病历、重新思考。
    • 新方法:医生只跑一趟,但在脑子里一次性构建了 3 个不同的诊断方案。
  • 结果:论文发现,新方法生成同样数量的答案,消耗的“计算资源”(Token)只有旧方法的一半甚至更少。就像一次出门办三件事,比分三次出门省多了。

5. 总结

这篇论文的核心思想是:不要强迫模型只选一个“标准答案”,而是教它像人类专家一样,在不确定时列出“可能性清单”并评估概率。

  • 以前:模型是“独裁者”,只给一个答案,错了就是全错。
  • 现在:模型是“顾问”,给出一组方案并附带风险评级,既全面又高效。

这就好比从**“只许猜中一个数字”的赌博,变成了“列出所有可能的号码并告诉你哪个最可能中奖”**的理性分析。这不仅让 AI 更聪明,也让它更懂得“知之为知之,不知为不知”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →