← 最新论文
💬 NLP

Post-training Large Language Models for Diverse High-Quality Responses

本文提出了一种基于行列式点过程(DPP)的 DQO 训练方法,通过在强化学习后训练阶段联合优化大语言模型的响应质量与语义多样性,有效解决了现有方法导致输出单一化的问题。

原作者: Yilei Chen, Souradip Chakraborty, Lorenz Wolf, Yannis Paschalidis, Aldo Pacchiano

发布于 2026-03-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Yilei Chen, Souradip Chakraborty, Lorenz Wolf, Yannis Paschalidis, Aldo Pacchiano

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 DQO (多样性质量优化) 的新方法,旨在解决大语言模型(LLM)在训练后变得“太听话”、只会说一种话的问题。

为了让你轻松理解,我们可以把大语言模型想象成一位才华横溢但有点僵化的厨师

1. 背景:厨师的困境(为什么需要这篇论文?)

  • 现状:现在的 AI 模型(厨师)经过“强化学习”训练后,确实变得更懂人类口味了(回答质量高)。但是,它们也染上了一个坏习惯:只会做一道菜
  • 问题:如果你问它“怎么煮鸡蛋”,它可能永远只给你一种最标准的做法。虽然这道菜很好吃(质量高),但如果你想要煎蛋、水煮蛋、茶叶蛋或者创意蛋卷,它就变不出花样了。
  • 后果:这种“千篇一律”让 AI 失去了创造力,也限制了它在不同场景下的适应能力。

2. 旧方法的局限:给厨师撒点“胡椒粉”

以前的方法试图在厨师端菜上桌时(推理阶段)强行增加变化,比如:

  • 随机撒料:让厨师随机加点调料(提高温度参数)。
  • 结果:这确实能让菜看起来不一样,但往往只是表面文章。比如把“煎蛋”说成“把蛋煎一下”,意思没变,只是换了个说法(词汇层面的差异)。更糟糕的是,有时候为了求新,菜反而做得难吃了(质量下降)。

3. 新方案:DQO —— 给厨师制定“全席菜单”策略

这篇论文提出的 DQO 方法,是在训练阶段(教厨师做菜时)就引入了一种全新的考核机制。

核心比喻:Determinantal Point Processes (DPP) = “餐桌空间感”

想象一下,厨师每次被问到一个问题,不能只端出一道菜,而是必须同时端出 10 道菜(比如 10 种不同的鸡蛋做法)。

  • 旧方法(只看距离):就像只要求这 10 道菜里,有两道菜离得远就行。结果厨师可能端出 5 盘煎蛋和 5 盘煮蛋,虽然煎蛋和煮蛋差别很大,但整体还是只有两类,缺乏真正的丰富性。
  • DQO 方法(看体积/行列式):DQO 引入了一个数学概念叫行列式(Determinant)
    • 想象这 10 道菜在“创意空间”里代表 10 个点。
    • DQO 不只看两点之间的距离,而是看这 10 个点围成的空间体积有多大。
    • 如果厨师端出的 10 道菜都挤在“煎蛋”和“煮蛋”这两个小角落里,它们围成的体积就很小(甚至接近于零,因为点都重叠或共线了)。
    • 如果厨师端出了煎蛋、水煮蛋、茶叶蛋、蛋炒饭、蛋挞、蒸蛋等,它们均匀地分布在“创意空间”的各个角落,围成的体积就很大

DQO 的目标就是: 奖励那些能端出围成最大体积(即多样性最高)且每道菜都好吃(质量高)的厨师。

4. DQO 是如何工作的?(简单三步走)

  1. 批量采样:每次提问,让模型一次性生成一组回答(比如 10 个)。
  2. 翻译与打分
    • 把每个回答翻译成“语义向量”(就像把菜的味道翻译成具体的坐标点)。
    • 计算这组坐标点围成的体积(这就是多样性分数)。
    • 同时,给每个回答打分(这就是质量分数)。
  3. 联合优化
    • 如果模型生成的回答既好吃(高分),又围成了一个大空间(高多样性),就给它大大的奖励。
    • 如果模型为了多样性瞎编乱造(质量差),或者为了质量只给一种标准答案(多样性差),奖励就会减少。

5. 实验结果:厨师真的变聪明了

论文在多个任务上测试了这种方法(比如写故事、做数学题、写摘要):

  • 写故事:以前模型可能只会写“王子救公主”,现在能写出“公主自己救了自己”、“王子和公主一起冒险”、“反派其实是好人”等截然不同的故事线。
  • 做数学题:以前只给一种解题步骤,现在能展示多种不同的解题思路,而且正确率并没有下降
  • 总结:DQO 成功地在“保持高质量”和“增加多样性”之间找到了完美的平衡点,就像那位厨师终于学会了既保证每道菜都美味,又能每天不重样地提供全席菜单

总结

这篇论文的核心思想就是:不要只教 AI 说“正确答案”,要教它学会“用多种不同的方式说出正确答案”。

通过一种叫DPP的数学工具,DQO 强迫 AI 在思考时“眼观六路”,确保它的回答不仅,而且丰富,避免了 AI 变成只会复读的“回声筒”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →