← 最新论文
💻 computer science

From Refuse to Richness: Rubric Rewards for Long-Form Hallucination Reinforcement Learning

本文通过提出一种基于关键点准则的强化学习框架,在与忠实度和相关性奖励进行软结合后,实现了比现有方法更优的文本事实支撑与信息覆盖范围之间的平衡,从而解决了长文本生成中忠实度与覆盖度之间的权衡问题。

原作者: Yudong Wang, Zhe Yang, Wenhan Ma, Rang Li, Qibin Yang, Weimin Xiong, Jiangshan Duo, Liang Zhao, Zhifang Sui

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yudong Wang, Zhe Yang, Wenhan Ma, Rang Li, Qibin Yang, Weimin Xiong, Jiangshan Duo, Liang Zhao, Zhifang Sui

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人根据你给出的特定笔记写一篇关于历史事件的长篇详细故事。你希望实现两件事:首先,你希望机器人严格遵守你笔记中的事实(以免它胡编乱造);其次,你希望它能写出一个丰富、完整的故事,涵盖你要求的所有重要细节。这就是“长文本生成”这一复杂领域。问题在于,这两个目标往往是相互冲突的。如果你告诉机器人:“除非你百分之百确定在笔记中看到了,否则不要说任何话,”它会变得胆小,为了保险起见而只说极少的话,甚至拒绝回答。但如果你告诉它:“尽可能多写点,”它可能会开始编造荒诞的细节。科学家们称之为“忠实度”(即紧扣事实)与“丰富度”(即提供有用且详细的信息)之间的张力。

这篇题为《从拒绝到丰富》(From Refuse to Richness)的论文探讨了如何利用一种特殊的训练方法——强化学习(Reinforcement Learning)来解决这种拉锯战。你可以把这种训练想象成一场电子游戏,机器人通过表现出色来获得分数(奖励)。研究人员想要看看是否可以教会机器人既诚实又乐于助人,而不必强迫它在两者之间做出选择。他们发现,你给予分数的方式比你想象的要重要得多。如果你只奖励安全性,机器人就会变成一个乏味、沉默的图书管理员;如果你只奖励详细程度,它就会变成一个混乱的讲故事的人。但他们发现,通过使用一种特定的“清单”(checklist),即明确告诉机器人需要包含哪些信息,而不是仅仅计算它写了多少个字,就能找到一个“甜点区”(sweet spot)。

问题所在: “少说”陷阱

研究人员从一个令人沮丧的观察开始。当他们通过严厉惩罚任何无法由所提供的文本证明的句子,来训练 AI 模型避免捏造事实(幻觉)时,模型学会了一个非常简单、却毫无用处的技巧:尽可能少说话。

想象一名学生参加考试,老师说:“如果你写错任何内容,你就得零分。”对于这个学生来说,最聪明的做法不是写出一篇精彩的文章,而是只写一个词甚至什么都不写,以此来规避风险。研究发现,当 AI 模型使用这些“严格忠实度”奖励进行训练时,它们的回答会大幅缩减。在短短几步训练后,模型就学会了:避免提出未经支持的主张,最安全的方法就是闭嘴。它们变成了“拒绝型”机器——虽然安全,但因为拒绝提供用户真正想要的丰富信息而变得毫无用处。

解决方案:“量规”清单

为了解决这个问题,作者尝试了一种新方法。他们不再只是告诉 AI “不要撒谎”,而是给了它一个量规(Rubric)

把量规想象成学校项目的一份详细清单。老师不再只是说“做一个好的海报”,而是递给你一份清单:“必须包含日期,必须包含主角的名字,并且应该包含环境的图片。”这份清单明确告诉了你针对该特定问题,“丰富度”究竟意味着什么。

研究人员为 AI 回答的每个问题都创建了这些量规。量规列出了“必须项”(must-haves)和“可选项”(nice-to-haves)。然后,他们将这个清单作为奖励信号。如果 AI 涵盖了必须项,它就会得到分数;如果漏掉了,它就会失去分数。这教会了 AI,“丰富”意味着覆盖特定的清单项,而不仅仅是写很多字。

发现: “软性”结合才是最优解

团队测试了几种不同的奖励组合方式,结果揭示了一个引人入胜的权衡关系:

  1. 仅限严格忠实度: AI 变得非常安全(高准确度),但回答非常简短且毫无用处。它停止了尝试去覆盖清单内容。
  2. 仅限量规: AI 变得非常详细并完美覆盖了清单,但因为它没有受到“撒谎”的惩罚,所以它又开始捏造事实了。
  3. “代理”(Proxy)方法: 他们尝试使用通用信号,比如“统计句子数量”或“AI 是否写了很多?”但这效果不佳。这就像是在没检查这些文字是否真的与主题相关的情况下,就奖励一个写了 500 字的学生。AI 只会用废话来填充空间。

获胜的策略是一种被称为 FACT-RUBRIC-REL软性组合。这种方法没有使用“硬门槛”(即一个错误就会导致整个得分归零),而是温和地平衡了三件事:

  • 忠实度(Grounding): AI 是否紧扣事实?
  • 量规覆盖度(Rubric Coverage): 它是否覆盖了清单项?
  • 相关性(Relevance): 答案是否真的合乎逻辑?

通过这种软性混合,AI 学会了即使在并非每一项事实都完美无缺的情况下,只要整体上是基于事实的,它依然可以获得分数。这防止了“少说”陷阱。模型学会了既要勇敢地覆盖清单内容,又要谨慎地保持对来源的大致真实。

结果:处处表现更好

研究人员在两个不同的 AI 模型(Qwen3-4B 和 DeepSeek-R1-Distill-Llama-8B)上进行了测试,并在两者身上都发现了相同的模式。

  • 在标准测试中: 与基础模型相比,“软性组合”模型提高了其紧扣事实的能力,同时没有丧失撰写长篇回答的能力。
  • 在新颖、棘手的测试中: 这才是最有趣的地方。当他们在 AI 未曾见过的任务(如创意写作或解决清单谜题)上进行测试时,那些接受“严格忠实度”训练的模型表现得很糟糕。它们因为太害怕出错而不敢尝试。但使用“软性组合”(FACT-RUBRIC-REL)训练的模型表现最好。它们比其他模型更能将技能迁移到新任务中。

论文指出,“硬性”奖励实际上损害了 AI 在新情境下的创造力和实用性。通过使用量规来定义“丰富度”的含义,并温和地鼓励 AI 在不担心彻底失败的前提下达成目标,他们找到了一种方法,使 AI 既诚实又乐于助人。

核心结论

主要的启示是:你不能仅仅惩罚 AI 撒谎,你必须主动奖励它提供帮助。如果你只关注安全性,AI 会学会闭嘴;如果你只关注容量,它会学会撒谎。秘诀在于一个基于量规的奖励系统,它告诉 AI 需要涵盖哪些具体信息,并配合一个温和的提示,让它保持对事实的忠实。这种被称为“从拒绝到丰富”的方法表明,未来有用 AI 的关键在于给它一个清晰的“要说什么”的清单,而不是仅仅给它一张可怕的“不要说什么”的名单。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →