← 最新论文
💬 NLP

FARCA: Fact-Aligned Reliability-Aware Credit Assignment for Reinforcement Learning with Factual Supervision

FARCA 是一个通过将带有事实监督的强化学习中的噪声信用分配分解为定位歧义和可靠性歧义,从而生成细粒度的、基于可靠性加权的标记级训练信号,在提升模型事实性的同时不损害其通用推理能力的策略优化框架。

原作者: Qiming Xie, Wenjie Zheng, Xiangqing Shen, Rui Xia

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Qiming Xie, Wenjie Zheng, Xiangqing Shen, Rui Xia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在快速发展的人工智能领域,大型语言模型已成为强大的推理工具,能够通过生成逐步解释来解决复杂问题。这些系统通常使用一种称为强化学习的方法进行训练,即计算机通过试错进行学习,只有在产生正确最终答案时才会获得奖励。虽然这种方法解锁了令人印象深刻的能力,但也隐藏着一个风险:模型可能会通过编织一个充满虚假事实的故事来得出正确的结论。因为训练系统只检查最终结果,它在无意中教会了模型,只要结尾是正确的,编造细节就是一种有效的策略。这种被称为“幻觉”的现象削弱了这些系统的可靠性,尤其是当它们被要求回答需要精确现实世界知识的问题时。

为了解决这个问题,研究人员开始引入一个新的监督层,用于检查推理过程中的事实,而不仅仅是最终答案。然而,一项新研究显示,仅仅添加这些事实检查是不够的。如果系统无法精确指出句子中的哪些词是真实的、哪些是虚假的,或者如果它盲目信任所使用的每一个事实检查器,那么训练实际上会变得更加嘈ей且效率低下。研究人员发现,现有方法通常将整个句子或一个推理步骤视为一个单一单元,将相同的功劳或责备分配给其中的每一个词。这造成了一种错位,即一个正确的事实和一个幻觉事实可能会共享同一个奖励信号,从而使模型感到困惑。此外,用于验证事实的工具并不完美;它们可能会被语言技巧或无关信息误导,然而目前的训练方法却将它们的判断视为绝对真理。

为了解决这些问题,来自南京理工大学和南京大学的一个研究小组开发了一个名为 FARCA 的新框架。他们的方案旨在使事实检查的粒度与模型的学习方式保持一致。FARCA 不再一次性判断整个句子,而是将模型的推理分解为微小的、独立的命题,即原子事实。对于每一个这样的微小命题,系统都会将其追溯到生成该命题的特定文本词汇。这个过程被作者称为“标记来源追踪”(token provenance),它确保模型仅针对对应于真实或错误陈述的特定词汇获得奖励或惩罚。如果一个句子包含一个正确事实和一个错误事实,系统现在可以奖励正确的部分,同时惩罚错误的部分,而不是将两者混为一谈。

研究人员还解决了事实检查器不可靠的问题。他们意识到,并非所有的事实检查信号都是同样值得信赖的。有些判断是基于清晰、可识别的证据,而另一些则可能是由模型的语言模式驱动的猜测。为了处理这个问题,FARCA 使用了一种称为“反事实证据归因”的技术。在接受一个事实检查之前,系统会问一个简单的问题:如果我们移除支持该事实的最重要证据,事实检查器会改变主意吗?如果答案是肯定的,则该判断被认为是高度可靠的。如果即使没有关键证据,事实检查器仍给出相同的答案,系统则认为该判断较弱,并降低其对训练过程的影响。这使得模型能够从强大的、有证据支持的修正中学习,同时忽略嘈杂或具有误导性的信号。

该团队在两个不同的语言模型上,使用多种需要深度知识和推理的挑战性数据集测试了这种新方法。他们将结果与几种使用事实监督的现有方法进行了比较。研究结果表明,新框架显著提高了模型坚持事实的能力,且没有牺牲其解决复杂问题的能力。在衡量模型编造内容的基准测试中,新方法表现优异,大幅减少了幻觉。例如,在一次衡量常识真实性的测试中,改进非常显著,新方法取得的分数比排名第二的系统高出几个百分点。至关重要的是,这些模型在数学推理任务上也保持甚至提升了性能,证明了让训练更专注于事实并不会降低模型的逻辑能力。

这项研究表明,训练可靠人工智能的关键在于精准与怀疑。通过精准定位事实在句子中的位置,并通过质疑每个事实检查背后的证据强度,研究人员创造了一个既准确又稳健的训练环境。他们的工作证明,通往更好人工智能的路径不仅在于检查更多的事实,还在于以一种尊重语言复杂性和验证工具局限性的方式来检查事实。这种方法为引导这些强大的系统提供了一种更清晰、更稳定的方式,确保它们在进行推理时,其基础是真理而非一系列听起来合理的谎言。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →