Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift
该论文提出了 Token 级离策标签化(Token-Level Off-Policy Labeling, TOPL)训练范式,该范式将后训练重新定义为一种 Token 级的正确性预测任务,旨在实现摘要生成和机器翻译等忠实生成任务中强大的分布外泛化能力和可解释的模型更新。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大幻觉搜寻:教 AI 识别自身的错误
想象一下,你正在试图教一个非常聪明、反应极快的机器人如何写故事。你给它一本书,它应该写出一个摘要。但有时,这个机器人会变得有点过于“放飞自我”。它可能会说某位著名的科学家出生在不同的城市或错误的日期。我们把这些错误称为“幻觉”(hallucinations)。在人工智能(AI)领域,这是一个大问题。如果机器人开始编造事实,我们就无法信任它来帮助我们完成翻译语言或总结新闻等实际任务。
为了解决这个问题,科学家们一直在尝试不同的训练方法。一种流行的方法是“强化学习”(Reinforcement Learning),这就像玩电子游戏,机器人通过得到好答案加分、坏答案减分来学习。然而,这种方法通常既慢又复杂,因为机器人必须练习数百万次才能学会。另一种方法是“离策”(Off-Policy)学习,这就像是在看老师的答案解析,而不是亲自参加测试。这种方法更快,但当机器人遇到从未见过的题目时,仍然会感到困惑。研究人员提出的核心问题是:我们如何让这些快速、简单的方法在机器人面对新的、棘手的局面时表现得更好?
新策略:“词元侦探”
本文介绍了一种名为词元级离策标注(Token-Level Off-Policy Labeling),简称 TOPL 的新训练方法。你可以把“词元”(token)理解为一个单词或单词的一个小片段。通常,当我们训练 AI 时,我们会要求它预测句子中的“下一个词”,就像玩“填空游戏”一样。但 TOPL 完全改变了游戏规则。它不再是要求机器人写出下一个词,而是将机器人变成了一名侦探。
想象一下,你有一份由机器人写的摘要。其中有些部分是真的(比如“居里夫人出生在波兰”),而有些部分则是编造的谎言(比如“居里夫人出生在斯洛伐克”)。TOPL 训练机器人去观察摘要中的每一个词元,并询问:“这个词是真的,还是个谎言?”它为每个词元提供一个简单的“是”或“否”的标签。通过这种方式,机器人学会了识别一个事实性的词元与一个幻觉词元之间的区别,而不仅仅是尝试预测序列中的下一个词。
它是如何工作的: “转向”的魔力
研究人员使用了一种名为 LoRA(低秩自适应)的特殊工具来教授机器人这种侦探技能。你可以把 LoRA 想象成一组小的、可拆卸的辅助轮,或者是一个安装在机器人大脑上的“转向套件”。
这里是巧妙之处:研究人员发现,当机器人以这种方式学习时,其大脑会自然地分为两个部分。
- 检测器 (LoRA-A): 这部分充当雷达。它扫描机器人的隐藏思维,并判断:“这个特定的词在事实层面是否正确?”它负责将“好”词与“坏”词区分开来。
- 转向轮 (LoRA-B): 一旦检测器发现了“坏”词,它就会告诉转向轮向不同的方向推动机器人的思维。这就像有一个 GPS 在提醒:“你正朝着谎言驶去;请向左转,驶向真相。”
论文指出,TOPL 之所以如此有效,是因为它不仅是在记忆正确答案,它还在学习如何通过“转向”自己的思维,从谎言中脱离,驶向事实,即使在遇到从未见过的全新话题时也是如此。
他们的发现:优于同类方法
研究人员在涉及文档摘要的 11 个不同数据集上测试了这种新的“侦探”方法。他们将 TOPL 与其他流行的方法进行了对比,包括标准训练 (SFT)、序列级偏好优化 (DPO) 以及其他词元级方法。
- 结果: TOPL 的表现始终优于所有其他方法,尤其是在机器人被测试于新数据(分布外数据)时。它在保持摘要事实性方面最为准确。
- 惊喜之处: 研究人员还尝试了一个观察整个句子而非单个词的版本(称为 SOPL)。结果显示,这种方法的效果并不理想。这证明了“侦探”方法需要观察微小的、独立的个体(词元)才能发挥作用。只看大局是不够的;你必须逐个词元地捕捉谎言。
- 迁移能力: 他们还在机器翻译(将一种语言转换为另一种语言)上进行了测试。TOPL 在那里也表现出色,这表明这种“侦探”技能对于许多不同类型的写作任务(而不只是摘要)都是有用的。
他们排除了哪些可能
论文谨慎地指出了哪些做法是行不通的。
- 随机猜测: 如果你给机器人随机的标签(告诉它谎言是真的,真话是假的),机器人会感到困惑且表现糟糕。这表明机器人确实需要学习分辨真伪,而不仅仅是记忆某种模式。
- 仅仅靠“词元级”是不够的: 仅仅逐个观察单词本身并不是神奇之处。其他同样逐个观察单词的方法表现并不如 TOPL。TOPL 特有的训练方式——即训练机器人区分真伪的能力——才是关键所在。
- “最终”层: 研究人员发现,如果你尝试将训练轮(LoRA)安装在机器人大脑的最末端层,效果反而会变差。最好的结果来自于对“中间”层的训练。看起来,中间层才是机器人进行事实理解重活的地方,而最后几层仅仅负责输出最终的词汇。
核心结论
作者认为,TOPL 是让 AI 变得更加诚实的一种强大的新方法。通过训练模型作为一个评论家,去评判每一个词元的真实性,并利用这种判断来“转向”模型的思维,他们创造出了一个更难被欺骗的系统。虽然他们并没有彻底“解决” AI 幻觉问题,但他们的实验有力地表明,这种“词元级侦探”方法是一个重大的进步,为教导 AI 恪守事实提供了一种更简单、更有效的方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。