← 最新论文
💬 NLP

An Empirical Study on Preference Tuning Generalization and Diversity Under Domain Shift

本文提出了一项系统的实证研究,证明了虽然伪标签自适应策略能有效缓解由领域偏移引起的偏好微调语言模型性能退化问题,但同时也诱发了模式崩塌,从而揭示了泛化性与多样性之间存在着一种根本性的权衡。

原作者: Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代能够阅读和书写语言的计算机并非天生就知道如何变得乐于助人、安全或礼貌。它们最初只是庞大的文本库,能够预测句子中的下一个词,但缺乏对人类真实需求的理解。为了解决这个问题,研究人员教导这些机器与人类价值观保持一致。他们通过向计算机展示成对的答案——一个好的,一个坏的——并让它学习人类更倾向于哪一个。这个过程通常被称为“偏好微调”(preference tuning),是将原始语言模型转变为得力助手的标准方法。然而,一个持久的问题出现了:当这些模型针对一种特定类型的对话进行训练时,当话题或风格发生变化时,它们往往难以表现良好。一个被训练用于总结非正式网络帖子的模型,在被要求总结正式新闻文章时可能会表现得一塌糊 l涂,尽管总结这项任务本身是相同的。

谢菲尔德大学的一个研究小组致力于理解这究竟是如何发生的,以及如何解决它。他们将这个问题视为一场适应性测试。他们采用了几种不同的教学方法来教导计算机符合人类偏好,并在三个不同的挑战中进行了测试。首先,他们尝试让模型从总结非正式的网络评论转向总结正式的新闻报道。其次,他们让模型从回答工程问题转向回答烹饪问题。第三,他们测试了如果一个模型被训练为拒绝有关网络犯罪的请求,它是否也能拒绝有关肢体暴力的请求。研究人员想要观察,是用于训练的具体数学方法更重要,还是他们为新话题准备数据的方式才是决定性因素。

研究揭示了一个令人惊讶的事实:用于准备新话题的数据准备方法,比选择特定的训练算法更为重要。当研究人员仅仅在旧数据上教导模型,然后让它执行新任务时,结果往往很差。模型要么会忘记已知的知识,要么无法理解新的语境。然而,当他们使用一种称为“伪标签”(pseudo-labeling)的技术时,结果发生了戏剧性的变化。在这种方法中,一个规模更大、更聪明的计算机模型生成了关于新领域优秀答案的示例。随后,较小的模型从这些合成示例中学习。这种策略显著提升了模型的性能。例如,在新闻摘要任务中,使用这种方法的模型达到了超过 83% 的成功率,而没有这种帮助的模型甚至难以达到 40%。研究人员发现,这种提升非常强大,以至于使用五种不同的对齐算法中的任何一种都显得无关紧要;合成数据的质量才是主导因素。

然而,这种成功也带来了隐藏的代价。研究人员发现,虽然这些模型变得非常擅长给出正确的答案,但它们失去了多样性的能力。当模型从合成示例中学习时,它开始反复重复相同的模式。在新闻摘要任务中,模型开始为每一篇摘要都生成完全相同的结构,无论故事是关于食物、旅游还是体育,都会以“本文讨论了……”开头,并遵循一种僵化的模板。这种被称为“模式崩溃”(mode collapse)的现象,意味着模型变成了一台可靠但单调的机器。它可以完美地总结新闻故事,但失去了人类作家可能具备的独特声音和多样性。研究表明,通过这种方式训练的模型具有高度的一致性,但在语言表达上显得平淡,实际上是用创造力换取了可靠性。

研究人员还发现,任务的类型会影响模型在多大程度上遭受这种多样性丧失的影响。在安全任务(即目标是拒绝有害请求)中,合成训练是一个明显的胜利。模型学会了无论请求是关于网络犯罪还是肢体暴力,都能近乎完美地准确拒绝。在这里,多样性的丧失并不是问题;目标仅仅是安全和一致。然而,在问答任务中,研究人员注意到一个微妙的问题。一个接受过工程问题训练的模型有时会用工程师那种刻板、技术性的风格来回答烹饪问题。虽然标准的计算机评判员可能会认为这很有帮助,因为逻辑是合理的,但人类读者会觉得这格格不入。模型学到了事实,却忽略了新社群的文化细微差别。

最终,这项研究表明,并没有一种完美的单一方法来教导语言模型进行适应。如果目标是高可靠性,例如在安全应用或严格的摘要任务中,使用由更强大的模型生成的合成数据是最有效的方法,即使这会让输出变得重复。如果目标是保持丰富的多样化声音,例如在创意写作中,结合新旧数据的方法效果更好,尽管它可能无法达到同样的高峰性能。研究人员得出结论,策略的选择完全取决于用户更看重什么:是正确答案的确定性,还是表达的多样性。他们警告说,过度依赖合成数据可能会导致一个未来,即所有的机器生成内容听起来都一样,从而使数字世界趋于同质化。他们建议,未来的路径在于寻找一种平衡,使模型既能提供帮助,又能保持人类的多样性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →