← 最新论文
💬 NLP

CroCo: Cross-Lingual Contrastive Preference Tuning on Self-Generations

本文介绍了 CroCo,一种通过利用自生成响应和英语训练奖励模型进行跨语言对比偏好微调的方法,该方法证明在采用策略内数据的前提下,无需特定语言的偏好标注即可有效提升多语言大语言模型在多样化任务上的性能。

原作者: Mike Zhang, Ali Basirat, Desmond Elliott

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Mike Zhang, Ali Basirat, Desmond Elliott

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《CROCO:基于自生成的跨语言对比偏好微调》的通俗解释,辅以日常类比。

核心理念:无需多语种评委,训练多语种大厨

想象你有一位才华横溢的大厨(AI 模型),他会说多种语言,但需要学习如何烹饪出更符合人类口味的佳肴。通常,要教导这位大厨,你需要一位与他说同一种语言的食品评委,来品尝菜肴并评价:“这道很棒,那道很糟糕。”

问题所在:
在 AI 领域,我们拥有大量精通英语的“评委”(奖励模型),但精通丹麦语、荷兰语或意大利语的评委却寥寥无几。传统上,为了改进多语种大厨,研究人员试图将英语指令翻译成其他语言,或者为每种语言聘请专门的评委。这不仅昂贵、缓慢,还常常导致大厨忘记如何烹饪原本的菜肴(即所谓的“灾难性遗忘”问题)。

解决方案(CROCO):
这篇论文的作者提出了一种巧妙的捷径,称为CROCO。他们不需要为每种语言配备评委,而是利用一位英语评委和一种名为对比偏好微调的技术。

具体步骤如下:

1. “自生成”自助餐

与其让大厨只烹饪一道菜,不如让 AI(大厨)针对特定语言(例如丹麦语故事)烹饪64 个不同版本的同一道食谱。

2. “单一评委”评分表

这位唯一的英语评委品尝所有 64 个版本。尽管评委讲英语,他们仍能分辨出连贯、有帮助的丹麦语故事与胡言乱语、令人困惑的故事之间的区别,并为每个版本打分。

  • 关键洞察: 评委不需要确切知道丹麦语故事在绝对意义上有多好。他们只需要保持一致性。如果故事 A 得 90 分,故事 B 得 10 分,评委就知道 A 优于 B,即使这些分数并不完美。

3. “甜蜜点”配对

这是魔法所在。研究人员并不仅仅挑选“最佳”和“最差”的故事。

  • 他们挑选最佳故事(获胜者)。
  • 他们挑选一个平庸的故事,该故事明显不如获胜者,但也不是绝对最差的(具体来说,是得分低于平均分约 2 个标准差的故事)。

这就像一位体育教练。教练不会给球员看金牌得主的视频和有人被鞋带绊倒的视频,而是展示金牌得主和一位犯了些错误但仍在比赛中的球员。这种“对比”更易于球员从中学习。

4. 课程(DPO)

AI 通过比较这两个特定故事来学习:“我应该以获胜者为目标,并应避免平庸者的风格。”因为 AI 学习的是两者之间的差异(差距),所以即使评委针对该特定语言的评分系统略有“偏差”也无妨。只要排名一致,AI 就能学到正确的教训。

他们的发现

研究人员在两个不同的 AI 模型(一个小模型,一个中等规模模型)上,针对14 种不同语言(包括丹麦语、荷兰语、法语、德语、意大利语、西班牙语,甚至威尔士语和爱尔兰语等资源匮乏的语言)测试了该方法。

  • “翻译”陷阱: 当他们尝试简单地将英语训练数据翻译成其他语言并直接教导 AI(监督微调)时,AI 变得困惑,忘记了如何流利地说这些语言。这就像强迫一位法国大厨死记硬背一本翻译过的意大利食谱;他们不仅弄错了词汇,还忘记了自己原本的技能。
  • CROCO 的成功: 使用“自生成 + 单一评委”方法,AI 在几乎所有语言中都取得了进步。
    • 它在结构化任务(如数学和编程)和开放式任务(如创意写作)方面都变得更好。
    • 它对小型和大型模型都有效。
    • 它甚至对 AI 在训练期间未曾见过的语言也有效,这表明它学习了一种通用的“更好烹饪”技能,并能跨语言迁移。

“秘密配方”的要求

论文发现,只有遵循两条严格规则,该方法才有效:

  1. 必须使用自己的烹饪(策略内数据): AI 必须自己生成这 64 个故事。如果你使用另一个AI 生成的故事来教导它,该方法就会失败。这就像大厨从自己的错误中学习,而不是从别人的错误中学习。
  2. “离线”方法更佳: 你必须在开始教导 AI 之前对所有故事进行评分。如果你尝试在 AI 实时生成故事的同时教导它(在线),AI 会被评委的即时反馈搞糊涂,学习效果不佳。

总结

这篇论文证明,你不需要一支多语种专家团队来教导 AI 在多种语言上表现得更好。你只需要一位一致的英语评委,以及一种聪明的方法,让 AI 在其自身语言中区分“好”答案和“坏”答案。

通过关注答案之间的相对差异而非绝对质量,AI 能够学会更好地讲丹麦语、意大利语或威尔士语,而无需为每种语言配备专门的老师,也不会忘记如何讲英语。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →