← 最新论文
💬 NLP

Cross-lingual Self-Consistency for Multilingual Reasoning with Language Models

本文提出了一种无监督强化学习方法,通过强制执行跨语言自一致性来增强大语言模型的多语言推理能力,在无需标准答案或平行数据的情况下,在多种语言和未见场景中实现了显著的性能提升。

原作者: Ahmed Elhady, Eneko Agirre, Mikel Artetxe

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahmed Elhady, Eneko Agirre, Mikel Artetxe

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位才华横溢的学生,他精通用英语解决数学问题,但一旦题目变成西班牙语、日语或斯瓦希里语,他就会感到困惑并犯错。这正是当今许多先进 AI 模型所面临的现状:它们在少数“高资源”语言(如英语)中表现出色,但在被要求用其他语言思考时却显得力不从心。

这篇论文介绍了一种巧妙的无监督训练方法,称为跨语言自一致性(Cross-lingual Self-Consistency),旨在解决这一问题。以下是其工作原理的简单类比:

问题所在:“困惑的翻译官”

目前,如果你用斯瓦希里语问 AI 一个数学问题,它可能会尝试在脑海中将其翻译成英语,解决问题,然后再将答案翻译回斯瓦希里语。但这个过程非常混乱。有时翻译质量很差,或者 AI 在过程中迷失了方向。结果呢?即使 AI 掌握了数学知识,它给出的斯瓦希里语答案却是错误的。

解决方案:“小组学习”类比

作者提出了一种新的 AI 训练方式,它不需要拥有正确答案(金标准标签)的老师,也不需要完美的翻译词典。相反,它利用了**自一致性(Self-Consistency)**的概念。

把 AI 想象成一个正在考试的学生。

  1. 旧方法(单语言): 学生用英语参加考试。如果他们连续三次得到相同的答案,他们就很有信心;如果得到的答案不同,他们就知道自己搞混了。
  2. 新方法(跨语言): 学生被给予同一个数学问题,但用 10 种不同的语言(英语、西班牙语、法语等)编写而成。
    • AI 用英语解决这个问题。
    • AI 用西班牙语解决这个问题。
    • AI 用法语解决这个问题。
    • ……以此类推。

黄金法则: 论文认为,如果数学逻辑是一样的,那么无论使用哪种语言来解决问题,最终答案必须是相同的。如果问题是“2 + 2”,那么无论在哪种语言下,答案都必须是“4”。

训练是如何运作的(“计分卡”)

研究人员利用强化学习(一种通过奖励良好行为来让 AI 学习的方法)为 AI 设计了一场游戏。

  • 设置: AI 被给出一个英语数学题。然后,它使用自身的内部知识将这个题目“自翻译”成其他语言(如西班牙语或日语)。
  • 挑战: AI 必须在原始英语以及它刚刚创建的所有新语言中解决这个问题。
  • 奖励: 只有当所有这些不同语言中的最终答案相匹配时,AI 才会获得“高分”(奖励)。
    • 如果英语答案是“4”,西班牙语答案也是“4”,AI 就会获得奖励。
    • 如果英语答案是“4”,但西班牙语答案是“5”,AI 就会受到惩罚。

通过不断重复这个过程,AI 学会了对齐其思维。它意识到:“嘿,如果我在英语中得到了正确答案,我也必须确保我在西班牙语中得到同样的正确答案。”这迫使 AI 提高其在较弱语言中的推理能力,以匹配其在英语中的优势。

结果:一个公平的竞技场

研究人员在 10 种不同语言的数学问题上测试了各种 AI 模型(从小型到大型模型)。

  • 巨大进步: 该方法在主要测试(MGSM)中将 AI 的准确率平均提高了 21.7%
  • 无需老师: 至关重要的是,这不需要任何人工提供的正确答案或预先翻译的数据。AI 通过检查其自身答案在不同语言之间是否一致,实现了自学。
  • 泛化能力: 即使在接受从未见过的语言训练时,AI 在解决这些新语言的问题方面也变得更强了。此外,该方法不仅适用于数学,也适用于不同类型的逻辑谜题。

总结

这篇论文表明,你不需要一个庞大的、由人类翻译的完美教科书库来教 AI 如何进行多语言推理。你只需要教会它一个简单的规则:“真理是不变的,无论你用什么语言说话。” 通过强制 AI 在不同语言之间保持一致,它自然而然地在所有语言中都变得更加聪明和可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →