← 最新论文
💬 NLP

Hidden Language Consistency Phenomena in Reasoning LLMs

本文揭示了多语言推理模型经常表现出一种“语言一致性崩溃效应”,即随着任务难度的增加,模型会突然转向其内部的主导语言,从而导致在输出语言一致性丧失的情况下,准确率反而得以保持或提高的场景,由此证明了可靠的评估需要将任务准确性、语言一致性和难度进行综合考虑。

原作者: Muhammad Ali Shafique, Kelly Marchisio

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Muhammad Ali Shafique, Kelly Marchisio

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正处在一个教室里,老师要求一名学生解决一道棘手的数学题,但有一个非常具体的规则:“你必须大声思考过程,并且完全用西班牙语写下你的答案。”在人工智能的世界里,这些“学生”就是大语言模型(LLMs)——它们是读过互联网上几乎所有内容的超级聪明计算机程序。当我们要求它们解决难题时,它们通常会使用一种叫做“思维链”(Chain-of-Thought)的技术,这就像一个学生在给出最终答案之前,先草拟出一步步的思考过程。长期以来,科学家们只关心最终答案是否正确。他们将思考过程视为一个“黑盒”,假设只要答案是对的,学生就是在正确地进行思考。但就像人类学生在尝试用西班牙语解题时,可能会不小心开始说法语或英语一样,这些人工智能模型有时也会发生“失误”,即使我们明确要求它们不要这样做,它们也会在中途切换语言。这篇论文研究的正是在这一点:当我们要求这些 AI 学生解决越来越难的数学题时,究竟会发生什么?它们能否遵守语言承诺,还是会因为过于困惑而开始说另一种语言?

这项研究背后的研究人员决定使用名为 PolyMath 的特殊数学考试来测试这些 AI “学生”,该考试涵盖了八种不同的语言和四个难度等级,从简单的学校数学到最难的奥林匹克级别谜题。他们观察了五种不同的“推理型”模型(旨在进行深度思考的 AI)和三种“非推理型”模型(标准 AI),以观察它们如何处理这项任务。他们的发现有点像在观察一个在压力下惊慌失措的学生。他们发现,随着数学题变得越来越难,模型不仅在数学方面表现变差,而且在坚持使用指定语言方面也往往表现得更差。

研究揭示了这种语言“失误”发生的四种不同方式。有时,一个模型表现得像个明星,无论题目多么困难,都能始终保持正确的语言。另一些时候,它完全是个叛逆者,从一开始就拒绝使用要求的语言,无论如何都坚持使用它最擅长的内部语言(通常是英语)。第三类模型起步很稳,但随着题目难度增加,逐渐失去了专注力,漂移到了另一种语言。但最令人惊讶的发现是第四类:这些模型在处理简单和中等难度题目时表现完美,但一旦遇到“中等”难度水平,它们就会突然且彻底地崩溃,突然切换语言。作者称之为“语言一致性崩溃效应”。

这里有一个让事情变得非常有趣的转折:论文发现,这种语言切换并不总是对分数不利。在某些情况下,当一个模型停止尝试用要求的语言(如泰卢固语或斯瓦希里语)思考,转而切换到它的“舒适区”语言(如英语)时,它实际上答对了更多的题目,即便题目变得更难了。这就像学生不再尝试用西班牙语解题,而是切换到了英语,然后突然得到了正确答案。这意味着,如果你只看最终得分,你可能会认为 AI 变得更聪明了,但实际上,它只是放弃了遵循你的语言指令。

研究人员还测试了通过“压缩”这些模型(一个称为量化,旨在让模型在更小的设备上运行得更快的过程)会发生什么。他们发现,这种压缩是一场赌博。有时它有助于模型坚持使用正确的语言,有时则会让它更快地切换语言,而且这种情况的发生与数学答案变好或变坏无关。例如,一种被称为 GPTQ 的方法通常比另一种被称为 AutoRound 的方法能更好地帮助模型保持语言一致性,尽管 AutoRound 在保持数学答案正确性方面表现更好。

简而言之,这篇论文认为,我们不能仅仅通过 AI 是否得到了正确答案来判断它在多语言能力方面是否优秀。我们必须观察它是如何思考的,以及在思考过程中使用了什么语言。如果我们不这样做,我们可能会忽略 AI 实际上是在用另一种语言秘密解题,或者在困难面前突然完全放弃了你的语言要求。这项研究表明,为了让 AI 在多语言世界中真正可靠,我们不仅需要衡量最终的分数,还需要衡量“学生”是否确实遵守了考试的语言规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →