Skill Issue: Are Skills Language-Invariant in LLMs?
本文通过使用一种多语言自我博弈框架,证明了大型语言模型在不同语言之间表现出显著且可衡量的技能不一致性,从而展示了同一个模型仅凭所使用的语言界面,即可表现出截然不同的性能强项、推理能力和策略行为。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大型语言模型是当今我们使用的许多人工智能工具背后的引擎,它们能够用几十种语言编写故事、解决问题并回答问题。多年来,研究人员一直知道这些系统在每种语言中的表现并不均衡;一个模型可能在回答英语的历史问题时表现得非常出色,但在用阿拉伯语或中文提问时却难以找到同样的知识点。这种不一致性通常被归咎于模型的训练数据,即假设某些语言可用于教导机器的信息量自然较少。然而,一种新的研究方向提出了一个更深层的问题:问题仅仅在于模型“知道”什么,还是在于模型实际“能做”什么?是否可能是同一个人工智能大脑,根据其所使用的语言不同,拥有了不同的技能组合,即便任务本身完全相同?
一个研究小组致力于通过将语言视为受控实验中的一个变量,而非研究对象,来回答这个问题。他们转向了一个熟悉的概念:游戏。通过将两个完全相同的同一人工智能模型副本放入数字竞技场进行对弈,他们创建了一个完美的技能测试。在这种设定下,游戏的规则、棋盘、卡牌和可能的移动都是固定且完全一致的。唯一改变的是描述情况时所使用的语言。一名玩家接收到的指令和看到的局面是英语,而其对手看到的则是完全相同的棋盘和规则,只是被翻译成了德语、希伯来语、中文或几种其他语言。由于模型是相同的且游戏机制是固定的,任何胜负差异必然源于语言界面本身,而非知识或智力的差异。
研究人员构建了一个名为 TextArena 的大规模测试平台,这是对已知游戏平台的多种语言扩展,允许他们在六种不同类型的游戏中运行数千场比赛。这些游戏涵盖了从简单的空间谜题(如玩家必须在网格中进行视觉化思考的井字棋)到涉及资源分配和博弈策略的复杂策略游戏。他们测试了三个规模相近的开源模型,让它们在八种不同的语言中进行自我对弈。结果揭示了一个令人震惊的现实:同一个模型在一种语言中可以是战略大师,而在另一种语言中却是笨拙的菜鸟。在某些情况下,使用英语进行游戏的模型始终能击败使用希伯来语或阿拉伯语进行游戏的自身版本,这并不是因为它掌握了更多关于游戏的知识,而是因为语言本身似乎开启或阻碍了它清晰思考的能力。
这些失败的性质具有特定性和启发性。在需要空间推理的游戏中(例如连接网格上的线条),使用阿拉伯语或希伯来语等非拉丁字母脚本语言的模型经常会出现看起来像是对棋盘产生了根本性误解的错误。它们经常无法识别出一条斜向或纵向的获胜线,处理网格的方式仿佛行(rows)才是唯一重要的维度。在涉及运气与策略的游戏中(如简化版的扑克),模型会根据语言改变其整个性格。即使手中的牌完全相同,一个模型在一种语言中可能会表现得谨慎且诚实,而在另一种语言中则会变得激进且容易进行冒险博弈。研究人员发现,这些并非随机错误,而是完全取决于界定问题的措辞而产生的系统性行为转变。
或许最令人惊讶的发现是,问题并不总是关于模型正在“阅读”的语言,而是关于它用来“思考”的语言。在一些实验中,研究人员保持游戏指令为较弱的语言(如德语),但指示模型在内部推理时使用英语。这一简单的切换让模型恢复了大部分丧失的表现,这表明语言障碍不仅是翻译问题,更是认知问题。如果允许模型在一种“更强”的语言中进行“思考”,即使是在玩一种“较弱”的语言,它也能发挥出全部的战略潜力。这表明语言界面影响着决策的各个阶段,从理解当前的局面到选择最佳的移动。
该研究还探讨了这些差异是否可以由互联网上存在的文本量来解释。虽然拥有更多可用数据的语言通常表现更好,但这并未说明问题的全貌。有些在网络上数据相对较少的语言依然能让模型表现得非常好,而另一些拥有丰富数据的语言却导致了糟糕的表现。这表明,问题不仅仅在于训练材料的数量,而在于模型如何学习在不同语言系统之间建立技能的联系。研究结果意味着,为了使人工智能真正可靠且公平,开发者不能简单地假设模型的能力在所有语言中都是一致的。模型所使用的语言不仅是其知识的一个窗口,更是一个可能扭曲其技能的透镜,改变了它观察世界以及参与游戏的方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。