← 最新论文
💬 NLP

A Systematic Comparison of Multilingual Interpretability Methods Reveals Anisotropy-Driven Failures

本文系统地评估了 21 个模型中的四种多语言可解释性方法,发现各向异性会扭曲大多数指标,而 ILO 则能独特且稳健地与跨语言迁移性能相关联,从而引导作者推荐将 ILO 作为主要的共享度量指标,并辅以各向异性诊断。

原作者: Oskar Holmström, Marcel Bollmann, Marco Kuhlmann

发布于 2026-09-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Oskar Holmström, Marcel Bollmann, Marco Kuhlmann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代理解语言的人工智能系统建立在一种数学基础之上,即将词汇和句子映射到庞大的多维空间中。在这些空间里,一个词的含义由一个特定的点来表示,而词与词之间的关系则由这些点之间的距离和方向来定义。当这些模型同时在许多不同的语言上进行训练时,它们会发展出一种卓越的能力:它们开始使用相同的内部点来表示不同语言中的相似概念,从而有效地创建了一个共享的精神词典。这种现象被称为“跨语言共享”(cross-lingual sharing),它是让一个主要在英语上训练的模型能够回答斯瓦希里语问题或翻译日语诗歌的引擎。然而,多年来,科学家们一直难以精确衡量这种共享到底有多好。不同的研究团队构建了不同的“尺子”来测量同一件事物,而这些尺子给出的答案往往相互矛盾。一个团队可能认为模型完美地共享了知识,而另一个使用不同方法的团队则可能认为它几乎没有任何共享。这种混乱使得人们很难辨别哪些模型是真正的多语言模型,而哪些只是在伪装。

一组研究人员致力于通过对比四种具有代表性的测量工具(这些工具旨在针对不同的方法论家族进行对比)来解决这一困惑,并将其应用于各种语言模型。他们收集了二十一个不同的模型,涵盖了从小型高效版本到大规模复杂版本的各种类型,代表了五种不同的人工智能家族。这些模型的参数规模从1.25亿到140亿不等,捕捉到了该领域的多样性。研究人员向这些模型输入了一组标准的十种语言句子(包括阿拉伯语、中文、英语和土耳其语),然后应用了这四种测量工具中的每一种,以观察模型在多大程度上混合了它们的语言。他们还通过测试模型的现实世界表现来进行验证:即教给模型一项新任务(使用英语),然后观察它在无需进一步训练的情况下,将该知识应用到其他语言中的效果。这种功能性测试作为一个验证标准,旨在观察这些测量结果是否能预测模型的知识迁移能力,尽管作者指出,迁移是由除表征对齐之外的其他因素驱动的。

结果显示,测量工具之间的分歧并非反映了模型本身的问题,而是由于这些工具构建方式的缺陷。研究人员发现,这些模型的内部表征通常是“各向异性”(anisotropic)的,这个术语描述了一种被拉伸成狭窄、针状圆锥体而非在所有方向上均匀分布的形状。想象一下球体与细铅笔之间的区别;在铅笔形状的空间里,几乎任何两个点看起来都很接近,仅仅是因为空间太窄了。四种测量工具中有三种都被这种形状所迷惑。它们将所有点都挤在一起的现象解释为强烈的共享证据,即便这些模型实际上并没有混合语言。其中一种工具尤其依赖于一种剔除最重要的信息方向来寻找模式的方法,结果却发现语言特征被推到了被丢弃的方向中。这就像是通过移除汤里的盐来寻找某种特定的味道,最后却因为盐没了而得出结论说这汤很淡一样。

相比之下,一种被称为“语际局部重叠”(Interlingual Local Overlap)的特定测量方法被证明是唯一可靠的尺子。该工具观察模型内部空间中每个词的直接邻居,询问不同语言的词是否站在彼此身边。与其他工具不同,这种方法经受住了严格的测试。它一致地预测了哪些模型在跨语言任务中表现出色,展现出了强大的相关性,且这种相关性无论模型的大小或家族如何,都保持成立。研究人员发现,在该特定指标上得分较高的模型,能够成功地将知识从英语迁移到其他语言。其他工具要么无法区分那些共享知识的模型与不共享知识的模型,要么受到数据狭窄形状的影响,为那些实际共享能力极差的模型产生了误导性的高分。

研究结论指出,该领域一直受到那些对数据的几何畸变敏感、而非对实际语言混合程度敏感的工具的误导。研究人员建议,未来的研究应将“语际局部重叠”作为主要的共享指标,但需同时报告各向异性诊断结果。此外,他们建议,每当有人报告语言共享得分时,必须同时报告一个数据形状的诊断检查,以确保高分反映的是真实的混合,而非仅仅是一个狭窄、扭曲的空间。这项工作并不声称解决了语言模型如何学习的奥秘,但它提供了一种清晰、可靠的方式来衡量它们学到了什么。通过识别哪些工具有效以及哪些工具失效,研究人员拨开了迷雾,使科学界终于能够在公平的平台上比较模型,并理解多语言智能的本质。这些结果是对全球共享指标的一种修正而非否定:单一的全局得分仍然是量化和比较模型间共享程度的正确工具,而解释共享是如何实现的,则需要机械论的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →