How Far Can a Single Vector Carry a Language? Mechanistic Limits of Inference-Time Steering for Low-Resource Devanagari Languages
本文研究了利用大型多语言模型中的印地语表示,通过推理时转向(inference-time steering)生成低资源天那伽里字母语言(迈蒂利语、尼泊尔语和博杰普尔语)的机制极限,发现虽然单向量偏移可以诱导目标语言的遵循,但它不可避免地会导致流畅度崩溃,从而揭示了可转向性受限于线性可分性,而非模型的能力或词汇重叠。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大型语言模型是许多现代工具背后的引擎,这些工具能够以数十种人类语言进行写作、翻译和对话。这些系统通过在海量文本上进行训练,通过识别词语如何组合在一起的模式,来学习预测句子中的下一个词。尽管它们功能极其强大,但也自带一份官方支持的语言清单。如果某种语言不在该清单上,模型通常会将其视为未知语言,即使该语言与它已知的某种语言共享相同的字母表和许多词汇。研究人员长期以来一直想知道,是否可以在不从头开始重新训练模型的情况下,引导这些模型说一种不支持的语言。他们没有尝试教模型新的事实,而是尝试了一种不同的方法:在模型的内部数学逻辑中寻找一个指向缺失语言的特定“方向”。这个想法依赖于这样一个概念:模型对不同语言的理解存在于其数字大脑中不同的形状或路径中,或许一次单一的推动就能将模型的输出从一条路径转向另一条路径。
一个研究小组决定使用四种共享天加里(Devanagari)字母(一种广泛用于南亚的文字系统)的语言来测试这一想法的极限。印地语是大多数大型模型支持的主要语言,而迈蒂利语(Maithili)、尼泊尔语(Nepali)和博杰普尔语(Bhojpuri)是与其密切相关的“姐妹”语言,尽管有数百万人使用,却经常被遗漏在官方名单之外。研究人员提出了一个简单但深刻的问题:如果他们利用模型对印地语的内部理解,并试图通过一次数学上的微调将其推向其中一个不支持的姐妹语言,他们能走多远?他们并没有改变模型的权重或喂入新数据。相反,他们分析了模型处理文本时的行为,确定了代表印地语的平均“中心”,并将其与目标语言的中心进行比较。这两个中心之间的差异产生了一个向量,即模型内部空间中的一个固定方向。在生成文本的过程中,他们将这个方向添加到模型的信息流中,希望能将输出从印地语转向目标语言。
研究人员发现,模型的内部结构类似于一个沙漏。在处理开始阶段,不同语言的表示是截然不同的。随着信息向网络深处移动,这些路径合并成一个共享的、共同的核心,在那里语言变得难以分辨。快到结尾时,就在模型产生最终词汇之前,路径再次分离。令人惊讶的是,研究人员发现,他们只能在语言仍在合并的中间阶段,成功地将模型转向目标语言。一旦路径在接近输出端时再次分离,这种微调就失效了。这与直觉相悖,因为人们可能会认为,在语言差异最明显的点进行切换应该是最容易的。然而,当语言最为融合时,模型对这种微调的反应最为灵敏。
当他们应用这种转向技术时,结果是成功与失败并存。模型可以被推向使用目标语言(如尼泊尔语)正确词汇和语法标记的文本。在一次特定的测试中,模型在表达目标语言方面取得了高分,达到了人类评判员会认为其基本属于尼ло波尔语的水平。然而,这种成功付出了沉重的代价。随着模型被更强力地推向说新语言,它失去了流畅表达的能力。文本开始自我重复,循环往复地使用相同的词汇或短语,句子也变得破碎。研究人员发现,不存在一种设置能让模型同时流畅且正确地使用目标语言。这种微调可以改变语言的表面身份,使其看起来像尼泊尔语,但它无法恢复流畅说话者的自然流利度和连贯性。
为了确保这不仅仅是一个偶然现象或针对特定模型的技巧,团队将他们的结果与另一种称为“少样本提示”(few-shot prompting)的方法进行了对比,即在要求模型写作之前,先向其展示目标语言的示例。这种替代方法允许模型生成流畅、自然的语言,证明了模型实际上具备说这些语言的能力。这证实了转向方法的失败并非由于模型缺乏知识,而是由于使用单一的、直线式的推动来在复杂的语言状态之间移动所带来的局限性。研究还表明,起始语言的选择至关重要。使用印地语作为起点比使用英语效果要好得多,尽管英语是模型训练中的主导语言。这是因为印地语在语言学上更接近目标语言,共享更多的词汇和结构,从而使两者之间的路径更短、更容易导航。
研究结论指出,虽然单一的数学方向可以改变模型的输出以模仿一种新语言,但它无法完全解锁该语言的流畅度。这种技术更像是一个探测器,揭示了模型内部结构的语言身份在何处具有灵活性,而不是作为一种实用的部署工具。它表明,模型具备说这些语言的能力,但要访问这种能力,不仅仅需要一次简单的推动;它需要少样本提示所提供的上下文和示例。研究人员还指出,该方法的有效性高度依赖于起始语言与目标语言之间的亲疏关系,事实证明印地语是一个比英语更好的桥梁。最终,这项工作描绘了推理时转向(inference-time steering)的可能性边界,表明虽然我们可以将模型推向一种新语言,但如果不进行更实质性的改变或提供上下文,我们无法强迫它精通该语言。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。