← 最新の論文
🤖 AI

Left-Branching Transformers Excel at Right-Branching Languages: Data Shapes Word Order Preferences in Language Models

本論文は、デコーダーのみの言語モデルにおける語順のバイアスは、固有のアーキテクチャ上の嗜好ではなく、むしろ学習データによって駆動されるものであり、モデルはデータの豊富さと質に起因して自然言語における右分岐型のSVO構造を好む傾向にあることを示し、それゆえに世界の語順の多様性を減少させるリスクをもたらすことを論じている。

原著者: Varvara Arzt, Allan Hanbury, Terra Blevins

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Varvara Arzt, Allan Hanbury, Terra Blevins

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

言語は単なる単語の集まりではありません。それは、意味を成すためにそれらの単語をどのように配置するかという一連の規則です。ある言語では、主語の後に目的語と動詞が続くことがあります(例:「猫が魚を食べた」)。また別の言語では、動詞が最初に来たり、主語の前に目的語が来たりします。この配列は「語順」として知られ、人間の言語がどのように異なるかを示す最も根本的な方法の一つです。数十年にわたり、言語学者はこれらのパターンを研究し、人間の脳がいかに言語を学習し処理しているかを理解しようと努め、あらゆる場所のすべての人々に適用できる普遍的な規則を探してきました。今日、この分野に新しい種類の学習者が登場しました。人工知能です。言語モデルと呼ばれるこれらのコンピュータプログラムは、膨大な量のテキストで訓練され、人間のような文章を生成することができます。ここで、ある重要な疑問が生じています。これらの機械は人間と同じように言語を学習しているのか、それとも単語がどのように配置されるべきかについて、独自の隠れた好みを形成しているのだろうか、という疑問です。

研究チームは、これらのモデルが異なる語順をどのように扱うかをテストすることで、この問いに答えようと試みました。彼らは、二つの非常に異なる種類のデータを用いた制御実験を構築しました。第一に、彼らは数百の人工言語を作成しました。これらは人々が話す実在の言語ではなく、特定の要素を分離するために設計された数学的な構成物でした。形容詞が名詞の前にあるか後ろにあるか、あるいは動詞が文の最初に来るか最後に来るかといった点だけが変化する言語を想像してみてください。文化的な背景や不規則な文法、乱雑なデータといった実在の人間の会話の複雑さを取り除くことで、研究者はコンピュータモデルに特定の構造に対する組み込みの好みがあるかどうかを確認することができました。その後、彼らはこれらの結果を、英語やスペイン語から日本語、スワヒリ語に至るまで、世界中の実在の自然言語におけるパフォーマンスと比較しました。

研究結果は、これらのモデルの振る舞いにおける驚くべき分裂を明らかにしました。研究者が人工言語を用いてモデルを訓練した際、コンピュータは修飾語が主要な単語の前に来るという特定の構造、言語学者が「左分岐型」と呼ぶパターンを一貫して好みました。この好みは非常に強く、文の基本となる語順に関わらず現れました。しかし、この好みは人間が言語を学習する方法とは一致しませんでした。人間は一貫性を好む傾向があります。もしある言語が動詞を最後に置くのであれば、人間は通常、他の文の構成要素も同様のパターンに従うことを期待します。人工言語を用いた結果は、モデルが人間の論理や世界中の言語に見られる統計的パターンに従っているのではなく、その特定のアーキテクチャにとって単に処理しやすい構造を好んでいることを示しました。このバイアスは、現実世界の言語規則とは無関係に存在していたのです。

研究者が実世界のデータに切り替えると、物語は一変しました。モデルを自然言語で訓練した際、テキストの量が非常に少ない場合(各言語につき約5メガバイト)は、特定の語順に対する明確な好みは見られませんでした。モデルは異なる配置に対しても同様に快適でした。しかし、研究者が訓練データを大幅に増やし、約1,000メガバイトの規模に達すると、明確なパターンが現れました。モデルは、英語や中国語のように、主語が動詞の前に来、動詞が目的語の前に来る、すなわち「主語ー動詞ー目的語(SVO)」の順序を持つ言語を好むようになったのです。興味深いことに、動詞が最後に来る順序(主語ー目的語ー動詞)の方が世界中の言語では実際にはより一般的であるにもかかわらず、この好みはデータ量が増えるにつれて強まりました。

研究者たちはなぜこのような変化が起こるのかを調査しました。彼らは、SVOへの好みがコンピュータのアーキテクチャがその特定の順序を本質的に理解しやすいからではないことを突き止めました。むしろ、この好みはモデルに与えられたデータによって完全に駆動されていたのです。インターネットやデジタルライブラリで最も広く利用可能な言語、いわゆる「高リソース言語」は、圧倒的にSVOです。モデルはこれらの特定の言語から得られる膨大な量のテキストで訓練されたため、その構造を優先することを学んだのです。研究者が、利用可能なデータが極めて少ない言語で訓練されたモデルを調べたところ、SVOの優位性は消失しました。このことは、モデルが普遍的な真理を発見しているのではなく、単にアクセスできる情報の不均衡を反映しているに過ぎないことを示唆しています。

この発見は、言語テクノロジーの未来に重大な意味を持ちます。もしこれらのモデルが、より一般的でない言語や異なる語順を持つ言語の翻訳、執筆、あるいはコミュニケーションに使用されるようになれば、それらの言語をSVO構造へと微妙に押し進めてしまうリスクがあります。モデルは、多くの言語がニュアンス、焦点、あるいは感情を表現するために依存している、自然で柔軟な語順の使用や理解を困難にするかもしれません。この研究は、コンピュータの内部設計にわずかなバイアスはあるものの、それが消費するデータこそがその振る舞いを形作る支配的な力であることを示しています。これらのツールが普及するにつれ、私たちが学習させるデータの選別と管理の仕方が、人間の言語の豊かな多様性を維持するか、あるいはそれを単一の均一なパターンへと徐々に平滑化してしまうかを決定することになるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →