Language Models Generalize to Human-like Word Order Preferences
本研究は、修飾語の順序に関する直接的な証拠を欠くデータで学習された言語モデルが、人間のようなスコープ同型的な語順を好むように一貫して汎化することを示しており、これはこれらのバイアスが単純な統計的関連性ではなく、一般的な学習メカニズムから生じることを示唆している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、ロボットに新しい言語を教えようとしていると想像してください。しかし、あなたはロボットにいたずらをすることに決めました。あなたはロボットに膨大な図書ライブラリを与えますが、一つの名詞に対して複数の記述(修飾語)が含まれる文章が入っているページを、すべて慎重に取り除いてしまいました。その結果、ロボットは「赤いボール(the red ball)」や「大きなボール(the big ball)」と言うことは学べますが、「大きな赤いボール(the big red ball)」や「赤い大きなボール(the red big ball)」といった、複数の記述を積み重ねる方法については一度も目にすることはありません。ロボットは、記述をどのように重ねるかというルールを直接的な証拠なしに学ぶことになります。さて、ここで大きな疑問です。もしあなたがロボットに「大きな赤いボール(the big red ball)」のような新しい文章の順序を推測するように求めたら、ロボットはただランダムに推測するのでしょうか? それとも、人間の子どもがするように、言語に隠された論理を見つけ出し、正しい順序を選び出すのでしょうか?
これは、言語学と人工知能の中心に位置するパズルです。科学者たちは、人間は言葉の順序を教える特別な「言語チップ」を脳内に持って生まれてくるのか、それとも単に耳にしたパターンの観察を通じてすべてを学ぶのかどうかを、長い間疑問に思ってきました。これをテストするために、研究者たちは「人工言語学習(Artificial Language Learning)」と呼ばれるものを使用します。これは、欠けている部分がある、作られた小さな言語を人間や機械に教える、制御された実験のようなものです。もし学習者が、一度も見たことがないパターンであっても、特定のパターンを選択できたとしたら、それは彼らが組み込みのバイアスを持っているか、あるいは単なる単語の頻度ではなく、世界の構造に基づいた巧みな推測方法を持っていることを示唆しています。この論文は、現代のAI言語モデルをテスト対象として使い、この謎を解き明かそうとしています。
言葉の順序に関する大いなる謎
この研究において、研究者のアマンダ・ポパディッチとシェーン・スタイント=スレルドは、コンピュータプログラム(言語モデルとして知られるもの)が、人間が行うような魔法のような芸当を成し遂げられるかどうかを確かめることにしました。彼女たちが知りたかったのは、「形容詞や数字をどのように積み重ねるか」というルールを、一度も積み重ねられたフレーズを目にすることなく、機械は学習できるのかどうかということです。
彼らが追い求めていた特定のルールは、「スコープ・ホモモルフィズム(scope-homomorphism:範囲同型性)」と呼ばれるものです。これは、フレーズ内の単語の順序が、その意味の順序と一致すべきであることを意味する、少し難しい言葉です。ロシアのマトリョーシカを想像してみてください。「大きな赤いボール(big red ball)」の場合、「赤」という言葉はボールを直接的に記述しており、「大きい」はその「赤いボール」を記述しています。英語では、自然に、より外側にある大きな記述(「大きい」)を先に置き、より内側にある具体的な記述(「赤い」)を名詞の近くに置きます。研究者たちは、AIモデルが、単一の記述のみを食べて育ったとしても、この「マトリョーシカ」のような順序を自然に好むようになるかどうかを調べたかったのです。
実験:言語のダイエット
これをテストするために、チームは非常に厳格なトレーニング環境を作成しました。彼らはインターネットの巨大な塊(具体的には2023年のWikipediaのデータ)を取り込み、フィルタリングを行いました。コンピュータプログラムを使用して、二つ以上の修飾語を持つ名詞(例:「あの二匹のふわふわした犬たち(those two fluffy dogs)」)を含むすべての文章を見つけ出し、それらを分解しました。彼らは「those two fluffy dogs」を、「those dogs」、「two dogs」、「fluffy dogs」といった別々の例に置き換えました。
その結果は、「刺激の貧困(poverty of the stimulus)」による食事となりました。モデルには1億語が与えられましたが、二つ以上の修飾語を持つ名詞の例は一度も提示されませんでした。モデルは個々の材料は学びましたが、完成したケーキを見ることはありませんでした。その後、研究者たちは、モデルに二つのバージョンの文章のどちらかを選ばせることでテストを行いました。一つは「マトリョーシカ」の論理に従ったもの(スコープ・ホモモルフィックなもの)、もう一つはそうでないものです。
彼らは、三つの異なるサイズのAIモデルをテストしました。小型(パラメータ数5,200万)、中型(1億1,000万)、そして大型(3億5,000万)です。
結果:AIは正解を見つけた
結果は驚くほど一貫していました。モデルはトレーニング中に複数の修飾語を含むフレーズを一度も目にしていないにもかかわらず、すべてのモデルが一貫して「マトリョーシカ」の順序を好みました。
研究者がモデルに対し、「those two dogs(あの二匹の犬)」と「two those dogs(二つのあの犬)」のどちらかを選ばせると、モデルは圧倒的に論理的な方を選びました。
- 小型モデルは、約**76%**の確率で正解しました。
- 中型モデルは、約**73%**の確率で正解しました。
- 大型モデルは、約**70%**の確率で正解しました。
このことは、モデルが単にトレーニングデータを暗記したのではなく、ルールを一般化したことを示唆しています。モデルは、たとえ答えを見せられていなくても、複数の記述がある場合には、それらを配置するための特定の論理的な方法があることを理解したのです。興味深いことに、モデルのサイズは結果に大きな影響を与えませんでした。小型、中型、大型のモデルがいずれもこのバイアスを示したことは、これがこれらのシステムが学習する際の堅牢な特徴であることを示唆しています。
ひねり:単なる単語のペアリングではない
研究者たちはさらに、次のような追試を行いました。「モデルはどのようにしてこれを理解したのか?」という問いです。一つの有力な理論は、学習者は単に単語がどの程度一緒に現れるかを見ているというものです。例えば、「赤(red)」は通常「ボール(ball)」のすぐ隣に見られるため、「大きい(big)」よりも常に名詞の近くにあるべきだ、という考え方です。これは「相互情報量(PMI:Pointwise Mutual Information)」と呼ばれる指標で測定されます。これは、二つの単語がどの程度強く結びついているかを示すスコアです。
チームは計算を行いました。彼らはトレーニングデータにおける単語の関連スコアを算出しました。すると、形容詞は名詞と強く結びついており、数字や指示詞(「those」など)はそれほど強くないことが分かりました。もしモデルが単にこれらの関連スコアに従っていただけなら、モデルは単語の順序を完璧に予測できていたはずです。
しかし、ここにひねりがありました。関連スコアは、モデルの選択を予測できませんでした。
研究者がモデルの実際の選択と、数学的な予測値を比較したところ、相関関係はほぼゼロでした。モデルは正しい順序を選んでいましたが、それは単語がどれくらいの頻度で一緒に現れるかを数えていたからではありませんでした。このことは、モデルが単なる単語ペアの統計を超えた、より深いもの――おそらく言語がどのように機能するかという構造的な理解――を捉えていることを示唆しています。
これが意味すること
この研究は、言語モデルが「乏しい」入力から、人間のような言語的一般化を回復できることを示しています。新しい言語において、あらゆる可能な組み合わせを見ることなく正しい単語順序を推測できる人間の子供と同じように、これらのAIモデルも、トレーニングデータに明示的に含まれていなかったパターンを見つけ出したのです。
しかし、著者らは、これがAIが人間と全く同じ方法で学習することを証明するものではない、と注意深く述べています。モデルは意識を持った子供ではなく、複雑な統計エンジンです。しかし、指示されなくてもこのようなバイアスが発達したという事実は、これらのルールを学ぶために必ずしも事前にプログラミングされた「言語チップ」が必要なわけではない、ということを示唆しています。時として、言語のルールは、たとえ証拠が不完全であっても、学習の経験から自然に立ち上がってくるものなのです。
また、研究者たちはAIと人間の間の小さな違いについても指摘しています。人間は通常、指示詞と形容詞(例:「that big dog」)の順序に対して最も強い好みを持ちますが、AIモデルは指示詞と数字(例:「those two dogs」)の順序に対して最も強い好みを持ちました。これは、一般化する能力は備わっているものの、バイアスの具体的な「味付け」は、トレーニングデータの詳細に依存している可能性があることを示唆しています。
結局のところ、この論文は言語を理解するための新しいツールを提供してくれます。AIモデルに情報の欠落した「食事」を与えることで、彼らが自力で何を「推測」するのかを見極めることができ、言語のルールがハードワイヤード(組み込み)なのか、それとも世界のパターンから学習されるものなのかを理解する助けとなるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。