Large Language Models as Proxies for Theories of Human Linguistic Cognition
本論文は、現在の大型言語モデルが、言語学的中立な人間の認知理論のプロキシ(代理)として、言語パターンの獲得を評価するために活用できる可能性を模索するものであるが、その役割における有用性は現時点では極めて限定的であることを認めている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
以下は、この論文の解説を、平易な言葉と日常的な比喩を用いて説明したものです。
大きな問い:AIチャットボットは人間の脳を理解するための未来となるのか?
言語学者(人間がいかにして言語を学ぶかを研究する科学者)が、ある謎を解こうとしていると考えてみてください。それは、**「なぜ人間の赤ちゃんは、複雑なルールを理解するのに十分な量の例を聞いていないにもかかわらず、これほど完璧に話せるようになるのか?」**という謎です。
数十年の間、有力な理論(これを理論Aと呼びましょう)はこう主張してきました。「人間は、脳の中に特別な『言語チップ』を生まれつき備えている。このチップは、特定の言語ルールに対して偏り(バイアス)を持っており、パズルのピースが特定の方向にしかハマらないようなものだ」というものです。
最近、新しい考え方が登場しました(これを理論Bと呼びましょう)。それは、「特別なチップは必要ないのではないか。ただコンピュータに大量のテキスト(赤ちゃんが言葉を聞くのと同様に)を読み込ませれば、コンピュータは自力でルールを見つけ出せるはずだ。したがって、現在のAIチャットボット(大規模言語モデル、LLM)こそが、人間がいかにして言語を学ぶかについての最良の説明である」という示唆です。
この論文の著者たちはこう言っています。「ちょっと待ってください。それは少し違います」
彼らは、**「プロキシ・ビュー(代理視点)」と呼ばれる中間的な考え方を提案しています。彼らは、AIチャットボットは人間の脳の完璧なモデルではないものの、第三の未知の理論(理論C)のための「テスト用ダミー」や「プロキシ(代理)」**として機能する可能性があると考えています。理論Cとは、公平で中立的な(特別な「言語チップ」を持たない)学習システムでありながら、それでも言語を習得できるという理論です。
論文はこう問いかけています。「現在のAIチャットボットは、中立的な学習システム(理論C)が実際に機能し得ることを証明するための、優れた『テスト用ダミー』になり得るだろうか?」
2つの大きなテスト
AIが優れた「テスト用ダミー」として機能するかどうかを確認するために、著者らは2種類の実験を行いました。これらを、2つの異なる障害物競争だと考えてください。
テスト1:「赤ちゃんの本」チャレンジ(限られたデータからの学習)
比喩: ロボットにチェスのルールを教える際、わずか10試合分しか見せられない状況を想像してください。人間の子供は、比較的少ない量の発話(約10年間の会話)から複雑な文法を学びます。
実験: 著者らは、異なる量のテキストを用いてAIモデルを訓練しました。
- あるモデルは、10ヶ月の赤ちゃんの分量だけのテキストを見ました。
- あるモデルは、8歳児の分量を見ました。
- あるモデルは、人間が一生のうちに聞くであろう量(80万年分という膨大な量)を見ました。
彼らは、人間なら簡単に解けるようなトリッキーな文法のパズルについて、これらのモデルをテストしました。例えば:
- 「誰が」パズル: "Which book did you say that Kim hated?"(どの本をキムが嫌いだと言ったのか?)のような文章において、誰が何をしたのかを判断する問題。
- 「that」パズル: 文章の中でいつ "that" を省略すべきかを知る問題(例:"Who did you say loves Sue?" は自然ですが、"Who did you say that loves Sue?" はネイティブスピーカーには不自然に聞こえます)。
結果:
AIモデルは惨敗しました。
- 非常に小さなモデル(赤ちゃんレベルのデータ)は間違えました。
- 決定的なのは、巨大なモデル(80万年分のデータで訓練されたもの)でさえ、依然として間違えたことです。 彼らはしばしば、文として「誤った」バージョンの方を好みました。
これが意味すること: もし無限の時間とデータを持つコンピュータでさえこれらのルールを解けないのであれば、「中立的な」人間の学習システム(理論C)がそれを成し遂げられる可能性は低いということです。AIは、この理論のための優れた「テスト用ダミー」として機能することに失敗しました。
テスト2:「奇妙な言語」チャレンジ(異常なものの学習)
比喩: あなたは言語を学習するロボットを持っています。あなたは、そのロボットが「普通の」言語(英語など)を、「奇妙な」言語(すべての文章が逆さまになっている言語など)よりも自然に好むかどうかを知りたいと考えています。
実験: 著者らは、実在する言語(英語、イタリア語、ロシア語)を取り上げ、数学的な手法を用いて「奇妙な」バージョンを作成しました。
- 部分的逆転(Partial Reverse): 文章の半分を逆にする。
- 完全逆転(Full Reverse): 文章全体を逆にする。
- トークン・ホップ(Token Hop): ロボットが記号を置く位置を決めるために、単語を数えるようにする。
彼らはAIに尋ねました。「どちらのバージョンが学習しやすいですか? 普通の言語ですか、それとも奇妙な言語ですか?」
結果:
AIは「奇妙さ」を気にしませんでした。
- 時には、AIは奇妙で逆さまの言語の方が、普通の言語よりも学習しやすいと判断しました。
- またある時には、普通の言語の方が学習が難しいと判断しました。
これが意味すること: もしAI(私たちの「テスト用ダミー」)が、奇妙な言語を普通の言語と同じくらい簡単に学習できるのであれば、それは「中立的な学習システム」が、なぜ人間が「普通の言語」だけを話し、「逆さまの言語」を一切話さないのかを自然に説明できないことを示唆しています。AIは、実在する言語が自然に学習しやすいものであることを示すことにも失敗しました。
結論:「テスト用ダミー」は壊れている
著者らは、「プロキシ・ビュー(AIを中立的な学習理論の代わりとして使うこと)」は現在、機能していないと結論づけています。
- LLM理論(AI = 人間の脳): これは間違いです。なぜなら、AIには人間特有の癖(例えば、文法的に正しくても「ありそうにない」文と、単に「間違っている」文の違いを理解することなど)が欠けているからです。
- プロキシ・ビュー(AI = 中立的な理論のテスト用ダミー): これも現在は失敗しています。AIモデルは、人間が容易に学ぶ特定のルールを学ぶのが非常に苦手である一方で、人間が決して使わないような「奇妙な」ルールを学ぶのは非常に得意であるため、中立的な学習システムが機能することを証明する助けにはなっていません。
最終的なまとめ:
著者らは、AIが役に立たないと言っているわけではありません。彼らは、現在のAIは人間の脳とは**「あまりにも異なりすぎる」**ため、新しい理論の信頼できる「テスト用ダミー」として使うことはできないと言っているのです。
彼らは実質的に、他の科学者たちにこう伝えています。「もし、特別な『言語チップ』なしに人間が言語を学ぶことを証明するためにAIを使いたいのであれば、もっと優れたAIを作るか、もっと明確な理論を先に構築する必要があります。現在のチャットボットはその役割を果たせていません。」
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。