Surprisal from Larger Transformer-based Language Models Predicts fMRI Data More Poorly
本研究は、より大規模なTransformerベースの言語モデルほど人間の文章処理の困難度を正確に予測できなくなるという逆スケーリング関係が、読解時間だけでなくfMRIデータにも適用されることを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、人間の脳がどのように言語を処理しているのかを理解しようとしていると想像してください。長年、科学者たちは「サプライザル(驚き度)」と呼ばれる概念を用いて、ある単語を理解するのが人にとってどれほど難しいかを推測してきました。サプライザルを「衝撃計」だと考えてみてください。もし、静かな図書館についての文章を読んでいる最中に、突然「ワニ」という言葉が出てきたら、あなたの脳は大きな衝撃(高いサプライザル)を受けます。なぜなら、それは予想外だからです。一方で、「本」という言葉が出てきたら、衝撃はありません(低いサプライザル)。なぜなら、それは予想通りだからです。
長い間、研究者たちは、より巨大で賢いコンピュータ言語モデル(高度なAIのようなもの)であればあるほど、その「衝撃計」は、人が文章を読むのにかかる時間や、脳の反応を予測する能力に優れていると考えてきました。
大きな驚き
この論文はその考え方を根底から覆します。研究者たちは、より大きく強力なAIモデルの方が、実は人間の脳の反応を予測する能力が低いということを発見しました。
これは、彼らがどのようにしてこの事実を見出したのかという物語であり、いくつかの簡単な比喩を用いて説明します。
「エキスパート」対「人間」
雨が降るかどうかを予測しようとしている、2人の気象予報士がいると想像してください。
- 予報士Aは、小さくて単純なモデルです。彼はこれまでに何度か雨を見たことがあり、それなりにうまく予測できます。
- 予報士Bは、過去のあらゆる気象レポートで学習させた、巨大でスーパーコンピューターのようなモデルです。彼は信じられないほど賢く、実際の気象パターンに対してほぼ完璧な精度で天気を予測します。
研究者たちは、人間の行動(人がどれほど驚いたかなど)を予測する場合、予報士Bは予報士Aよりも精度が低くなるということを発見しました。
なぜでしょうか? 超スマートなAIは、珍しい単語をあまりにも完璧に予測できてしまうため、それに対して「驚かなくなる」からです。しかし、人間は依然として珍しい単語に対して驚きます。AIは自分の仕事において「完璧」になりすぎてしまい、普通の人間脳の仕組みとの接点を失ってしまうのです。それは、チェスのグランドマスターがゲームのあらゆる手を完璧に予測できる一方で、初心者が次に何をするかを予測できない状況に似ています。なぜなら、初心者はグランドマスターなら決してしないような「ミス」をするからです。
実験:2つの異なる脳
これが単なる偶然ではないことを証明するために、研究者たちは単なる読解速度ではなく、脳スキャン(fMRIデータ)を用いてこの理論をテストしました。彼らは、AIの「大きければ大きいほど悪い」というルールが、実際の脳の物理的な活動にも当てはまるかどうかを確認したかったのです。
彼らは、サイズの異なる(小規模から大規模まで)17種類のAIモデルを使用し、物語を聞いたり文章を読んだりしている間の脳がスキャンされている人々、2つのグループに対してテストを行いました。
- 「自然な物語」テスト: 人々が自然な物語を聞いている間の脳をスキャンしました。
- 「ペレイラ」テスト: 人々が短い一節を読んでいる間の脳をスキャンしました。
結果:
どちらのテストにおいても、同じパターンが現れました。AIモデルが大きく、賢くなるにつれて、人間の脳の反応と一致する能力は低下したのです。最も大きなモデルが、人間の脳がどのように反応するかを予測する上で最も劣っていました。
なぜこれが重要なのか(論文による説明)
この論文は、この「逆スケーリング」(モデルが大きくなるほど、人間に対する予測能力が低下すること)は、単に人が読むスピードに関する特異な現象ではなく、脳の実際の電気的活動にも起こる現象であると結論付けています。
著者らは、これらの大規模なモデルは膨大なデータで学習されているため、珍しい単語を予測するのが上手くなりすぎ、その結果、人間の「驚き」のレベルと比較して、彼らの「驚き」のレベルが低くなりすぎると示唆しています。
まとめ:
もしあなたが、人間の脳がどのように言語を処理しているのかを理解したいのであれば、必ずしも最大級の、最も高価なAIが必要だとは限りません。実際には、少し小さくて、あまり「完璧」ではないモデルの方が、私たちの脳の働きをより良く映し出す鏡になるかもしれません。
注:この論文は、これらの特定の言語モデルと脳データセットに限定して結論を出しています。これが他の言語、臨床診断、または将来のAIへの応用にも適用されると主張するものではありません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。