Vectors from Larger Language Models Predict Human Reading Time and fMRI Data More Poorly when Dimensionality Expansion is Controlled
本研究は、未学習の大規模言語モデルを用いた次元拡張を制御した場合、人間の読解時間およびfMRIデータに対する学習済みLLMベクトルの予測能が逆スケーリングを示し、学習による付加価値がわずか数十億パラメータの時点でゼロに減退することを実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
何十年もの間、科学者たちはコンピュータが生物に近いスピードで読み書きを学習していく様子を見守ってきました。大規模言語モデルとして知られるこれらの機械は、膨大な量の人間によるテキストを用いて訓練され、文中の次の単語を驚くべき正確さで予測できるようになります。これらが言語を巧みに扱うため、研究者たちは、これらの機械が単に私たちを模倣しているだけでなく、私たちの脳が言語を処理する方法を実際に反映しているのではないかと考え始めました。主流となっていた期待は、これらのモデルがより大きく、より複雑になるにつれて、人間が単語を読むのにどれくらいの時間がかかるか、あるいは物語を聞いているときに脳がどのように反応するかを予測する能力がどんどん向上していくというものでした。この考えは、これらのデジタルな精神の構造が人間の思考の構造への地図となり、人間によるデータとの一致が見られない場合は、単に計算能力が不足しているだけであるということを示唆していました。
しかし、オハイオ州立大学とカリフォルニア大学サンディエゴ校の研究者による新しい研究は、この楽観的な見解に異を唱えています。彼らは、モデルが生成するデータの純粋な規模を厳密に制御したところ、モデルのサイズと人間のようなパフォーマンスとの関係が特定の形で変化することを発見しました。すなわち、訓練による「追加の」恩恵が消失したのです。訓練プロセスによって大規模なモデルが未訓練のモデルよりも大幅に優れたものになるのではなく、最大規模のモデルは、同じサイズの未訓練バージョンよりも優れた性能を示すことはありませんでした。この研究は、これらの巨大なシステムの目覚ましい成功は、言語の真の理解によるものではなく、アクセスできる情報の膨大な量によって作り出された一種の錯覚であると示唆しています。研究者たちがこの利点を取り除くと、これらのモデルを強力にしている訓練は、全く訓練されていない同型の機械に対して、追加の恩恵をほとんど提供しないように見えました。
この結論にどのように達したかを理解するには、まずこれらのモデルが通常どのようにテストされているかを見る必要があります。研究者はしばしば、物語を言語モデルに読み込ませ、モデルの内部状態を、人間が特定の単語でどれくらい休止するか、あるいは文章を聞いているときに脳がどのように反応するかといった人間によるデータと比較します。以前の研究では、より多くの内部変数を持つ大きなモデルほど、一貫して人間の行動をより良く予測しているように見えました。これは「品質・パワー」仮説と呼ばれる理論につながりました。つまり、モデルが大きければ大きいほど、人間の精神に似ているというものです。しかし、研究者たちはこの論理に隠れた欠陥があるのではないかと疑いました。モデルが大きくなると、単に賢くなるだけでなく、分析対象となる内部信号(ベクトル)の数も大幅に増加します。それは、学生に問題の数が2倍になったテストを与えるようなものです。たとえ学生が何も知らなくても、問題の数が多いだけで、運良く正解を当てるチャンスが増えるからです。研究者たちは、以前の研究が「より優れた脳」の恩恵を測定していたのではなく、「より多くの問題」を持っていることの恩恵を測定していた可能性があることに気づきました。
この謎を解くために、チームはサイズの影響と知能の影響を分離する一連の実験を設計しました。彼らは、数億個のパラメータを持つ小さなものから、660億個のパラメータを持つ巨大なものまで、5つの異なる言語モデルのファミリーを集めました。そして、自然な物語を読んでいる際の人間の読解時間や、同じ物語を聞いている人の脳スキャンを含む、実際の人間データに対してこれらのモデルをテストしました。最初の実験において、彼らは以前の知見を再現しました。モデルが大きくなるにつれて、人間の行動の予測が確かに改善しているように見えたのです。これにより、「品質・パワー」効果が表面上は確認されました。
しかし、そこで彼らは決定的なコントロールを導入しました。彼らは同じモデルを取り上げ、テキストによる訓練を受ける前の状態についても調査しました。これらの未訓練のモデルは、訓練されたものと全く同じサイズと構造を持っていますが、本質的にはランダムなノイズであり、言語の知識を持ち合わせていません。訓練されたモデルを、これらと同じサイズの未訓練のモデルと比較することで、研究者たちは、改善のどれほどが実際の学習によるものであり、どれほどが単に利用可能な内部信号の数が多いことによるものなのかを見極めることができました。彼らは、大規模な未訓練のネットワークが単純な分類器によって形作られる原材料として機能する「リザーバー」に似た手法を用いました。もし訓練が本当にモデルをより人間らしくさせているのであれば、訓練されたバージョンは、特にモデルが大きくなるにつれて、未訓練のバージョンよりも大幅に優れた性能を示すはずでした。
結果は驚くべきものでした。研究者が内部信号のサイズを制御すると、訓練による「追加の」利点は消失しました。実際、数十億のパラメータを持つモデルについては、訓練されたバージョンは未訓練のものよりも優れた性能を示しませんでした。いくつかのデータセットでは、訓練による追加の恩恵はゼロにまで低下しました。これは、以前の研究で見られた劇的な改善が、より大きなモデルがより深い言語理解を獲得したためではなく、単にデータを適合させるための内部次元が多く存在していたためであることを意味しています。研究者たちは、モデルが一定の点を超えて成長するにつれて、未訓練のベースラインに対するモデルの適合への「貢献度」は増加するのではなく、ゼロに近づくことを発見しました。モデルが大きくなればなるほど、モデルのサイズ自体が提供する予測力に対して、訓練プロセスが加える価値は減少していったのです。
また、研究ではモデル内の異なる層についても調査し、一部の先行研究で重要であると示唆されていたネットワークの中間層が異なる挙動を示すかどうかを確認しました。彼らは同じパターンを発見しました。モデルの成長に伴い、すべての層において訓練の貢献度がゼロに低下したのです。モデルが人間データを予測する能力の限界に達している可能性を考慮して統計的手法を調整した場合でも、その傾向は変わりませんでした。研究者たちは、これらの大規模モデルの成功は、より多くの変数を持つことでより良い適合が可能になるという統計的な効果によるものであり、人間の認知を真に反映しているわけではないと結論付けました。
この発見は、これらの人工システムが構築されている方法と、人間の脳が機能する方法との間に、重大な不一致があることを示唆しています。これらのモデルを優れたテキスト生成へと導く訓練プロセスは、必ずしも人間による読解や脳活動のより優れたモデルにすることにはなりません。実際、この研究は、これら巨大なネットワークの未訓練バージョン(複雑なランダムな接続の貯蔵庫として機能するもの)が、高価で完全に訓練されたバージョンと同等の精度で人間のデータを予測できる可能性があると主張しています。研究者たちは、将来の研究においては、得られた改善が訓練による真の成果なのか、それとも単にモデルのサイズによる副産物なのかを確実にするために、これらの未訓練モデルを標準的なベースラインとして使用すべきであると提案しています。「大きいことは良いことだ」という考えが長年この分野を牽引してきましたが、この研究は、人間の言語処理の領域において、サイズと訓練を増やすことが、必ずしも人間の精神への理解を深めるのではなく、むしろそこから遠ざかることになる局面があることを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。