On the use of foundation models in cognitive science
本論文は、基盤モデルを認知および発達モデルとして厳密に評価するための4段階の推論フレームワークを提案し、行動的な整合性だけでは不十分であり、明示的な理論的コミットメント、仮説の連結、および体系的な比較評価に基づかなければならないと主張するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、人間の脳がどのように機能しているのかという謎を解こうとする探偵だと想像してください。何十年もの間、科学者たちは私たちの精神の「モデル」として機能する、小さく簡略化されたコンピュータプログラムを作り、数学の問題や言語ゲームなどのパズルを用いてそれらをテストしてきました。もしコンピュータが子供と同じ間違いをし、あるいは同じ時間でパズルを解いたなら、それはコンピュータが似たような「思考」プロセスを用いている可能性を示唆します。さて、ここに、非常に強力な新しいタイプのコンピュータ・ブレイン、「基盤モデル(Foundation Model)」が登場しました。これらは物語を書き、複雑な論理問題を解決し、人間のようにチャットができる巨大なAIシステムです。これらは人間の振る舞いを模倣するのが非常に上手いため、一部の研究者は、「これらのAIシステムは本当に私たちと同じように考えているのか、それとも単に非常に巧妙に『ふり』をしているだけなのか?」というスリリングな問いを投げかけています。この論文は、AIを称賛するためではなく、厳格な審判として、「AIが正解に辿り着いたからといって、それがどうやってそこに到達したのかを私たちが理解したことの証明になるのか?」と問いかけるために、この議論に踏み込みます。
著者たちは、ジョージア工科大学、カリフォルニア大学サンディエゴ校、スタンフォード大学の研究チームです。彼らは、単にAIが正解を得るのを見守るだけでは、それを人間の認知のモデルと呼ぶには不十分であると主張しています。彼らは、AIが人間の思考と一致していると言うとき、それが単なる幸運な偶然ではなく、科学的で深い意味を持つものであることを保証するために、新しい4段階の「探偵フレームワーク」を提案しています。
4段階の探偵キット
論文によれば、AIが人間の精神のモデルであるかどうかを真にテストするには、単に質問を投げかけて何が起こるかを見るだけでは不十分です。科学者のための「サイモン・セズ(Simon Says)」ゲームのような、4つの明確な段階を持つ構造化された調査が必要です。
- 翻訳(適応): まず、人間が行うテストを、AIがプレイできるように翻訳しなければなりません。例えば、人間が形や色を使った視覚的なパズル・テストを受ける場面を想像してください。テキストしか読めないAIは、それらの形を見ることができません。そのため、研究者は視覚的なパズルを、その論理性を変えることなく、テキストによる記述(例:「青い四角の隣にある赤い円」)に変換しなければなりません。もし翻訳が不器用であれば、AIは間違った理由で失敗するか、あるいは間違った理由で成功してしまう可能性があります。
- 辞書(連結仮説): これが最も重要なステップです。AIが「言っている」ことを、人間が「行う」ことに翻訳するための辞書が必要です。AIの内部的な計算は「深く考えている」ことを意味しているのでしょうか? AIの躊躇は「混乱」を意味しているのでしょうか? 論文は、この辞書を作る方法は多く存在すると警告しています。AIの最終的な回答(選択肢形式のテストなど)を見ることもできますし、AIが考えるのに要した時間(反応時間を測定するなど)を見ることや、さらにはAIの内部的な「思考プロセス」(日記を読むことなど)を見ることさえできます。著者たちは、どの辞書を選ぶかが物語全体を変えてしまうと強調しています。もし間違った辞書を使えば、AIが実際には推測しているだけなのに、天才であるかのように誤認してしまうかもしれません。
- スコアカード(評価): 次に、AIのパフォーマンスを実際の人間データと比較します。しかし、ここでの注意点は、平均スコアだけを見るのではないということです。もしAIが90%正解し、人間も90%正解した場合、それは一つの出発点に過ぎません。優れたモデルは、同じ状況において、同じものを間違えなければなりません。人間が特定のトリッキーなパズルに苦戦する場合、AIも同様に苦戦すべきです。もし人間が躓いている間にAIがそれを軽々とこなしてしまうなら、そのAIは人間の思考をモデルにしているのではなく、単に異なる、おそらくより簡単なショートカットを使っているに過ぎません。
- 比較(対照): 最後に、「もし〜だったら?」という検証を行います。一つのAIだけをテストしてはいけません。より小さなAI、より大きなAI、あるいはAIの脳の特定のパーツを取り除いたバージョンなど、異なるバージョンをテストする必要があります。もしAIの一部を取り除いたことで、突然人間のように振る舞わなくなったとしたら、あなたは「思考」プロセスにおいてどの部分が実際に重要であるかという手がかりを見つけたことになります。このステップは、AIが「なぜ」機能しているのかではなく、「どのように」機能しているのかを科学者が理解する助けとなります。
「ふりをする」という罠
論文は、大きな罠について非常に注意深く指摘しています。それは、行動の整合性は、同一であることと同じではないということです。
二人の人物が迷路を解いている場面を想像してください。一人は地図と論理を使用しています(人間のやり方)。もう一人は、出口を見つけるまで純粋な運によってあらゆる壁にぶつかり続けます(AIのやり方)。もし二人が同じ時間で出口に到達したとしても、外見上は同一に見えます。しかし、内部では、彼らは完全に異なっています。著者たちは、現在の多くの研究は、ゴールラインを見守りながら、両方のランナーが同じ戦略を用いたと決めつけているようなものだと述べています。AIが人間の振る舞い(数学の問題を解いたり、言葉を学習したりすること)を再現できるからといって、それが人間のメンタル・マシナリー(精神的機構)と同じものを使用していることを意味するわけではない、と彼らは警告しています。
また、論文はこれらのAIモデルが膨大な量のテキストに基づいて訓練されている一方で、人間は世界と相互作用し、親と話し、成長することで学習しているという点も強調しています。彼らの「幼少期(トレーニング)」は根本的に異なるため、AIは人間が決して目にすることのないパターンを学習したり、逆に人間が依存しているパターンを見落としたりすることがあります。著者たちは、AIの開発と人間の発達を比較する際には、それらが辿る道筋が根本的に異なるため、非常に慎重になる必要があると示唆しています。
結論
著者たちは、AIが人間の精神について教えてくれないと言っているわけではありません。実際、彼らはこれらのモデルが非常に有望なツールであると考えています。しかし、彼らが言いたいのは、これらを単に「正解を出す」魔法の箱として扱うのをやめるべきだということです。むしろ、慎重なキャリブレーション(校正)を必要とする科学的計器として扱う必要があります。
論文は、AIが人間の認知の真のモデルであるためには、単に私たちの答えを模倣する以上のことをしなければならないと結論づけています。それは、私たちが失敗するのと同じ方法で失敗し、私たちが成功するのと同じ方法で成功し、そして私たちが用いるものと同じ内部的な「推論」ステップに依存していなければなりません。これらの4つの丁寧なステップを通じて、AIの「脳」が私たちの脳の仕組みに関する理論と一致する方法で機能していることを証明できて初めて、私たちは真の科学的進歩を遂げていると言えるのです。それまでは、AIは単に非常に説得力のある俳優に過ぎない可能性があり、私たちはそのパフォーマンスに騙されないようにしなければなりません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。