← 最新の論文
🤖 AI

Small Foundation Models of Human Cognition and Behaviour

本論文は、人間の行動データで微調整された小規模な基盤モデルは、分布内の心理学的タスクにおいて大規模なベースラインと効果的に同等の性能を発揮できる一方で、未知のタスク構造への汎化を大幅に向上させるのは大規模なモデルのみであり、その性能は単なる選択履歴ではなく、特定の刺激およびフィードバック内容の処理に強く依存していることを示している。

原著者: Nick Oh, Fernand Gobet

公開日 2026-08-07
📖 1 分で読めます☕ さくっと読める

原著者: Nick Oh, Fernand Gobet

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットに人間のように考える方法を教えようとしているところだと想像してください。何十年もの間、科学者たちは、私たちの脳がどのように意思決定を行うかをステップ・バイ・ステップで説明しようとする、小さく手作りされた「精神的機械」(ACT-RやSoarなど)を構築してきました。しかし、これらの機械は脆弱です。もしゲームを少しでも変えてしまうと、ロボットは壊れてしまいます。最近、ある新しいアイデアが主流となりました。ゼロから精神的機械を構築する代わりに、巨大で超スマートなコンピューターの脳(大規模言語モデル)に、人間が選択を行う実例を何百万件も読み込ませてはどうだろうか、というアイデアです。もしコンピューターが次に人間が何をするかを予測できるなら、それは人間の思考の「ルール」を学習したのかもしれない、というわけです。これが「認知プロキシ(認知の身代わり)」の世界です。つまり、人間の心を代行するAIモデルのことです。しかし、大きな疑問が残っています。この巨大な脳は、本当にゲームの「論理」を理解しているのでしょうか、それとも単なるパターンマッチングの達人であり、教科書を読まずに解答集だけを暗記した学生のように、近道(ショートカット)を記憶しているだけなのでしょうか?

「人間の認知と行動の小規模な基盤モデル(Small Foundation Models of Human Cognition and Behaviour)」と題されたこの論文は、その謎に深く切り込んでいます。著者であるニック・オーとフェルナンド・ゴベットは、人間の行動を模倣するために、必ずしもパラメータ数が700億個もある巨大な「巨人の脳」が必要なのか、それとももっと小さな「ポケットサイズの」モデルで事足りるのかをテストすることにしました。彼らは、160種類の心理学実験における1,000万件以上の人間の選択を含む、Psych-101という大規模なデータセットを用いて、1億3,500万(135M)から140億(14B)のパラメータを持つ14種類の異なるAIモデルを訓練しました。

彼らが発見した内容は、少し予想外の展開を見せます。第一に、もしAIがすでに見たことのあるタイプのゲームを見ているだけであれば、サイズは考えているほど重要ではないことが分かりました。わずか6億(0.6B)のパラメータを持つ小さなモデルでも、既知の実験における選択の予測において、700億(70B)の巨大なモデルとほぼ同等の性能を発揮できました。それは、特定の芸を学ぶ小さな機敏な犬が、巨大なグレート・デーンと同じ速さで学習するようなものです。しかし、彼らが新しいタイプのゲーム(分布外のデータ)を投げつけた瞬間、サイズが再び重要になりました。大きなモデルは、見たことがないゲームのルールを解明することにおいて、はるかに優れていましたが、小さなモデルは混乱してしまいました。

しかし、最もエキサイティングな部分は、これらのモデルが「どのように」学習しているかという点です。一部の批評家は、これらのAIが実際のゲームのルールを無視して、過去の選択の履歴だけに頼って(例えば、これまでにプレイされたカードを数えることで、次にくるカードを推測するように)、見せかけの相関関係に依存しているのではないかと懸念していました。これをテストするために、著者たちは情報の「隠れ身の術」を行いました。彼らは、指示を隠したり、ゲームの刺激(画像や数字)をぼかしたり、フィードバックを消去したり、さらには試行の順序を入れ替えたりして、プロンプトの要素を体系的に取り除いていきました。

結果は劇的でした。ゲームの実際のコンテンツ(刺激とフィードバック)をぼかしたところ、モデルの性能は急落し、ランダムに推測した場合を下回りました。これは、モデルが単に回答のシーケンスを暗記しているのではなく、ゲームの「内容」に実際に注意を払っていることを証明しています。さらに、順序が重要ではないゲームにおいて試行の順序をシャッフルしたとき、モデルは気にしませんでした。しかし、順序が重要であるゲームにおいてシャッフルを行ったとき、モデルは混乱しました。このことは、AIがいつイベントのシーケンスが重要で、いつ重要でないかを知るほど賢いことを示唆しています。

要約すると、これらの微調整された小さなモデルは、優れた「ノイズ・シーリング(ノイズの天井)」の推定器です。ノイズ・シーリングとは、人間の行動をどの程度予測できるかを示すガラスの天井のようなものです。もしモデルがこの天井に達したならば、それは私たちがデータの中にある予測可能なパターンをすべて見つけ出したことを意味し、残りのエラーは単なるランブルな人間の「ノイズ」に過ぎません。これらの小さなモデルは、スーパーコンピューターを使わなくてもこの天井に到達できることを示していますが、同時に、これらのモデルは学習したゲームの範囲内に限定されていることも思い出させてくれます。彼らはラボにおける人間の行動を模倣することには非常に長けていますが、人間の心の完全な理論ではありません。彼らは非常に正確な「鏡」であって、その鏡を見つめている「本人」ではないのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →