✨ 要約🔬 技術概要
あなたが、非常に多様な生徒のグループに、全く新しい複雑なボードゲームの遊び方を教える場面を想像してください。生徒には以下の 3 種類がいます。
「蛮力」学習者(深層強化学習) : これらの生徒は、あり得るすべての手を試し、何千回も失敗し、単なる反復によってルールをゆっくりと暗記します。彼らは、正しく座るたびにご褒美をもらって芸を覚える犬のようです。
「論理パズル」解決者(ベイズ推論エージェント) : この生徒は、人間のような論理学者で、あり得るすべてのルールを書き出し、科学者のようにそれらをテストし、手を動かす前にゲームの仕組みに関する完璧な理論を構築します。
「超読者」(大規模推論モデル、LRM) : これらは、人間が書いたもののほとんどを読み尽くした高度な AI システムです。彼らはこの特定のゲームを以前にプレイしたことはありませんが、盤面を見て、声に出して考え、人間と同じようにほぼ瞬時にルールを推測します。
実験 研究者たちは知りたいと思いました:これらの生徒のどれが、最も人間のように考え、学ぶのでしょうか?
それを明らかにするために、研究者たちは単に誰がゲームに勝ったかを見ただけではありませんでした。彼らは、人間がこれらのビデオゲームをプレイしている間、その人間を MRI 装置(脳を撮影する巨大なカメラ)の中に入れました。目的は、どの AI 生徒の「思考プロセス」が、人間の脳内の実際の電気活動と一致するかを確認することでした。
ゲーム:謎の箱 使用されたゲームは、デジタルの謎の箱のようでした。プレイヤーはルールを知りませんでした。「赤い四角に触れると死んでしまう」あるいは「茶色の箱を押すと扉が開く」といったことを発見する必要がありました。これらのゲームには、パターンを見極め、推測を行い、誤りだった場合にその推測を変更する能力が求められました。
結果:「超読者」の勝利
行動(プレイの仕方) :
「蛮力」学習者 はひどいものでした。上手になるまで、ゲームを何百万回もプレイする必要がありました。彼らは遅く、不器用でした。
「論理パズル」解決者 はまあまあでしたが、少し硬直していました。
**「超読者(LRM)」**がスターでした。彼らは人間と同じように、数回の試行でルールを学びました。MRI 装置の中の人々と同じ速度で、同じ効率でゲームの「謎」を解き明かしました。
脳スキャン(思考の「X 線」) :
これが最も驚くべき部分です。研究者が AI の内部的な「思考」(デジタル脳活動)を人間の脳スキャンと比較したとき、「超読者」は完璧に一致しました 。
AI の「思考」は、視覚を処理する視覚野や、計画を立てる前頭葉における人間の脳活動と、ほぼ完全に同じように見えました。
「蛮力」学習者はどうでしょうか?彼らの「思考」は人間の脳とは全く似ていませんでした。計算機と人間の心を比較するようなものです。
「超読者」は、他の AI モデルよりも10 倍 人間の脳活動を予測しました。
「思考」と「実行」の意外性 研究者たちは、「超読者」について奇妙な点を見つけました。
発見 : ルールを推測している 間、彼らは非常に人間らしかったです。
実行 : 一度解き明かすと、彼らは時としてループに陥ることがありました。勝つための経路を見つけると、より短い経路が存在しても、その全く同じ経路 を何度も繰り返しプレイしました。しかし、人間はルールを知った瞬間、より短く効率的な経路に即座に切り替えました。
教訓 : AI の「脳」(ゲームの状態をどのように表現するか)は非常に人間らしいですが、その「筋肉記憶」(計画をどのように実行するか)は少しロボット的です。
なぜこれが重要なのか この論文は、これらの「超読者」(大規模推論モデル)が、単に人間のように振る舞う だけでなく、実際に人間のように考える 最初の AI システムであると示唆しています。
通常、AI モデルは特定のタスク(チェスなど)のために特別に訓練されます。しかし、これらのモデルは、すでにトレーニングから得た知識を用いて、ルールを読み、画面を見るだけでゲームを学びました。これはまさに人間が新しいことを学ぶ方法です。ゼロから始めるのではなく、一般的な知識を使って新しい状況を即座に理解します。
要約 もしあなたが、私たちが世界を理解するのと同じように世界を理解する AI を構築したいなら、パターンを暗記させること(「蛮力」学習者のように)だけをしてはいけません。代わりに、膨大な知識のライブラリを与え、問題を解決するために「声に出して考え」させましょう。この論文は、このアプローチが、私のようにゲームをプレイするだけでなく、文字通り私と同じ場所で「脳」を点灯させる AI を生み出すことを示しています。
技術的概要:プレイする理由:最先端の論理推論モデル(LRM)と人間のゲーム学習者の間の行動的・脳活動の整合性
問題提起
人間の認知は、新しい環境における抽象的な構造を迅速に学習し、その知識を柔軟に展開して知的な行動を導く能力によって特徴づけられる。現代の AI システム、特に大規模論理推論モデル(LRM)は、静的な推論タスクにおいて印象的な能力を示してきたが、それらが人間と同様の効率性と柔軟性をもって、動的な環境においてインタラクティブに学習し計画できるかどうかは依然として不明である。既存のベンチマークは、インタラクティブな学習中のエージェントの内部表現を捉えることに失敗することが多く、従来の深層強化学習(RL)エージェントは特定のドメインでは成功しているものの、人間に比べて桁違いに多くのデータを必要とし、転送可能な内部モデルを欠いている。さらに、計算神経科学は、インタラクティブな認知中の人間の脳活動を予測するモデルの確立に苦慮しており、特定のタスクにゼロから訓練されたモデルはしばしば脆い符号化信号を生み出す。
本研究は以下の問いに答えるものである:最先端の LRM は、新しいビデオゲームのルールを発見し実行する過程において、人間の行動軌跡と人間の脳活動の両方に整合する形で学習し計画できるか?
手法
データセットとタスク
著者らは、12 の異なるビデオゲーム(ビデオゲーム記述言語 VGDL で定義)のプレイを学習する 32 名の健康な成人参加者からの同時 fMRI 記録とゲームプレイ軌跡を含むVGDL-fMRI データセット を利用した。
タスク構造: 参加者は 6 回のスキャナー走査で 6 つのゲームをプレイした。各ゲームは複雑さが増す 9 つのレベルで構成され、新しいオブジェクトタイプと相互作用ルールが段階的に導入された。
環境: ゲームには、ルールの発見、仮説の修正、多段階の計画(例:箱を押し、危険を回避し、協力的に誘導する)が必要とされた。
入力制約: モデルは、人間参加者と同じく、特権的な意味ラベルなしに、色を匿名化した記号的な観察(グリッド位置、色、インベントリ)を受け取った。
モデルクラス
本研究では、3 つのパラダイムにわたるエージェント群を評価した。
最先端の大規模論理推論モデル(LRM): Qwen 3.5 および DeepSeek ファミリーから 8 つのモデル(9B から 397B パラメータ)を評価した。これらのモデルは、観察を受け取り行動を生成するマルチターン対話形式 で評価された。2 つの条件がテストされた。
推論の転記: 後続のターンにおいて、モデルの隠れた思考の連鎖(chain-of-thought)がコンテキストに含まれた。
行動のみ: 明示的な推論痕跡の寄与を分離するため、行動のみが提供された。
深層強化学習(RL)ベースライン:
モデルフリー: 各ゲームごとの広範なハイパーパラメータ調整とカリキュラムベースの訓練を伴う Double DQN(DDQN)。
モデルベース: モンテカルロ木探索による計画のために潜在ダイナミクスモデルを学習する EfficientZeroV2(EZV2)。
記号的ベースライン: ゲームルールの手書きオントロジー上でベイズ推論を実行する理論ベースのエージェントである Explore–Model–Plan Agent(EMPA)。
評価指標
行動的整合性:
発見効率: レベルごとの初回勝利までの累積ステップ数(人間分布に対するアース・ムーバーズ・ディスタンス、EMD により測定)。
能力: 固定されたステップ予算下で到達した平均レベル(2 回連続勝利が必要となるブロック型カリキュラム)。
脳符号化:
プロトコル: LRM を受動的な観察者 として実行し、人間参加者が見た正確な観察ストリームを、行動や推論痕跡を生成することなく入力した。最終入力トークンにおいて隠れ状態特徴を抽出した。
分析: バンドド・リッジ回帰を用いて、モデル特徴から血液酸素レベル依存(BOLD)応答を予測した。性能は、6 つの解剖学的関心領域(ROI:前頭葉、運動野、頭頂葉、視覚野、初期視覚野、線条体)全体にわたる予測 BOLD 活動と観測 BOLD 活動との間のピアソン相関(r r r )として測定された。
対照: 比較には、ランダム初期化対照、軌跡シャッフル対照、および交絡因子回帰変数(ボタン押下、ゲームの同一性、時間)が含まれた。
主要な貢献
インタラクティブ学習における LRM の体系的評価: 12 のゲームと 32 名の人間参加者を対象とした、人間のようなインタラクティブなゲーム学習における最先端 LRM の体系的評価はこれが初めてである。単一ステップのプロンプティングや古い LLM を用いた先行研究とは異なり、本研究は明示的な推論痕跡を伴うマルチステップ対話を採用している。
人間との行動的同等性: 本研究は、最先端 LRM が発見効率と能力の進展の両面で人間の学習軌跡と一致することを示しており、一方深層 RL ベースラインは桁違いに多くの経験が必要であり、早期に頭打ちになる。
優れた脳活動との整合性: LRM は、すべての皮質および皮質下領域において、深層 RL ベースライン(DDQN、EfficientZero)および記号的 EMPA エージェントよりも桁違いに優れた人間の脳活動の予測を行う。この整合性は置換対照に対して頑健であり、微調整やドメイン固有のツールなしに**そのまま(off-the-shelf)**達成された。
機械的洞察: 本研究は、脳整合性シグナルがモデルの文脈内におけるゲーム状態の表現 を反映しており、その下流の計画や推論プロセスを反映するものではないことを分離して示した。モデルが推論痕跡を生成することなく受動的な観察者として実行されても符号化精度が依然として高いという事実に基づく。
リソースの公開: 著者らは、10 万を超える推論痕跡、すべてのリプレイデータ、抽出された隠れ状態特徴、および完全な分析パイプラインを含むインタラクティブな補足資料を公開した。
結果
行動パフォーマンス
発見効率: 最先端 LRM は、初回勝利までのステップ数の人間分布の周りに密集してクラスタリングした。最良のモデルである DeepSeek V4-Pro は、発見における EMD 0.28 を達成し、DDQN の 3.07 および EfficientZero の 3.22 と比較された。これは、RL ベースラインに対する人間行動との距離を 5〜11 倍削減したことを意味する。
能力: LRM は、1600 ステップの予算内で平均レベル 4〜6 に到達するなど、人間と同等の速度で 9 レベルのカリキュラムを進展させたのに対し、RL ベースラインはめったにレベル 1〜2 を越えなかった。
発見と実行のギャップ: 実行において顕著な乖離が認められた。人間は初回勝利後にステップ数を大幅に短縮した(中央値 32 ステップ)のに対し、LRM は「固執」する傾向があり、推論内でより短い経路が示唆されても、初回勝利の正確な軌跡を再生していた。このギャップはモデルの規模とともに減少し、DeepSeek モデルではほぼ存在しなかった。
脳符号化
整合性の大きさ: LRM は、視覚および初期視覚領域でピアソン r r r 約 0.07〜0.10、前頭葉、運動野、線条体領域ではより低いが有意な値で BOLD 活動を予測した。これは、r = 0.015 r=0.015 r = 0.015 未満で推移した最良の RL ベースラインよりも約 1 桁高い 値である。
訓練対アーキテクチャ: 訓練された LRM は、同じアーキテクチャのランダム初期化バージョンを大幅に上回った(6.4〜6.9 倍の改善)。これは、整合性がアーキテクチャの事前知識ではなく、学習された表現に由来することを確認した。
規模対整合性: 一般的にモデルサイズとともにスケールする行動パフォーマンスとは異なり、脳符号化の精度はパラメータ数に対して単調にスケールしなかった。Qwen3.5-35B-A3B(MoE)モデルが最高の符号化精度を達成し、DeepSeek V4-Pro などのより大きなモデルを上回った。
表現の特異性: 符号化シグナルは、ゲームプレイの瞬間ごとのシーケンスにロックされた。埋め込みの時間的順序を置換するか、またはコンテキスト履歴を切り捨てると、符号化精度が大幅に低下し、シグナルが長期的な記憶統合ではなく、即座の表現構造を捉えていることを示した。
意義と主張
本論文は、複雑で自然主義的な環境における人間の学習と意思決定の説得的な計算論的説明として、最先端 LRM を確立する と主張している。
整合性の新規性: 著者の知る限り、インタラクティブなゲームプレイ中に人間と LRM の間で行動的かつ神経的な整合が示されたのはこれが初めてである。
整合のメカニズム: 結果は、LRM がテキストの事前訓練を通じて獲得した豊かで転送可能な表現が、人間と同様の「広範な事前知識」を持って新しいゲームに臨むことを可能にすることを示唆している。これは、ゼロから学習する必要があり、脆い表現を生み出して人間の脳活動と整合しない深層 RL エージェントとは対照的である。
限界: 著者は控えめに、自らのパラダイムはすべての人間軌跡が固有であるため、ボクセルごとのノイズ天井推定を困難にしていると指摘している。また、LRM は訓練コーパスから一般的な事前知識を保持しており、これを完全に制御できないことも認めている。
将来の方向性: 本論文は、現在の LRM が人間の認知の表現的 構造を捉えている一方で、能動的学習や計画そのものに伴うシグナルを見逃していることを示唆している。将来の研究には、モデルを個々の人間の軌跡に整合させるための、より豊かな認知アーキテクチャと能動的関与プロトコルが必要である。
本研究は、LRM が計算神経科学への道筋を提供し、タスクを解決するだけでなく、インタラクティブな学習中の人間の脳の内部計算状態を反映するモデルを提供すると結論づけている。
毎週最高の biology 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×