From Large Language Models to Multimodal Intelligence: Bridging AI and Cognitive Science
このレビュー論文は、大規模言語モデルが印象的な認知能力を示す一方で、AIの将来的な発展には、言語のみのシステムの固有の限界を克服するために、身体化された経験、階層的な変調、および自律的な強化を通じてマルチモーダルな知能への隔たりを埋めることが必要であると論じている。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
偉大なる脳のアップグレード:テキストのみの世界から、全身を備えたAIへ
あなたはロボットに世界の理解する方法を教えようとしているところだと想像してください。長い間、科学者たちは、膨大な量の本、記事、ウェブサイトをロボットに読み込ませることで、これを行おうとしてきました。このアプローチによって生まれたのが「大規模言語モデル(LLM)」です。これらは、これまでに書かれたほぼすべての文章を読んだ、超スマートなオウムのような存在です。彼らは文中の次の単語を予測したり、数学の問題を解いたり、詩を書いたりすることには驚くほど長けています。しかし、一つ問題があります。彼らは言葉を通じてのみ世界を知っているのです。彼らは太陽の熱を感じたことも、サンドペーパーのざらつきを感じたことも、重い箱の重みを感じたこともありません。
ここから、人工知能(AI)と認知科学(心の仕組みを研究する学問)の世界における大きな問いが生まれます。「読むだけで、真に賢くなれるのだろうか? それとも、機械が真に理解するためには、体が必要なのだろうか?」あなたがこれから読む論文は、言語は強力なツールではあるものの、真の知性にはいくつかの決定的な要素が欠けているかもしれないという考えを探求しています。この論文は、AIが人間のように学習し、適応し、私たちと相互作用できるようにするためには、単なるテキストを超えて、視覚、聴覚、触覚といった「マルチモーダル」な感覚を与え、言葉で読むだけでなく、世界を直接体験させる必要があることを示唆しています。
メニューを読むことから、料理を味わうことへ
大規模言語モデル(LLM)を、宇宙にあるすべての料理本を暗記しているけれど、一度もキッチンに足を踏み入れたことがないシェフだと考えてみてください。このシェフは、何百万もの記述に基づき、イチゴの色、味、質感について完璧に詳細に説明することができます。イチゴを食べる喜びについての詩を書くことさえできます。しかし、もしそのシェフに本物のイチゴを手渡したとしたら、どうやってそれを持ち、どのくらいの強さで握るべきか、あるいは肌に触れたときに実際にどのような感じがするのかを、彼らは知らないでしょう。彼らはその体験に関する「言葉」を知っていますが、体験そのものを「経験」してはいないのです。
研究者のYanru Jiang氏とRick Dale氏によるこの論文は、シンプルかつ深遠な問いを投げかけています。「もし機械が言語を通じてのみ世界を知っているとしたら、その機械は真に知的になれるのだろうか?」
著者たちは、これらのテキストのみの「シェフ」たちは自分たちのすることにおいて素晴らしいものの、ある壁に突き当たると主張しています。彼らは情報の表現や書き起こせる問題の解決には優れていますが、「学び方を学ぶ」ことや、マニュアルなしで新しい奇妙な状況に適応することには苦戦します。論文は、この壁を乗り越えるためには、AIが「テキストのみ」のシステムから、言語と視覚、聴覚、動きを組み合わせた「マルチモーダル」なシステムへと進化する必要があると示唆しています。
二つの思考法:図書館 vs 遊び場
なぜこれが重要なのかを理解するために、論文では心の働きに関する二つの異なる考え方を分類しています。
- 記号的認知(図書館): この見解は、言語だけで十分であると説きます。言葉は現実世界に完璧に対応するシンボルであるという考えです。もしあなたが「バラ」という言葉と、それが結びつく他のすべての言葉(「赤い」、「棘がある」、「ロマンス」など)を知っていれば、本質的にバラが何であるかを知っていることになります。現代のAIはこの分野において非常に優れていることを論文は認めています。AIは、地図やカレンダーを見たことがなくても、言葉がどのように使われているかを見るだけで、「ニューヨーク」が場所であり、「月曜日」が時間であることを理解できます。
- 身体的認知(遊び場): この見解は、言語だけでは不十分であると説きます。言葉を真に理解するには、それを「経験」していなければならないという考えです。単に定義を読んだから「重い」という意味を知るのではなく、重い箱を持ち上げて筋肉が張るのを感じるからこそ、重さを知るのです。論文は、自転車に乗ることや、飲み物の載ったトレイのバランスを取ることといった多くの概念は、言葉だけで完全に捉えることはできないと示唆しています。それらは「行う」必要があるのです。
著者たちは「図書館」のアプローチが無用だと言っているわけではありません。実際、それが非常に強力であることを認めています。しかし、それは不完全であると彼らは主張しています。物理学の本を読んで自転車の乗り方を学ぶことができないのと同様に、AIは本を読んでナビゲーションの方法を学ぶことはできないのです。
なぜ言葉だけでは足りないのか
論文は、テキストのみのAIが常に少し制限を受ける理由として、主に二つの点を指摘しています。
1. 「言葉にできない」問題
言葉にするのが難しいことはあります。特定の種類の音楽の感じ方や、グラスに光が当たる正確な様子などを考えてみてください。人間はしばしば、教科書を通じてではなく、感覚や体を通じてこれらのことを学びます。もしAIがテキストにしかアクセスできないのであれば、これらの「言語化できない」概念を逃してしまうことになります。それは、甘いものを食べたことがない人にチョコレートの味を説明しようとするようなものです。どれほど多くの言葉を使っても、実際に味わうまでは理解できません。AIが迅速かつ柔軟に新しいことを学ぶためには、単に読むだけでなく、世界を直接体験する必要があると論文は示唆していますしています。
2. 「対人的」なギャップ
美しい夕日を見ている友人と話している場面を想像してください。あなたが「あれを見て!」と言ったとき、友人はあなたが何を言っているのか正確に理解できます。なぜなら、友人もあなたと同じ空を見ているからです。さて、テキストしか読めないロボットに話しかけている場面を想像してください。あなたが「あれを見て!」と言ったとき、ロボットには「あれ」が何なのか分かりません。ロボットには夕日を見る目も、体を向けて見る体もありません。
論文は、人間のコミュニケーションには、どこを見ているか、どのくらいの速さで話しているか、ボディランゲージといった「非言語的」な手がかりが満載であることを指摘しています。これらの手がかりがあるからこそ、私たちは瞬時に理解し合えます。テキストのみのAIは、これらすべてを見落としてしまいます。あなたが単に「はい」か「いいえ」を求めているだけなのに、AIは非常に長く詳細な回答を返すかもしれません。なぜなら、AIはあなたの焦りや気分を感じ取ることができないからです。優れた会話のパートナーであるためには、AIは「身体的(embodied)」である必要があります。つまり、人間と同じように、リアルタイムで状況を見て、聞き、反応できる必要があるのです。
より賢いAIへのロードマップ
では、どのようにしてこの「マルチモーダル」なAIを構築するのでしょうか? 論文は、デジタル脳をアップグレードするためのレシピのように、三つの刺激的な道筋を概説しています。
1. 材料を混ぜ合わせる(マルチモーダル表現学習)
現在、多くのAIシステムは、言語モデルとビジョンモデル(見るモデル)を取り出し、最後にそれらを貼り合わせることで構築されています。著者たちは、もっとうまくやる必要があると提案しています。単に貼り合わせるのではなく、最初から「共に」学ぶように訓練すべきだというのです。子供に、まず本を読ませてから後で絵を見せるのではなく、言葉を話し、同時に見ることを教える様子を想像してください。この「早期統合」は、AIが見ているものと聞いていることの間の深い繋がりを理解する助けとなり、よりスマートで直感的なシステムにつながるかもしれません。
2. 脳の司令塔(階層的モジュレーション)
私たちの脳は層状に構成されています。下の層は「あれは赤い点だ」といった単純なことを扱い、上の層は「地面に落ちる前にあのボールをキャッチしなければならない」といった複雑なことを扱います。論文は、AIにも同様の「司令塔」システムが必要であると示唆しています。この「司令塔」(人間の脳における実行機能のようなもの)は、視覚、聴覚、触覚といったすべての異なる感覚を見渡し、どの瞬間にどれに集中すべきかを決定できるべきです。それはオーケストラの指揮者のようで、バイオリンとドラムが完璧に共演するように調整します。現在、ほとんどのAIはこれを行うのが苦手であり、情報が一度に入ってくると混乱してしまうことがよくあります。
3. 内なる衝動(自律的強化)
最後に、論文は問いかけます。「何がAIに学習させたいと思わせるのか?」 現在、私たちは通常、AIに何をすべきかを正確に指示し、正解したときに「報酬(ポイントのようなもの)」を与える必要があります。しかし、人間は探索するために教師を必要としません。私たちは自然に好奇心を持っています。あのボタンを押したらどうなるか、あの木に登ったらどうなるかを知りたいと思うのです。著者たちは、将来のAIは「内発的動機付け」を持つべきだと提案しています。これは、次に何が起こるかを予測するためにエネルギーを使う私たちの脳のように、探索し学習するための組み込まれた衝動です。これにより、AIは人間から毎回特定のタスクを与えられることなく、自ら発見し、新しいことを学ぶことができるようになるでしょう。
総括
論文は、大規模言語モデルは大きな前進ではあるものの、それは始まりに過ぎないと結論づけています。それらは、図書館にあるすべての本を読んだけれど、一度も建物から外に出たことがない優秀な学生のようなものです。学習し、適応し、人間らしく自然に私たちと相互作用できる真に知的な機械を作るためには、彼らに体と感覚を与える必要があります。
私たちは、単に言葉を「知っている」AIから、世界を「体験する」AIへと移行する必要があります。言語を視覚、聴覚、動きと組み合わせ、これらの機械に自ら探索し学ぶ能力を与えることで、AIが単に私たちが話しかける道具ではなく、私たちを真に理解してくれるパートナーとなる未来を築くことができるのです。それは図書館を置き換えることではなく、ドアを開けて、AIを外の世界へと踏み出させることなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。