Grounded world models in biological organisms and future embodied AI
本論文は、将来のエンボディドAIは、堅牢でオープンエンドな知能を実現するために、受動的な言語中心の学習から、能動的な環境相互作用、内在的なダイナミクス、および社会的関与を通じて構築される、生物学的に着想を得た接地された世界モデルへと移行すべきであると論じている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
偉大なる脳の構築者:なぜロボットは、話す前に「触れる」必要があるのか
あなたが、超スマートなロボットに世界の仕組みを教えようとしている場面を想像してみてください。あなたには主に2つの方法があります。1つ目の方法は、ロボットに何十億冊もの本と何百万本もの動画を渡し、「すべてを読み、パターンを暗記し、次に何が来るかを推測しろ」と命じるようなものです。これは、今日の最も有名な人工知能の多くが機能している仕組みです。それは、あらゆる辞書を暗記したものの、リンゴを一度も手に取ったことがなく、その重さを感じたことも、甘さを味わったこともない学生のようなものです。その学生は「リンゴ」「重い」「シャリシャリとした食感」という言葉は知っていますが、リンゴとは本当は何なのかを理解してはいません。
2つ目の方法は、あなたや私、あるいは小さなミミズのような、生き物が学習する方法です。私たちはマニュアルを読んで始めるわけではありません。私たちは動き、何かにぶつかり、空腹を感じ、ボールを押したり紐を引いたりすると何が起こるのかを理解することから始めます。私たちの脳は、こうした実体験に基づいて世界の地図を作り上げます。言葉(ラベル)をその経験に結びつけるのは、ずっと後のことです。この論文は、これら2つのアプローチの違いについて論じています。そして、大きな問いを投げかけます。もし私たちが、人間を真に理解し、混沌とした物理的な世界をナビゲートできるロボットを作りたいのであれば、本を詰め込み続けるべきでしょうか、それとも、外に出て遊びに行かせるべきでしょうか? 著者たちは、「先に遊び、後で話す」という方法こそが、現在のロボットに欠けている「秘伝のソース」である可能性を示唆しています。
論文の核心: 「受動的な読者」から「能動的な探検家」へ
イタリアとカナダの科学者チームによって書かれたこの論文は、現在の人工知能(AI)の構築方法は、自然が私たちを作り上げた方法と比較して、逆転してしまっていると主張しています。
現在、AIにおける最もホットなトレンドは「生成AI」です。これらは、膨大な量のテキストを読み、動画を視聴することで学習するシステムです。これらは、文章の次の単語や、動画の次のフレームを予測することにおいて非常に優れています。論文では、これを「受効的なトレーニング・レジーム(訓練体制)」と呼んでいます。椅子に座って画面を見つめ、人がボールをキャッチする動画を千本見ている学生を想像してください。その学生は、ボールがどのように動くかという「統計」は学べるかもしれませんが、ボールが手に当たった時の「感覚」は学べません。著者らは、これらのシステムにおいては言語(言葉)が基礎となっていると指摘しています。AIはまず言語のルールを学び、その後にそれらの言葉に画像や行動を紐付けようとするのです。
この論文は、生物学的有機体(人間、犬、さらにはミミズなど)は、その正反対を行っていると示唆しています。私たちはまず「接地された世界モデル(grounded world models)」を構築します。これは、私たちの脳が、自分自身の体が動くことを通じて、世界の仕組みに関するメンタルマップ(精神的な地図)を作成するという、少し専門的な言い方です。私たちは、誰かに「火は熱い」と言われたからではなく、熱さを感じたから、火が熱いことを学びます。こうした身体的で接地された理解を得た後に初めて、その上に言語を重ねるのです。私たちにとって、言葉とは、経験を通じてすでに知っているものに対するラベルに過ぎません。
私たちの脳がより優れた地図を構築する5つの方法
自説を証明するために、著者らは、生き物がこれらの接地された地図を構築するのを助ける5つの特定の「回路」または脳の部位に注目しています。彼らはこれらの例を用いて、今日のロボットに何が欠けているのかを示しています。
1. GPSとコンセプトマップ
あなたが街をナビゲートする方法を考えてみてください。赤い標識を見たからといって、ただ左に曲がるわけではありません。あなたにはメンタルマップがあります。あなたの脳には、ヒッポカンパス(海馬)と嗅周皮質に存在する、ハニカム構造(蜂の巣状)のように六角形のパターンで発火する「グリッド細胞」を用いた、GPSのような特別なシステムがあります。
しかし、ここからが面白いところです。この同じGPSシステムは、物理的な通りをナビゲートするためだけに機能するのではありません。論文によれば、あなたの脳はこの同じ「グリッド」を使用して、概念(アイデア)の中をナビゲートします。物語について考えたり、異なる2つの概念を比較したり、あるいは社会的な関係を理解しようとしたりするとき、あなたの脳は本質的にメンタルマップの中を「歩いて」いるのです。論文は、生物学においては、物理的な空間をナビゲートする能力が先にあり、抽象的な概念をナビゲートする能力はその上に構築されたものであると説明しています。現在のAIは、この物理的な「歩行」の部分をスキップして、テキストから直接、抽象的な概念を学ぼうとしています。
2. 「何ができるか?」の検出器(アフォーダンス)
椅子を見たとき、あなたは単に「4本の脚を持つ木製の物体」を見るのではありません。「座ることができるもの」として見ています。カップを見るときは、「掴むことができるもの」として見ています。論文では、これらを「アフォーダンス」と呼んでいます。これは、見たものと、それを使って「何ができるか」を直接結びつけるものです。
あなたの脳は常に、「あの岩に登れるか?」「あのリンゴを掴めるか?」という競争(計算)を行っています。単に世界を記述しているのではなく、行動の可能性を計算しているのです。論文は、ロボットが「注意してください、そのカップは壊れやすいです」という文章を真に理解するためには、「壊れやすい」という感覚が、それを保持した時にどのような感じなのかという接地されたモデルを持つ必要があると主張しています。つまり、強く握りすぎたらカップが壊れるということを知っておく必要があります。現在のAIは「壊れやすい」という言葉は知っていますが、そのリスクを理解するための内的な「筋肉の記憶」を持っていない可能性があります。
3. 好奇心のエンジン
ただ面白いからという理由だけで、新しいものを探索したいと感じたことはありますか? それは単なる人間の癖ではなく、生物学的な衝動です。論文では、私たちの脳が「自分がどれだけ知らないか」を追跡する「メタモデル」を持っていることについて述べています。好奇心を感じるとき、私たちの脳はノルアドレナリンなどの化学物質を放出し、注意力を高め、学習の準備を整えます。
これは、教師から新しいデータセットを与えられるのを待っているだけのロボットとは異なります。生物学的なエージェントは「内発的に動機付けられています」。彼らは、自分自身のメンタルマップにある空白を埋めるために、自ら進んで新しい経験を追い求めます。論文は、AIが効果的に学習するためには、単にデータを待つのではなく、まだ理解していないものを見つけに行くための内的な衝動を持つべきであると示唆しています。
4. 体の警報システム(アロスタシス)
あなたの脳は、外の世界について考えているだけでなく、常に自分の内の世界についても監視しています。空腹、喉の渇き、体温、エネルギーレベルなどを追跡しています。これは「アロスタティック制御」と呼ばれます。
あなたの脳を、単に寒さに反応するだけでなく、寒くなることを予測して、震え出す前にジャケットを着るように指示するサーモスタットだと想像してください。このシステムは「自己」という感覚を生み出します。それは、自分にとって何が良いもの(食べ物)で、何が悪いもの(痛み)であるかを教えてくれます。論文は、この「これが欲しい」「これが欲しい」という内的な感覚こそが、あらゆる動機の基礎であると主張しています。現在のAIシステムは通常、人間から与えられた目標(「ゲームに勝つ」など)を持っています。彼ら自身を突き動かす内的な「空腹」や「恐怖」は持っていません。
5. 「私がやったのか?」のフィルター
指を動かしたとき、あなたの脳はそれがどのような見た目になるかを正確に知っています。脳は、自分が引き起こした動きをキャンセルするために、「動き」のコマンドのコピーを眼へと送ります。これにより、自分自身の動きを無視して、それ自体が動いているもの(例えば飛んでいる鳥など)に集中することができます。
これが、「自分」と「世界」を区別する方法です。鼻に触れたとき、あなたはそれが自分が行ったことだと知っています。もし誰か他の人が鼻に触れたなら、それは驚きになります。論文は、自己生成された行動と外部の出来事を区別するこの能力が、原因と結果を理解するために極めて重要であると説明しています。これがないと、ロボットは「自分が」カップを壊したのか、あるいは「自分が」音を立てたのかを理解できないかもしれません。
これが未来に意味すること
著者らは、現在のAIが「壊れている」とか、生物学が「完璧である」と言っているわけではないことに注意しています。彼らは、「受動的な読解」という方法が、執筆やチャットなどの分野で非常に成功してきたことを認めています。しかし、もし私たちが、ロボットに物理的な世界を真に理解させ、人間と自然に交流させ、自律的に学習させたいのであれば、アプローチを変える必要があるかもしれないと示唆しています。
彼らは、将来のAIは生物学的有機体のように構築されるべきだと提案しています。
- 身体から始める: テキストを読むだけでなく、まずは動きや相互作用を通じてAIに学習させる。
- 基礎から地図を築く: 複雑な言語を教える前に、物体や空間に関する物理的な理解をAIに発達させる。
- 自己の感覚を加える: AIに内的な衝動(好奇心やバランスを維持する必要性など)を与え、受動的ではなく能動的に学習させる。
- 社会的に学ぶ: 人間が他者との関わりの中で学ぶように、将来のAIは人間や他のエージェントと交流し、世界の「共有された」理解を築くことで学ぶ必要があるかもしれない。
論文は、生物学のどの部分が不可欠で、どの部分が進化の単なる幸運な偶然であるかは不明であるが、生き物がどのように学ぶかという方法を無視することは大きなリスクであると結論づけています。もし私たちが、私たちの世界を真にナビゲートできるAIを望むのであれば、それを「図書館」として扱うのではなく、「好奇心旺盛な探検家」として扱い始める必要があるのかもしれません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。