← 最新の論文
💻 computer science

Data-Environment Coverage and the Path from Narrow to General AI:A Cyber-Physical-Social-ThinkingSurvey

本論文は、現在のAIにおける因果推論、社会認知、および記号的構成における持続的な限界は、規模の不足ではなく多様なデータ環境の欠如に起因するものであると論じ、80のシステムに関する調査を通じて、物理的、社会的、および思考空間の信号を統合することが、狭義のパターン認識から汎用知能へと進展するために不可欠であることを実証するものである。

原著者: yi peng, Huansheng Ning, Jianguo Ding

公開日 2026-08-07
📖 1 分で読めます☕ さくっと読める

原著者: yi peng, Huansheng Ning, Jianguo Ding

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに世界を理解させる方法を教えていると想像してみてください。ここ10年間、人工知能(AI)における最大の進歩は、テキスト、画像、コード、ビデオといった膨大な量のデジタル情報をこれらのロボットに食べさせることで実現してきました。これは、学生に海に関する本を無限に提供するようなものです。彼らは潮汐、魚、嵐に関するあらゆる事実を暗記し、海についての美しいエッセイを書くことができるでしょう。しかし、もし彼らに実際に泳ぐこと、冷たい水を感じること、あるいは見たこともない潮流を渡ることを求めたら、彼らは立ち往生してしまうかもしれません。これが現在の「特化型AI(Narrow AI)」の状態です。デジタルデータの処理には極めて優秀ですが、因果関係や人間の意図の理解、あるいは単なるパターンマッチング以上のものを必要とする論理的推論といった、現実世界の泥臭い事柄には苦戦するシステムです。科学者たちは、これらすべてをこなせる機械を構築することを「人工汎用知能(AGI)」と呼んでいます。誰もが問いかけている大きな疑問は、「なぜ私たちはまだそれを構築できていないのか?」ということです。それはコンピュータが十分に大きくないからでしょうか、それとも、私たちがこれらの機械を教える方法に何か欠けているものがあるのでしょうか。

研究者のYi Peng、Huansheng Ning、Jianguo Dingによって書かれたこの論文は、問題はコンピュータのサイズやデータの量ではないと主張しています。むしろ、問題はそのデータが「どこから」来ているかにあるのです。著者らは、現在のAIはデジタル記録からのみ学習する「サイバー限定(Cyber-only)」のバブルの中に閉じ込められていると示唆しています。真に賢くなるためには、AIは図書館の外へ踏み出し、現実世界へと入っていく必要があると彼らは主張しています。彼らは、AIの学習に対する新しい視点として、「CPST」フレームワークを提案しています。これは**Cyber-Physical-Social-Thinking(サイバー・物理・社会・思考)**の略です。これを現実世界の4次元マップとして考えてみてください。

  • Cyber(サイバー): テキスト、コード、ファイルからなるデジタル世界(現在のAIが住んでいる場所)。
  • Physical(物理): 物体、重力、そして因果関係が存在する世界(コップを押せばそれが落ちるのを見てわかる世界)。
  • Social(社会): 人間の感情、意図、そしてルールが存在する世界(他人が何を考えているかを推測しなければならない世界)。
  • Thinking(思考): 厳格な論理、数学、および構造化された記号が存在する世界(定理を証明できる世界)。

論文は、AIが「スマートな計算機」から「汎用知能」へと進化するためには、デジタル界だけでなく、これら4つの世界すべてのループを閉じる必要があると示唆しています。

巨大なデータのバブル

研究者たちは、初期の画像分類器から最新のロボットやチャットボットに至るまで、80種類の異なるAIシステムを調査しました。彼らは、これらのシステムが4つの世界(サイバー、物理、社会、思考)のうち、どれだけの世界と「クローズドループ(閉じたループ)」で相互作用しているかに基づいて、システムを分類しました。クローズドループとは、システムが単にデータを読むだけでなく、世界に対して働きかけ、その結果を見て、そこから学ぶことを意味します。

以下に彼らの発見があります。これは「大きいことは良いことだ」と信じている人々にとって、少々ショッキングな内容です。彼らのリストにある80のシステムの中で、これら4つの世界の2つ以上のループを閉じることに成功したAIシステムは、たったの一つも存在しませんでした。

純粋にデジタルな(サイバー限定の)最も高度なシステムは、厳しい天井に突き当たっています。それらは見たデータのパターン認識には驚異的な能力を発揮しますが、現実世界の理解を必要とする事柄には惨めに失敗します。例えば:

  • 因果推論: ロボットがブロックを積み上げるビデオを見せられた場合、デジタル限定のAIは次の動きを予測できるかもしれません。しかし、「もし下のブロックを取り除いたらどうなるか?」(反事実的な質問)と尋ねると、彼らはしばしば間違えます。彼らは重力を「感じて」おらず、ブロックを「押して」もいないため、物理学を真に理解していないのです。
  • 社会的認知: 現在のAIは人間の会話を模倣することはできますが、その人が本心を隠している場合に、その人が何を考えているかを理解することには苦労します。それは、カードは読めるが、プレイヤーの表情やボディランゲージを読むことができないポーカーをしているようなものです。
  • 論理的推論: AIはパターンの推測によって数学の問題を解くことはできますが、自身の作業をルールセットと照らし合わせながら、厳格なステップバイステップの論理経路に従うよう求められると、しばしば失敗します。

この論文は、単にAIを大きくすること(パラメータを増やしたり、より多くのテキストで学習させたりすること)がこれらの問題を解決するという考えを明確に否定しています。彼らは、最も巨大で強力なモデルであっても、依然として「サイバー」領域に留まっていることを指摘しています。それらは、あらゆる料理本を読んだことはあるが、一度もコンロに触れたり料理を味わったりしたことがないシェフのようなものです。実際に手を汚したことがなければ、どれほど本を読んでも完璧な料理を作る方法は学べません。

足りない要素

著者らは、なぜ「サイバー限定」のアプローチが失敗するのかを説明するために、巧みな比喩を用いています。彼らは、4つの世界それぞれが、他の世界では決して生み出すことのできない独自の「信号」を提供していると述べています。

  • 因果関係(原因と結果)を学ぶには、**物理的(Physical)**なデータが必要です。何かを実際に「行い」、その結果を見る必要があります。物理学の本を読んでいるだけでは、これを学ぶことはできません。
  • 社会的知能(人間を理解すること)を学ぶには、**社会的(Social)**なデータが必要です。実際に人間と対話し、彼らの反応を見、自分の行動を調整する必要があります。チャットログを読んでいるだけでは、これを学ぶことはできません。
  • 複雑な論理を学ぶには、**思考的(Thinking)**なデータが必要です。クエリを投げたり修正したりできる、構造化された記号とルールのシステムが必要です。単なるテキストの塊ではありません。

論文は、この点について強力な証拠を提示しています。彼らは、与えられるデータが異なるだけで、他の点では同一であるAIシステムを比較しました。

  • ロボットが他のロボットが動いているビデオのみで訓練された場合、そのロボットは自身の動きを計画することができませんでした。しかし、同じロボットが、自分自身が動き、物体と相互作用している「実際の」ビデオで訓練されたとき、そのロボットは見たこともないものを計画し操作する方法を突如として学習しました。
  • 同様に、単なる言語モデルであった数学解決AIは、ほとんど正解を出せませんでした。しかし、その同じ言語モデルを厳格な論理エンジン(「思考」ツール)に接続したところ、そのパフォーマンスは劇的に跳ね上がりました。

データは明確なパターンを示しています。追加の1つの世界(物理や思考など)と相互作用するシステムは、より高い能力レベルに到達する可能性がはるかに高いのです。しかし、真の「汎用知能」である、4つの世界すべてを同時に扱うシステムという「聖杯」は、依然として空席のままです。80のシステムを調査した結果、3つ以上の世界でループを閉じることに成功したシステムはゼロでした。 真の「汎用知能」が存在すべきマップの領域全体が、現在はゴーストタウンとなっているのです。

汎用知能へのロードマップ

では、ここからどこへ向かうべきでしょうか?著者らは単に問題を指摘するだけでなく、それを修正するための3段階のロードマップを提示しています。

  1. 意味論的整合(Semantic Alignment): AIに、これら異なる世界間の翻訳を教える必要があります。現在、AIは物理的なセンサーの読み取りを理解していても、それがどのように社会的ルールや論理的事実と結びつくのかを知らないかもしれません。私たちは、AIが「ロボットがコップにぶつかった(物理)、その結果、人間が怒った(社会)、だから私は謝罪すべきだ(思考)」と言えるような架け橋を築く必要があります。
  2. 統一世界モデル(Unified World Models): 異なる種類の情報を同時に保持できる単一の「脳」を構築する必要があります。物理学のための脳、社会ルールのための脳、数学のための脳というように別々に存在するのではなく、これらすべてを同時に操ることができる一つのシステムが必要です。
  3. ガバナンス(統治): AIが現実世界(物理)や現実の人々(社会)と相互作用し始めるにつれ、新しい安全規則が必要になります。単にコードをチェックするだけでなく、AIが現実世界における自身の行動の結果を理解していることを確認しなければなりません。

論文は、大胆な予測で締めくくられています。AGIへの道は、より大きなコンピュータを作ることや、インターネットからより多くのテキストをスクレイピングすることではありません。それは、触れ、感じ、物理的世界と相互作用できるロボットを作ること、人間と真に会話し交渉できるシステムを作ること、そして厳格な論理で推論できるツールを設計することなのです。AIシステムが、デジタル上のライブラリから踏み出し、サイバー・物理・社会・思考という、複雑で混沌とした4次元の現実へと入っていくまで、彼らは優れた、しかし限定的な学生であり続け、真の汎用知能のレベルへと卒業することはできないでしょう。

著者らは、これは強力な証拠に裏付けられた仮説であり、まだ証明された法則ではないという点に注意深く言及しています。もし、純粋にデジタルなAIが、現実世界に触れることなくこれらすべての問題を突然解決したならば、彼らの理論は間違っていることになります。しかし、今のところ、証拠は一つの明確な方向を指し示しています。汎用知能を構築するためには、世界を単なるデータセットとして扱うのをやめ、遊び場として扱い始めなければならないのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →