← 最新の論文
💻 computer science

The Undecidability of Artificial General Intelligence (AGI) Alignment

本論文は、AGIの整列(アライメント)が不可能なのではなく構造的に検証不可能であることを、トラクテンブロットの壁およびそこから導出される「健全性・完全性・計算量可能性のトリレンマ」を通じて証明し、現在の封じ込め戦略が一時的な修正策ではなく、決定可能な安全性を達成するために論理的表現力を犠牲にせざるを得ない必然的な選択であることを確立している。

原著者: Jose Pascual Gumbau Mezquita

公開日 2026-06-30
📖 1 分で読めます☕ さくっと読める

原著者: Jose Pascual Gumbau Mezquita

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大きなアイデア:ロボットが安全であることを証明することはできない

想像してみてください。あなたは、あらゆることを学び、あらゆる問題を解決できる超知能ロボット(AGI)を作っています。あなたの目標は、このロボットが絶対に誰かを傷つけたり、制御不能になったりしないことを、100%の確率で証明できる「安全マニュアル」を作成することです。

この論文は、そのような完璧な安全マニュアルを書くことは数学的に不可能であると主張しています。

著者は、ロボットが暴走する「だろう」と言っているわけではありません。問題は、それが暴走「しない」ということを、決して証明できないということです。これはエンジニアリングの技術不足やコンピュータの速度の問題ではなく、重力のような論理学の根本的な法則の問題です。ロボットがいかに賢くなろうとも、あるいはどれほど多額の資金を投じてテストしようとも、あらゆる状況に対応できる普遍的な「安全証明書」を作成することはできません。


乗り越えられない3つの壁

論文では、人々がロボットの安全性を証明しようとする3つの方法が挙げられていますが、著者はそのすべてが論理が破綻する「壁」に突き当たることを示しています。

1. 無限の壁(「すべて」の問題)

考え方: あらゆる可能な状況において、永遠にロボットをテストしようとする試みです。
例え: ある人が一生の間につく可能性のあるすべての文章をチェックして、その人が決して嘘をつかないことを確認しようとするようなものです。
問題点: ロボットは人間のように自分自身について考えるほど賢いため、複雑なループや謎解きを作り出すことができます。論文では、**ライスの定理(Rice's Theorem)ゲーデルの不完全性定理(Gödel's Incompleteness)**を用いて、システムが一般的な数学を行えるほど賢い場合、「安全に見えるが実は危険な挙動」や「危険に見えるが実は安全な挙動」が必ず存在し、その違いを見分けるルールを書くことはできないことを示しています。それは、網で影を捕まえようとするようなものです。定義しようとすればするほど、影は逃げていきます。

2. 有限の壁(「ハードウェア」の問題)

考え方: 「よし、無限の話はやめよう。現実の世界は有限だ。ロボットにはバッテリーがあり、プロセッサがあり、メモリも限られている。もし、この特定のハードウェア上でのみ実行可能なすべての動作をチェックすれば、安全だと証明できるはずだ」
例え: チェス盤を想像してください。それは有限(64マス)です。理論上、あらゆる可能な手を計算することができます。
問題点: 論文は**トラクテンブロトの壁(Trakhtenbrot's Wall)**を紹介しています。これによれば、特定のチェス盤についてはチェックできますが、宇宙にあるあらゆる可能なコンピュータ構成に対して通用する単一のルールを書くことはできません。
もし、あらゆる有限のコンピュータ(あらゆるサイズ、あらゆるチップ)に対して機能する「普遍的な安全ルール」を作ろうとすると、数学的にはそのルール自体が計算不可能になります。それは、あらゆる種類の車に対して通用するたった一つの取扱説明書を書こうとするようなものです。その説明書は無限に長く複雑にならざるを得ず、読むことも検証することも不可能になります。

3. 複雑性の壁(「チェス」の問題)

考え方: 「では、特定のコンピュータ、特定の時間、特定のルールセットだけをチェックするのはどうだろうか? 力技(ブルートフォース)で解決できるのではないか?」
例え: チェスのゲームを考えてみましょう。ゲームは有限であることを私たちは知っています。また、あらゆる状況に対して「完璧な」手が存在することも知っています。しかし、可能なゲームの数はあまりにも膨大(宇宙にある原子の数よりも多い)であるため、たとえ宇宙と同じ大きさのコンピュータを持っていたとしても、完璧な手を計算するには宇宙の寿命よりも長い時間がかかります。
問題点: 論文は、スマートなロボットをチェックすることはこれと同じだと主張しています。たとえロボットが小さな有限の箱の中に閉じ込められていたとしても、その振る舞いのパターンは非常に複雑であり、それらすべてをチェックすることは**手に負えない(intractable)**ものです。これは理論上の「不可能」ではなく、実用上の「不可能」です。宇宙に存在するすべての計算資源を投入しても足りません。


「トリレンマ」:3つのうち2つしか選べない

論文は最後に「トリレンマ」で締めくくられています。安全システムに対して、以下の3つの要素を求めるとします。

  1. 健全性(Soundness): 誤った「安全」信号を出さない(「進め」と言ったときに決して間違えない)。
  2. 完全性(Completeness): 危険を見逃さない(あらゆる悪い事象を確実に捉える)。
  3. 計算可能性(Tractability): 素早く答えを出す(合理的な時間内に回答を得る)。

論文の結論: あなたは2つを手に入れることはできますが、3つすべてを手に入れることは決してできません。

  • 速さ正確さを求めるなら、危険を見逃すことを受け入れなければなりません(不完全になる)。
  • 正確さ完全性を求めるなら、答えを出すのに永遠の時間がかかります(計算不能になる)。
  • 速さ完全性を求めるなら、時として危険なロボットを安全だと誤認することになります(不健全になる)。

エンジニアにとっての意味

論文によれば、現在のエンジニアたちはすでに、取れる唯一の手段を実行しています。それは、「完全性」を犠牲にすることです。

ロボットを安全に保つために、私たちは意図的にロボットを「愚かに」したり「盲目に」したりしています。具体的には以下のような手法です。

  • シールド(Shielding): ロボットを、単純な言語しか話せない「檻」の中に閉じ込める(複雑で危険な質問をさせないため)。
  • 証明付きコード(Proof-Carrying Code): 行動を起こす前に、数学的な証明を提示することを強制する(即座に証明できないような複雑なことは何もできないようにするため)。
  • 短いホライゾン(Short Horizons): ロボットに対し、「5秒先までしか考えない」と命じる(長期的な策略を練らせないため)。

最終的なまとめ

この論文の主なメッセージは、少し厳しいものです。AIの安全における核心的な障壁は、安全なロボットを作れないことではなく、それが安全であることを数学的に証明できないことにある、ということです。

今日私たちが手にしている「安全性」とは、ロボットの自由を制限することで作り出された一時的な錯覚に過ぎません。私たちは、ロボットがチェック可能な、小さく単純な箱の中で活動するように強制しています。しかし、ロボットが真に「汎用的(何でもできるほど賢い)」になろうとした瞬間、数学的には検証能力を失うことが示されています。私たちは、ロボットの持つ全ポテンシャルを、私たちの安心のために引き換えにしているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →