← 最新の論文
⚡ electrical engineering

An Omitted Mode Is a Rare Rule: The Sampling-Verification Danger Law in Continuous Code World Models

本論文は、連続的なコード・ワールドモデルにおいて、サンプリングによる検証のみに基づいてLLMが合成したプランナーを受け入れることは、極めて危険であるほど不十分であることを示しており、なぜならそれはしばしば決定的な不連続モードを見落とし、ランダムなサンプリングではなく標的を絞った介入を通じてのみ確実に特定できる壊滅的なプランニングの失敗を招くからである。

原著者: Javier Aguilar Martín

公開日 2026-08-19
📖 1 分で読めます☕ さくっと読める

原著者: Javier Aguilar Martín

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代の人工知能の世界において、ロボットや自動運転車のような物理的なシステムを制御する方法を機械に教えるための一般的な戦略は、機械にまず世界の仕組みに関する「心の地図」を構築させることです。この地図は「世界モデル」とも呼ばれ、特定の行動をとった場合に次に何が起こるかを予測するものです。この地図を手に入れたら、機械はプランニング・アルゴリズムを用いて何千もの可能な未来をシミュレーションし、最善の結果につながる一連の行動を探し出します。長らく、この心の地図が学習したデータに対して十分に正確であれば、プランニングに使用しても安全であるという仮定が置かれてきました。もし地図が千回のテスト走行で未来を正しく予測できるなら、それは信頼できるガイドであると見なされるのです。

しかし、ある新しい研究は、世界の中に、機械が学習中に一度も遭遇したことのない稀で突然の出来事が存在する場合に何が起こるかを検証することで、この仮定に異を唱えています。例えば、滑らかな道を走行するように学習したが、壁を見たことがない車を想像してみてください。もしその壁が非常に稀であり、車の学習中に一度も衝突することがなかった場合、機械の心の地図はその壁の存在を単に無視し、道が永遠に続いていると想定してしまうかもしれません。危険なのは、機械が実際に現実世界で走行しようとしたとき、その見えない壁を通り抜けられると信じて、壁に向かって真っ直ぐ進む経路を計画してしまう可能性があることです。研究者が問いかけたのは、標準的な安全チェック(機械の地図を世界のランダムなサンプルに対してテストするもの)が、この種の「盲目」をクラッシュを引き起こす前に捉えられるかどうかでした。

研究者たちは、この問いに答えるために、カートがトラック上を動いたり、振り子が揺れたりするような単純な物理シミュレーションを用いた、一連の制御された実験を設定しました。これらのシミュレーションでは、「ハードストップ」という「稀なルール」を導入しました。これは、物体が触れた瞬間にその動きを停止させる壁や床のようなものです。彼らは大規模言語モデルに機械の心の地図となるコードを書かせましたが、その際、この壁の存在をモデルの学習データから意図的に隠しました。モデルには、壁を回避することになったカートや振り子のランダムな動きだけが示されました。壁は稀であったため、モデルは学習中にその壁を目にすることがほとんどありませんでした。

結果は衝撃的なものでした。研究者が標準的な安全チェック(モデルを数千のランダムなシナリオに通して、実際の物理法則と一致するかを確認する手法)を用いてモデルをテストしたところ、モデルは頻繁に合格しました。ランダムな数千回のテストにおいて壁がトリガーされなかったため、モデルは「正しい」と受け入れられたのです。しかし、これらの「検証済み」のモデルがシステムを制御するためのプランナーに渡されると、プランナーは自信を持ってカートや振り子を隠れた壁へと誘導してしまいました。壁という概念を持たないモデルは、物体がそこを通り抜けると予測してしまうのです。この誤った予測を信じたプランナーは、物体を壁に突っ込ませ、物体はそこで動けなくなります。こうして機械は目標に到達できなくなり、成功の可能性をほぼすべて失うことになります。この研究は、この失敗が計算ミスではなく、知識の根本的な欠落によるものであることを明らかにしました。モデルは、存在しているがサンプリングされなかったルールに対して盲目だったのです。

研究者たちは、この災厄が発生する確率が、希少性に基づいた精密な数学的パターンに従っていることを発見しました。もし危険なイベントが100回のランダム試行のうち1回発生する場合、安全チェックが100回の試行を行うと、そのイベントを見逃す可能性が十分にあります。チェックを1000回行えば、見逃す確率は下がりますが、決してゼロにはなりません。研究は、学習データにその稀なイベントが含まれていない限り、いかなる巧妙なプランニングやモデルの改良を用いても、それを発見することはできないと証明しました。モデルは盲目のままであり、安全チェックは、その性質上、ランダム・サンプリングを用いている以上、その盲点が見つかったことを保証できないのです。

また、研究では、学習中に壁を見せられた場合に機械がそのルールを学習できるかどうかも調査されました。カートが直線的に動くような単純な一次元的なタスクにおいては、答えは驚くほどポジティブなものでした。モデルにカートが壁に当たる例をわずかでも示せば、大規模言語モデルは壁を止めるための正確なコードを記述することができ、事実上、心の地図を「修復」できました。モデルはルールを完璧に学習したのです。しかし、研究者がこれを、平らな面上の円形のパッチ(円形の領域)という二次元的な環境へと移行させると、状況は一変しました。このケースでは、たとえモデルに壁がパッチに当たる例を見せたとしても、証拠から境界の形状や位置を推論することに失敗しました。モデルは、見せられた証拠から正しい円形のルールを導き出す代わりに、直線や正方形といった誤った形状を捏造したり、あるいはなぜそうなるのかを理解しないまま物体を静止させたりしました。モデルは、いくつかの例から、障害物の完全な形状を推論することができなかったのです。

この発見は、これらのシステムがどのように学習するかにおける決定的な限界を浮き彫りにしています。研究は、機械が単純な文脈において明示的に教えられたり示されたりしたルールを翻訳することには優れている一方で、散在する証拠から複雑なルールの形状や位置を推論することには苦慮することを示しました。機械の「自己修復」能力は、問題の幾何学的な性質に大きく依存します。単純なケースでは機能しますが、複雑な二次元のケースでは失敗します。研究者は、モデルに例をもっと多く与える、思考プロセスを変える、あるいは障害物の形状に関するヒントを与えるといった、モデルを助けるための様々な介入を試みました。しかし、これらはいずれも効果がありませんでした。モデルは、二次元のパッチに対する正しいルールを導き出すことに一貫して失敗し、代わりに、より単純で誤った形状を代用してしまいました。

この研究の含意は、AIによる物理システムの制御に依拠しているすべての人にとって極めて重要です。これは、ランダム・サンプリングに基づく安全チェックは、稀ではあるが壊滅的な失敗を捉えるには不十分であることを示唆しています。モデルは与えられたすべてのテストに合格しても、なお、特定の稀なイベントに対して危険なほど間違っている可能性があります。本研究は、もし危険なイベントがサンプリング・プロセスによって見逃されるほど稀であれば、モデルはその事象に対して盲目のままであり、プランナーはその盲性を利用して失敗へと導くことを証明しています。安全を確保する唯一の方法は、学習データがこれら稀なイベントの境界をカバーしていることを保証するか、あるいはランダムな偶然に頼らない別の種類の検証を用いることです。研究の結論は、AIはデータから学ぶことは驚くほど得意であるが、見たことがないものを学ぶことはできないということであり、物理的な世界においては、見たことがないものこそが最も大きな被害をもたらすものになり得るのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →