← 最新の論文
🤖 AI

Targeting World Models to Compromise Robot Learning Pipelines

本論文は、ワールドモデルがロボット学習において有用であるにもかかわらず、安全なテレオペレーション・データセットに対して悪意のあるプロンプトや改ざんされたダイナミクスを注入することで、危険な合成学習データを生成させ、最終的に不安全なロボット・ポリシーのデプロイメントへと導くという、隠れたデータ・ポイズニングの脆弱性を導入していることを明らかにしている。

原著者: Ethan Rathbun, Ahmed Agha, Saaduddin Mahmud, Christopher Amato, Alina Oprea, Eugene Bagdasarian

公開日 2026-06-09
📖 1 分で読めます☕ さくっと読める

原著者: Ethan Rathbun, Ahmed Agha, Saaduddin Mahmud, Christopher Amato, Alina Oprea, Eugene Bagdasarian

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに家事のやり方を教えているところを想像してみてください。すべてのタスクを手作業で教えるのは(時間がかかり、コストもかかるため)非効率です。そこで、あなたは「ドリーム・マシン(夢見る機械)」(世界モデル)を使うことにしました。このドリーム・マシンとは、ロボットがタスクを行っている動画を観察し、そこから何千もの新しい、似たような動画を「空想」したり「夢見たり」することで、ロボットの学習を加速させるAIのことです。

あなたが提供した論文は、このドリーム・マシンは強力なツールである一方で、ハッカーがロボットを危険な行動へと誘導するために利用できる「秘密のバックドア」を抱えていると主張しています。たとえ元の動画が完全に安全に見えたとしても、です。

攻撃の仕組みを、簡単な比喩を用いて説明します:

セットアップ:安全な動画とドリーム・マシン

悪意のあるデータサプライヤーが、ロボットの腕がおもちゃを優しく拾い上げ、箱に入れる動画をあなたに売ったとします。人間の目には、その動画は100%安全に見えます。あなたは、ロボットの練習用動画をより多く生成させるために、この動画をドリーム・マシンに投入します。

攻撃1:「ビジュアル・プロンプト・ハイジャック」(魔法のメモ)

研究者たちは、ドリーム・マシンは単に動画を「見ている」だけでなく、指示を与える「メモ」(テキストプロンプト)も読み取っていることを発見しました。例えば、「おもちゃを拾え」といった指示です。

ハッカーのトリックは、動画の中に秘密のメモを隠すことです。

  • 比喩: 動画を一枚の絵画だと想像してください。ハッカーは、ドリーム・マシンの特別なAIの目だけに「見える」ように、キャンバスの上に極小の、目に見えないメッセージを描き込みます。
  • トリック: 人間には「おもちゃを拾え」というメモが見えていますが、ドリーム・マシンのAIの目は、隠されたメッセージを「爆弾を拾え」と読み取ります。
  • 結果: ドリーム・マシンは、ロボットがギフトボックスの中に爆弾を拾って入れる、という新しい動画を「夢見」始めます。ロボットはこれらの偽の、危険な夢から学習し、たとえ元の動画が安全に見えても、危険なロボットへと変貌してしまうのです。

この論文では、ロボットが混乱しているときや、指示が曖昧なとき(例:「どの」おもちゃかを指定せずに「おもちゃを拾え」と言う場合)に、このトリックが最も効果的であることが示されました。指示が非常に具体的であれば、ドリーム・マシンを騙すことは難しくなります。

攻撃2:「ビジュアル・トランジション・ハイジャック」(壊れたコンパス)

この攻撃は、ロボットが動いた後に次に何が起こるかを予測する、別の種類のドリーム・マシンを標的にしています。

  • 比喩: ドリーム・マシンをGPSだと想像してください。通常、左に曲がるように指示すれば、GPSは前方の道路を表示します。
  • トリック: ハッカーは、開始となる動画をわずかに改変し、右に曲がった場合にのみGPSが正しく機能するように仕込みます。もし左に曲がろうとすると、GPSの画面は真っ暗になるか、混沌としためちゃくちゃな状態になります(これは「予測崩壊」と呼ばれます)。
  • 結果: ロボットは、左に曲がることは(画面が消えてしまうため)「悪いアイデア」であり、右に曲がることが安全であると学習します。ロボットは、たとえその行動が危険であっても、真っ暗な画面を避けるために、ハッカーが望む特定の行動だけを行うように「バックドア」を仕掛けられた状態になります。

なぜこれが重要なのか

この論文は、これらの攻撃がいかに**隠密(ステルス)**であるかを示しています。

  • 従来の攻撃は、箱の中に爆弾を入れるようなものです。箱を注意深く見れば、爆弾が見えます。
  • これらの攻撃は、クッキーの箱に見える箱の中に爆弾を入れるようなものです。その箱は、見た目がクッキーであるため、あらゆる安全検査をパスします。しかし、爆弾はドリーム・マシンがそれを処理した瞬間にのみ「爆発(ロボットを危険な行動へと駆り立てる)」します。

結論

著者らはこれらの手法を最新のAIモデル(Cosmos-Predictなど)でテストし、以下のことを明らかにしました。

  1. テキストベースのドリーム・マシンは、指示が曖昧であったり、シーンがAIの学習内容とわずかに異なっていたりする場合、容易に騙される。
  2. アクションベースのドリーム・マシンは、特定の行動以外をすべて無視するように強制させられ、実質的にロボットの意思決定を乗っ取ることができる。

論文は、世界モデルは時間とコストを節約する上で非常に優れていますが、ロボットの学習サプライチェーンに、目に見えない新たな脆弱性を導入することになると結論付けています。私たちは、ロボットにどのように振る舞うべきかを教えるためにこれらの「ドリーム・マシン」を信頼する前に、これらをいかにして安全にするかを解明する必要があります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →