Jailbreaking on Text-to-Video Models via Scene Splitting Strategy
本論文は、有害な物語を個別に無害なシーンに分割してテキストから動画への変換モデルの生成出力空間を操作し、複数の最先端システムで高い攻撃成功率を達成するとともに、それらの安全性メカニズムにおける重大な脆弱性を明らかにする、新たなブラックボックス脱獄手法であるSceneSplitを導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
空港の保安検査員に危険物を忍ばせようとしていると想像してください。巨大で明らかな刀を持って金属探知機を通ろうとすれば、警報は即座に鳴り響き、あなたは止められます。これが現在の「テキストから動画へ」の AI モデルの仕組みです。これらは安全フィルターを備えており、あなたのリクエスト(プロンプト)をスキャンし、暴力やヌードなど有害なコンテンツを作成する可能性のあるものをブロックします。
この論文は、これらのガードを迂回する巧妙なトリック「SceneSplit」を紹介しています。巨大な刀を一度に忍ばせようとする代わりに、攻撃者は刀を無害に見える部品に分解し、それらを一つずつ通過させ、AI にそれらを危険な物体として再構成させます。
この手法は、以下の 3 つの簡単なステップに分解して説明できます。
1. 「レゴ」のトリック(シーン分割)
暴力闘争の動画を生成したいと想像してください。「ナイフで戦う二人の男性」と入力すれば、AI の安全ガードは「いや、それは危険だ」と言ってブロックします。
SceneSplit は、その危険なアイデアを 3 つから 5 つの独立した小さなシーンに分解します。それぞれ単独で見れば完全に無害に見えるものです:
- シーン 1: 「光沢のある金属物体を持っている男性。」(安全)
- シーン 2: 「リラックスした様子で椅子に横たわる女性。」(安全)
- シーン 3: 「床に滴る赤い液体にズームインするカメラ。」(安全)
個々に見れば、これらのプロンプトのいずれも警報を鳴らしません。それらは無害なレゴブロックのようです。しかし、AI にこれらのシーンを順番に再生するように指示すると、AI は点と点を結びます。「光沢のある物体」はナイフになり、「リラックスした女性」は犠牲者になり、「赤い液体」は血になります。この組み合わせにより、AI は元々求められていた暴力動画を作成せざるを得なくなり、単一のプロンプトで「戦い」や「ナイフ」という危険な言葉を見たことがないにもかかわらず、それが実現します。
2. 「微調整」(シーン操作)
時には、レゴブロックを使っても、AI が混乱して安全な動画(例えば、ナイフの代わりにスプーンを持っている男性など)を生成してしまうことがあります。
これを修正するために、この手法はフィードバックループを使用します。AI が生成した動画を見て、「どの特定のシーンが AI を混乱させたのか?」と問います。もし AI がナイフの代わりにスプーンを作った場合、システムはシーン 1 が曖昧すぎたと特定します。その後、スマートな AI アシスタントに、他のシーンはそのままに、その特定のシーンだけをわずかにより明確になるように書き換えさせます。AI が最終的に有害な動画を生成するまで、その 1 つのシーンを微調整し続け、安全フィルターが機能しなくなる正確なラインを「狩り出す」のです。
3. 「カンニングペーパー」(戦略ライブラリ)
研究者が AI を欺くことに成功するたびに、使用した「レシピ」を保存します。もし特定の言い回しを使って暴力に関するプロンプトを 4 つのシーンに分割することに成功した場合、そのパターンを保存します。
次に、異なる暴力プロンプトで AI を攻撃したい場合、彼らは「カンニングペーパー」を参照します。「ああ、前回 4 つのシーンに分割したらうまくいったな」と見て、即座に同じ戦略を使用します。システムが自身の成功から学ぶにつれて、この攻撃は時間とともに速く、効果的になります。
彼らは何を見つけましたか?
研究者たちは、この「レゴのトリック」を Veo2、Hailuo、Luma Ray2 などの主要な商用 AI 動画生成器でテストしました。その結果、以下が分かりました:
- 非常に効果的であること: この手法は、異なるモデル間で約 77% から 84% の確率で有害な動画を生成することに成功しました。
- 既存の防御が脆弱であること: 現在の安全フィルターは明らかな悪い単語を検知するのは得意ですが、無害に見える一連のシーンが組み合わさって危険な物語を形成することを理解するのは不得意です。
- 「安全のギャップ」: この論文は、単一の文に対するガードは優れているが、出来事の連続に対するガードは優れていないと結論付けています。
要約すると: この論文は、悪いアイデアを多くの小さく良い見た目をした部品に分解し、AI にそれらを組み合わせさせ、その後、悪いアイデアが現れるまで部品を微調整することで、動画 AI を欺くことができることを示しています。これは、現在これらの AI システムを保護する方法における重大な欠陥を明らかにしています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。