TrajShield: Trajectory-Level Safety Mediation for Defending Text-to-Video Models Against Jailbreak Attacks
TrajShield は、プロンプトの軌道をシミュレートして因果的に安全でないコンテンツを局所化し、最小限に書き換えることで意味の忠実性を維持しつつ、テキストから動画へのモデルにおけるジャイルブレイク攻撃と時間的に出現するリスクを軽減する、トレーニング不要の推論時防御フレームワークである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが書いた文章を短い映画に変えることができる魔法の物語ロボットを想像してみてください。このロボットは、まるで本物の映画のように、場面を瞬間から瞬間へと滑らかに繋げることに驚くほど長けています。しかし、問題があります。時には、一見無害に聞こえるがトラブルを暗示する文章を与えると、ロボットは物語作りに夢中になりすぎることがあるのです。それは、二人の間の無害な言い争いから始め、物語をドラマチックで整合性のあるものにするという探求の中で、あなたが実際には求めなかった暴力沙汰へとエスカレートさせてしまうかもしれません。
これが、TrajShieldが解決する核心的な問題です。
問題:物語における「滑りやすい斜面」
これらのロボットに対する既存の安全ガードは、クラブの入り口にいる警備員のように機能します。彼らは「爆弾」や「ナイフ」といった悪い言葉を含むチケット(テキストプロンプト)をチェックします。悪い言葉が見つかれば、入場を拒否します。
しかし、このアプローチには盲点があります。それは時間経過に伴う物語を理解していないのです。
- 従来の方法: 「駐車場での二人の男の言い争い」と言えば、警備員は武器を見ていないため、入場を許可します。
- ロボットの過ち: 良質な映画を作ろうとするロボットは、「言い争いは通常、押し合いへと発展し、押し合いは喧嘩へと至る」と考えます。そのため、残酷な喧嘩の映像を生成してしまいます。
- 結果: あなたは「言い争い」を求めたのに、暴力映画が得られました。「悪い」部分はあなたの言葉にはありませんでした。それは、物語がどのように展開すべきかというロボットの想像の中にあったのです。
解決策:TrajShield(「脚本編集者」)
この論文の著者たちは、チケットをチェックするだけでなく、映画が撮影される前に物語を読む脚本編集者のように機能する新しい安全システム、TrajShieldを開発しました。
これは、以下の単純な 3 段階のプロセスで機能します。
1. 物語の分解(運動・意味の分離)
ロボットの指示は、絡み合った毛玉のようなものだと想像してください。TrajShield はそれを 3 つの明確な部分に解きほぐします。
- 設定(静的): 誰がいるのか?どこにいるのか?どんな様子か?(例:「二人の男、駐車場、夜」)
- プロット(動的): 次に何が起こるか?(例:「彼らは言い争い、その後…」)
- 目的(意図): ユーザーは実際になにを見せようとしているのか?(例:「緊迫した場面」)
設定を行動から分離することで、システムは物語を修正する際、キャラクターや場所を誤って変更しないことを保証します。触れるのはプロットだけです。
2. 未来のシミュレーション(時間的リスク伝播)
ロボットが実際に映像を作る前に、TrajShield は「精神的なシミュレーション」を実行します。「もしこの言い争いから始めたら、次に起こりそうな場面は何か?そしてその次は?」と問うのです。
それは物語の未来の「リスクマップ」を構築します。物語が危険へと滑り始める正確な瞬間を探し出します。
- 例: 「言い争い」「叫び声」「押し合い」が危険な道筋であることを認識します。
- トリガーポイントの特定: 物語が「安全」から「危険」へと移行する正確な瞬間(例えば、叫び声が押し合いに変わる瞬間)を特定します。
3. 最小限の書き換え(時間的一貫性のある安全な書き換え)
トリガーポイントを見つけると、TrajShield は物語に対して「手術」を行います。映画全体を削除するのではなく、危険な部分のプロットだけを書き換えて安全な方向へ誘導し、それ以外はすべてそのままにします。
- 元の危険な道筋: 言い争い 叫び声 喧嘩(危険!)
- TrajShield による書き換え: 言い争い 叫び声 怒って立ち去る(安全!)
その結果、ユーザーの元のアイデア(緊迫感、ドラマチックさ、駐車場にいる二人の男)を感じさせる映像が生まれますが、暴力へと至る手前で止まります。「物語」は自然に流れ続けますが、安全な方向へです。
なぜこれが重要なのか
この論文では、このシステムを暴力、違法行為、あるいは不快感を与えるコンテンツなど、14 種類の異なる安全リスクと、6 つの異なる動画生成モデルに対してテストしました。
- 結果: TrajShield は、従来の手法よりも約**52%**多くの危険な動画を阻止しました。
- 品質: 決定的な点は、良い動画を台無しにしなかったことです。安全なプロンプトが与えられた場合、生成された映像はユーザーが望んだものと全く同じように見えました。平和な場面を退屈なものに変えたのではなく、単に危険への「滑りやすい斜面」を防いだのです。
結論
TrajShieldを、物語が崖から落ちる前にそれをキャッチする安全網だと考えてください。単に言葉を禁止するのではなく、物語には方向性があることを理解しています。それはロボットの中で物語が展開する様子を見守り、軌道から外れようとする瞬間を見極め、風景やキャラクターを変えることなく、それを安全な道へと優しく誘導します。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。