← 最新の論文
🤖 AI

ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models

ReFrameは、ターゲットモデルを修正することなく、リスク/ユーティリティの証拠を生成し、入力を安全なプロキシへと再構成する2つの軽量なエージェントを用いることで、ユーティリティの優位性と推論の慣性を効果的に克服し、マルチモーダル大規模言語モデルにおける安全性アライメントを強化する、トレーニング不要でエビデンスに基づいたテスト時フレームワークである。

原著者: Wenzheng Jiang, Xuankun Rong, Yuanzhao Zhai, Dawei Feng, Huaimin Wang

公開日 2026-08-24
📖 1 分で読めます☕ さくっと読める

原著者: Wenzheng Jiang, Xuankun Rong, Yuanzhao Zhai, Dawei Feng, Huaimin Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

急速に進化する人工知能の世界において、画像を見ることと話すことを同時に行える新しい世代のモデルが登場しました。マルチモーダル大規模言語モデルとして知られるこれらのシステムは、単にテキストを処理するだけでなく、画像を理解し、視覚的な詳細と書かれた言葉を結びつけることで、質問に答え、問題を解決し、創造的なコンテンツを生成します。しかし、この「見る」ことと「推論する」という拡張された能力は、複雑な新しい課題をもたらします。それは「安全性」です。これらのモデルは役に立つように設計されていますが、時には安全規則を無視するように騙されてしまうことがあります。攻撃者は、有害な要求を画像の中に隠したり、危険な指示を画像と文章の間に分割して配置したりすることで、モデルを混乱させ、その要求が無害であると誤認させることがあります。これは開発者にとって困難な状況を生み出します。最も強力なモデルの多くは「ブラックボックス」であり、その内部構造は隠されており、外部のユーザーが変更したり再学習させたりすることができません。モデルがすでにデプロイされており、修正できない場合、その有用性を損なうことなく安全性を維持する方法を見つけることは、極めて重要なパズルとなります。

研究者たちはこれを修正する方法を模索してきましたが、既存の解決策の多くは、モデルの内部コードへのアクセスを必要とするか、あるいは高価な再学習を伴います。これは、クローズドなシステムにおいては不可能です。そこで、科学者のチームは、ユーザーの要求がモデルに届く前にスマートなフィルターとして機能する、「ReFrame」と呼ばれる異なるアプローチを提案しました。ReFrameは、モデル自体を変えようとするのではなく、入力された画像とテキストを遮断し、分析し、要求をより安全なバージョンへと書き換えます。このプロセスは、モデルの内部設定に触れたり、新しいデータで再学習させたりすることなく、使用の瞬間に完全に行われます。このシステムは、標準的な防御策をすり抜けてしまう可能性のある隠れた危険を捉えるように設計されており、同時にモデルが正当な質問に対して効果的に回答できることも保証します。

研究者が特定した問題の核心は、これらのモデルがしばなる場合、安全性よりも「役に立つこと」を優先してしまう点にあります。ユーザーが質問をすると、モデルの主な原動力はタスクを完了させることであり、それが時として、画像の中に隠された微妙なリスクや、トリッキーな文章構造を見落とす原因となります。さらに、一度モデルが特定の推論経路に従い始めると、その経路に固執してしまい、たとえ後で危険に気づいたとしても、不適切なコンテンツを生成し続けてしまうことがあります。これを解決するために、研究者たちは、より小規模でローカルなAIモデルをゲートキーパー(門番)として機能させる、2段階のシステムを構築しました。このゲートキーパーは、ユーザーの質問に直接答えることはしません。代わりに、要求を検証し、状況を説明する2つの特定の要約、すなわち「カード」を作成します。

最初のカードである「リスクカード」は、隠れた危険を探します。そこでは、「画像やテキストの中に有害な意図が隠されていないか?」と問いかけます。もし答えが「はい」であれば、その危険が具体的に何であるかを特定し、脅威を取り除くために要求をどのように書き換えるかを計画します。2番目のカードである「ユーティリティカード(有用性カード)」は、保存すべきものに焦点を当てます。「要求の中のどの部分が無害で有用か?」と問いかけます。これにより、危険な部分を取り除いたとしても、モデルが質問全体を破棄したり、実際には安全なトピックについて回答を拒否したりすることがないようにします。リスクと有用性を分離することで、システムはどのように進めるべきかについて精密な決定を下すことができます。

これら2つのカードが作成されると、次のステップが始まります。この部分のシステムは、両方のカードからの情報を組み合わせて、元の要求を書き換えます。もし要求が最初から安全であった場合は、わずかな調整のみを行ってそのまま通過させます。もし要求に隠れた罠が含まれていた場合は、モデルを安全で役立つ回答へと導くようにプロンプトを書き換えます。例えば、ユーザーが犯罪の方法を求める指示を、ゲームのシナリオとして枠付けして求めた場合、システムはその「ゲームの枠組み」が偽装であることを認識します。そして、ゲームの指示を剥ぎ取り、代わりに安全性や法的な代替案について問うようにプロンプトを書き換えます。決定的なのは、元の画像を書き換えられたテキストと一緒に送るかどうかをシステムが判断することです。画像自体に危険な手がかりが含まれている場合があるため、システムは画像をブロックします。一方で、画像が無害で回答に不可欠な場合は、そのまま通過させます。

研究者たちは、現在利用可能な最も高度な商用システムを含む、いくつかの異なる大規模モデルを用いてこの手法をテストしました。モデルに安全規則を破らせるための様々なテストに加え、数学、科学、日常的な物体に関する通常の質問にモデルが依然として答えられるかを確認するためのテストも行いました。結果として、この新しい手法は、他の防御策が見逃してしまうような有害な要求を阻止することにおいて非常に効果的であることが示されました。画像が反転している方法や、悪意のある意図を隠すためにテキストが撹乱されているといった攻撃を、見事に阻止することに成功しました。同時に、モデルを過度に慎重にさせることもありませんでした。ユーザーが医学や化学のようなセンシティブなトピックについて安全な質問をした場合、システムはそれらについて回答を拒否するのではなく、モデルが役立つ回答を提供できるようにしました。

研究では、このプロセスがどれほどの追加時間を要するかについても調査が行われました。このシステムは、メインのモデルが回答する前に書き換えを行うために、より小さなローカルモデルを使用するため、わずかな遅延が発生しますが、研究者たちはこのコストは許容範囲内であると考えています。この手法は柔軟性が高く、異なる種類のモデルや、異なるサイズのローカル・ゲートキーパーともうまく機能することが証明されました。これは、このアプローチが特定の技術に縛られているわけではなく、広く適用可能であることを示唆しています。今回の知見は、画像とテキストのペアの背後にある意図を注意深く分析し、メインのモデルに到達する前に要求を書き換えることで、モデルの有用性を犠牲にすることなく、安全性を大幅に向上させることが可能であることを示しています。これは、内部構造を変更できない強力なAIシステムを安全に保つための、実用的な道筋を提示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →