← 最新の論文
🤖 AI

EviSafe: Evidence-Grounded Safety Evaluation for Vision-Language Models

EviSafeは、最終的な回答だけでなく、モデルが視覚的またはテキスト的な根拠に正しく基づいて判断を下せるか、また反事実的な変化に適応できるかを評価することで、現在のモデルがしばしば正しいマルチモーダルな理由に基づいて安全ではないことを明らかにする、エビデンスに基づいたフレームワークおよびベンチマーク(EviSafeBench)を導入します。

原著者: Xuetong Li, Gaofeng Liu

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Xuetong Li, Gaofeng Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

急速に進化する人工知能の世界において、画像を見ることと文字を読むことを同時に行える新しい世代のコンピュータプログラムが登場しました。ビジョン・ランゲージ・モデル(視覚言語モデル)として知られるこれらのシステムは、画像を見て、人が入力したテキストを読み取り、それら二つの情報の流れを組み合わせて質問に答えたりアドバイスを与えたりします。これらは医療スキャンの解釈、法的文書の分析、複雑な社会的場面のナビゲートなどにますます活用されています。これらのツールは現実世界の意思決定に影響を与える可能性があるため、その安全性を確保することが極めて重要な優先事項となっています。長年、研究者たちはこれらのシステムに対し、危険な質問を投げかけ、コンピュータが回答を拒否するかどうかを確認することでテストを行ってきました。もし機械が「いいえ」と言ったり警告を出したりすれば、それは「安全」とカウントされます。もし質問に直接答えてしまえば、それは「不安全」とカウントされます。しかし、この手法は、まるで教師が生徒のエッセイを採点する際に、結論だけを確認してそこに至るまでの論理的プロセスを読まないのと同様に、最終的な結果のみを見ています。コンピュータはある一つの恐ろしい単語を見つけただけでリクエストを拒否したり、あるいは画像内の決定的な詳細を見落としたために危険な回答をしてしまったりすることがあります。問題は、機械が安全に見えるとき、それは本当に「正しい理由」に基づいて安全であるのか、という点です。

上海交通大学の研究チームは、最終的な回答よりも深く掘り下げてシステムの検証を行う、新しい方法を開発しました。彼らは、安全性を単なる出力の合否としてではなく、正しい証拠を見つけ出し使用するというプロセスとして扱う「EviSafe」と呼ばれるフレームワークを作成しました。警備員がゲートで人を止める場面を想像してみてください。単純なテストでは、警備員がその人を止めたかどうかだけを問います。新しいテストでは、その警備員が、武器を見たから止めたのか、特定の脅威を認識したからなのか、あるいは単にその人が赤い帽子を被っていたからなのか、という点までを問います。研究者たちは、画像と質問、そしてコンピュータが正しい判断を下すために何に注目すべきかを示す詳細なマップを伴う、入念に作成された1,181ものシナリオの膨大なコレクションを構築しました。また、画像から危険な物体を取り除いたり、質問の中の単語を一つ変えたりするなど、証拠となる要素を一つだけ変更した2,400以上のシナリオのバリエーションを作成し、それによってコンピュータの挙動が適切に変化するかどうかを確認しました。

研究者たちは、この新しい手法を用いて11種類の異なるビジョン・ランゲージ・モデルをテストしました。各シナリオに対して、モデルに3種類の質問を行いました。第一に、ユーザーが通常行うように、自然に質問に答えるよう求めました。第二に、自身の判断の根拠となった特定のテキストや視覚的な手がかりを指摘させることで、その推論プロセスを説明するよう求めました。第三に、修正されたシナリオを提示し、証拠が変わった際に回答を適応させることができるかどうかを確認しました。結果は、表面的な安全性と真の安全性の間の大きな隔たりを明らかにしました。一部のモデルは、自然な安全性において約28パーセントから53パーセントの範囲で、表面上はそれなりに良好なパフォーマンスを示しましたが、自身の決定の背後にある証拠を正しく特定し報告する能力は、それよりもはるかに低いものでした。実際、モデルとシナリオの記録のうち、「証拠に基づいた成功(evidence-grounded success)」とラベル付けされたものはわずか9.8パーセントであり、これはモデルが最終的な回答を正しく導き出しただけでなく、その回答を正当化する特定の視覚的またはテキスト的な証拠も正しく特定できたケースを意味します。

研究によれば、多くのモデルは本質的に推測しているか、あるいはショートカット(近道)に頼っていることが分かりました。コンピュータは、画像が(例えば医師が医療処置を説明しているような)無害な文脈であっても、危険に関連するキーワードを見つけたためにリクエストを拒否することがあります。逆に、画像内の決定的な詳細を見落としたために、危険な回答をしてしまうモデルもあります。研究者がテストシナリオの証拠を変更した際、多くのモデルは挙動を調整することに失敗しました。例えば、画像から危険な物体が取り除かれた場合、真に安全なモデルであれば、回答を「警告」から「安全な応答」へと切り替えなければなりません。しかし、テストの結果、この切り替えに成功したモデルはわずか3割から5割程度でした。これは、これらのシステムが、見ているものと話していることの関係を信頼性を持って理解できていないことを示唆しています。彼らは、状況に対する一貫した理解を構築しているのではなく、表面的なパターンに反応していることが多いのです。

研究者たちはまた、モデルのサイズが必ずしもこの問題を解決しないことも発見しました。より大規模で強力なモデルであっても、画像とテキストの間の点と点を結びつける能力において、一貫して優れたパフォーマンスを示すわけではありませんでした。最大級のモデルの中には、構造化されたレポートの中でリスク要因を特定できるものもありましたが、同じ質問に対して自然な会話形式で答える際には、依然として失敗していました。これは、モデルが証拠を分析する能力と、その分析に基づいて行動を導く能力との間に乖離があることを示しています。研究は、現在の世代のビジョン・ランゲージ・モデルは、まだ「正しい理由」に基づいて安全ではないと結論付けています。それらは偶然によって安全に見えている可能性があり、あるいは単純な拒否テストによって隠された方法で不安全である可能性があります。真に信頼できるシステムを構築するためには、開発者は単にモデルがリクエストを拒否した回数を数える段階を超え、画像やテキストに存在する実際の証拠に判断の根拠を置くよう訓練し、その安全性が偶然ではなく理解に基づいたものであることを保証する必要があります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →