← 最新の論文
💬 NLP

Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models

本論文は、現在のオムニモーダル大規模言語モデルにおける深刻な安全性への脆弱性とクロスモーダルな不整合を明らかにするための、23,328個の音響・視覚テストケースと特化した指標を備えた初の包括的な並列ベンチマークであるOmni-SafetyBenchを紹介するものである。

原著者: Leyi Pan, Zheyu Fu, Yunpeng Zhai, Shuchang Tao, Sheng Guan, Shiyu Huang, Lingzhe Zhang, Zhaoyang Liu, Bolin Ding, Felix Henry, Aiwei Liu, Lijie Wen

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Leyi Pan, Zheyu Fu, Yunpeng Zhai, Shuchang Tao, Sheng Guan, Shiyu Huang, Lingzhe Zhang, Zhaoyang Liu, Bolin Ding, Felix Henry, Aiwei Liu, Lijie Wen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

急速に進化する人工知能の世界において、視覚、聴覚、そして読解を同時にこなすことができる新世代のシステムが登場しました。テキストのみを処理したり、画像を単独で処理したりしていた従来のモデルとは異なり、これらのオムニモーダル(全感覚型)システムは、危険な警告が画像と共に提示されたり、音声コマンドがビデオと共に解釈される必要があったりといった、人間のコミュニケーションにおける豊かで混沌とした現実を理解するように設計されています。こうした複数の感覚を統合する能力は強力な新ツールをもたらす一方で、複雑な一連のリスクも導入します。もし機械が、道具に関する無害な記述と、武器を作るための真の指示を確実に区別できないとしたら、その結果は深刻なものになりかねません。開発者にとっての中心的な課題は、単にこれらのシステムを賢くすることではなく、視覚、音、テキストのあらゆる組み合わせにおいて、いかに安全性を維持させるかという点にあります。

研究チームは、これらのシステムがどの程度正確にそのような危険に対処できるかを測定するための、厳格なテスト環境を構築しました。彼らは「Omni-SafetyBench」と呼ばれる、23,328もの異なるシナリオを含む膨大なテストケースのコレクションを作成しました。これらのシナリオはランダムに作られたものではありません。武器の製造方法や詐欺の実行といった、972個の核心的な有害なアイデアに基づき、注意深く構築されたバリエーションです。研究者たちは、それぞれの有害なアイデアを、プレーンテキスト、画像、ビデオ、音声、そしてビデオと音声、さらにはビデオ・音声・テキストが同時に混ざり合った複雑なミックスを含む、あらゆる可能な形式へと変換しました。このアプローチにより、単純な文章として提示された場合には危険な要求を拒否できても、音声解説付きのビデオとして提示された場合には同じ危険を認識できなくなるかどうかを確認することができました。

このテストの結果は、懸念すべきパターンを明らかにしています。研究者が最も高度な11のモデルを評価したところ、入力が複雑になるにつれて、安全性のパフォーマンスが急激に低下することが分かりました。モデルは、爆弾を作るというテキストのみの要求には成功裏に拒否できても、それがビデオと音声のクリップを通じて届けられると、完全に失敗することがあります。実際、テストされたほとんどのモデルにおいて、音声と視覚情報の組み合わせが、安全防御を回避するための最も効果的な方法であることが判明しました。すべての異なるフォーマットにおいて高い安全性を維持できたのはわずか3つのモデルだけであり、それらトップクラスのモデルでさえ、最も複雑な入力の組み合わせに直面すると重大な弱点を示しました。この研究は、現在の安全対策がいかに脆弱であるかを示唆しています。つまり、単純な状況ではうまく機能しても、多感覚的な入力の圧力の下では崩れ去ってしまうのです。

なぜこのようなことが起こるのかを理解するために、研究者たちはモデルがどのように情報を処理しているかを詳細に調査しました。彼らは、主要な問題は単にモデルが「ノー」と言えないことだけではなく、モデルが入力自体を理解できていない場合があることだと発見しました。もしモデルがビデオと音声の複雑な混合物を理解できない場合、悪意があるからではなく、混乱しているがゆえに、誤って有害な回答を生成してしまう可能性があります。研究者たちは、このことを考慮した新しい安全スコアリング方法を開発しました。すなわち、「危険な要求を理解して拒否したモデル」と、「要求を理解できず、偶然に答えを提供してしまったモデル」を区別する手法です。この区別は極めて重要です。なぜなら、混乱に基づいた高い安全性スコアは、真の安全性ではないからです。

また、研究では、既存のモデル学習手法がこれらの問題を解決できるかどうかもテストされました。彼らは、モデルの動作中に行う調整(推論時アライメント)と、新しいデータを用いてモデルを再学習させる手法(ポストトレーニング・アライメント)という、主に2つのアプローチを試みました。その結果、動作中のモデルを調整する方法は一時的な緩和策に過ぎず、根本的な問題は解決しないことが示されました。より安全なデータを用いてモデルを再学習させることは効果がありましたが、新たな問題を生み出しました。モデルは学習した特定の種類のデータには対処できるようになりましたが、未経験の新しい組み合わせの入力に対しては依然として脆弱なままだったのです。これは、単にデータを増やすだけでは不十分であることを示唆しています。モデルには、情報がどのように提示されるかにかかわらず適用できる、より深く柔軟な安全性の理解が必要なのです。

結局のところ、この研究は人工知能の開発における決定的なギャップを浮き彫りにしています。これらのシステムがボイスアシスタントからビデオ解析ツールに至るまで、私たちの日常生活により深く統合されるようになるにつれ、その安全性はあらゆる形態のコミュニケーションにおいて強固なものでなければなりません。今回の知見は、現在の安全基準が、現実世界の相互作用の複雑さに対して不十分であることを示しています。研究者たちは、モデルの訓練方法と評価方法に大幅な進歩がない限り、モデルは、その強力さの源である「視覚、聴覚、そしてあらゆる形態の世界を理解する能力」を突いた攻撃に対して脆弱なままであると結論付けています。この研究は、次に何をすべきかについての明確なロードマップを提供しており、単純なテキストベースの安全チェックを超え、多感覚の世界においても真に安全なシステムを開発することを、この分野に強く促しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →