Visual Token Compression Enhances Robustness of MLLMs
本論文は、不整合または分布外の視覚トークンを特定して除去することで、マルチモーダル大規模言語モデルのジェイルブレイク攻撃およびハルシネーションに対する堅牢性を高めると同時に、推論コストを削減する視覚的トークンプルーニング手法を提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
コンピュータが単に言葉を読み取るだけでなく、画像も「見て」、それらを組み合わせて質問に答えたり、物語を語ったり、問題を解決したりする世界を想像してみてください。これらはマルチモーダル大規模言語モデル(MLLM)と呼ばれます。これらは、図書館にあるすべての本を読み、写真を見て文脈を理解することもできる、非常に賢い学生のようなものだと考えてください。しかし、どんな学生とも同じように、彼らも混乱することがあります。トリッキーな写真を見せられたり、巧妙な質問をされたりすると、危険なことを言わせる(「ジェイルブレイク(脱獄)」)ことや、もっともらしく聞こえるけれど完全に間違った事実を作り上げる(「ハルシネーション(幻覚)」)ことに騙されてしまうことがあります。
なぜこのようなことが起こるのかを理解するには、これらのモデルがどのように情報を処理しているかを見る必要があります。彼らは画像を、デジタル的な小さな断片である「ビジュアルトークン」に細かく切り分け、それをテキストトークンと混ぜ合わせます。問題は、コンピュータの「目」と「耳」が必ずしも完璧に同じ言語を話しているわけではないことです。時には、あるビジュアルトークンがあまりにも場違いであったり、混乱を招くようなものであったりして、ラジオ信号のノイズ(雑音)のように機能することがあります。このノイズはモデルのバランスを崩し、攻撃に対して脆弱にしたり、偽の情報を夢想させたりする原因となります。科学者たちは以前から、このノイズを掃除することがモデルをより速くするだけでなく、より安全にすることにも繋がると知っていましたが、通常は単にコンピュータを高速化するためのものだと考えていました。
この論文では、ビジュアルトークン圧縮、具体的にはOOD-VTP(Out-of-Distribution Visual Token Pruning:分布外ビジュアルトークン・プルーニング)と呼ばれる巧妙なトリックを紹介しています。研究者たちは、テキストとうまく噛み合わない「奇妙な」ビジュアルトークンを特定して取り除くことで、モデルが実際により強固になり、嘘をつく可能性が低くなることを発見しました。それはまるで、場にふさわしくない騒々しい客を追い出し、パーティーを安全で秩序ある状態に保つクラブの用心棒のようなものです。この研究は、これが単なる理論ではないことを示しています。7つの異なる人気のあるベンチマークでテストした結果、モデルはより騙されにくくなり、精度も向上し、さらに高速に動作しました。
騒がしい部屋の物語
あなたが、友人たち(テキスト)が真剣な会話をしている、巨大で騒がしい部屋の中にいると想像してください。突然、大勢の赤の他人(ビジュアルトークン)が押し寄せてきました。ほとんどのストレンジャーは役に立ちます。彼らは軽食を持ってきたリ、会話の内容に一致するものを指し示してくれます。しかし、数人のいたずらっ子が紛れ込んでいます。彼らはマスクを被っていたり、意味不明なことを叫んでいたり、会話と全く噛み合わない看板を掲げていたりします。
AIの世界において、これらのいたずらっ子は不整合なビジュアルトークンです。コンピュータの視覚システムと言語システムが完全に同期していないため、これらのトークンは**OOD(Out-of-Distribution:分布外)**の入力として機能します。簡単に言えば、彼らは「場違い」なのです。AIがこれらを処理しようとすると、混乱が生じます。この混乱こそが、ハッカーがAIを「ジェイルブレイク(脱獄)」させる(AIに安全ルールを無視させるよう騙す)ことを可能にし、あるいはAIに「ハルシネーション(幻覚)」を引き起こす(事実を捏造させる)原因となるのです。
用心棒の戦略
この論文の著者たちは、従来のメソッドが、ランダムにトークンを削除したり、単に「冗長な(=声の小さい人)」トークンを削除したりすることでAIを高速化しようとしていたことに気づきました。しかし、彼らはそのような方法ではAIを安全にすることはできないと発見しました。実際には、時には状況を悪化させてしまうことさえあります!
彼らの新しい手法であるOOD-VTPは、非常に賢い用心棒のように機能します。その仕組みは以下の通りです。
- 距離の測定: 用心棒は、すべてのビジュアルトークン(画像のすべての断片)をチェックし、「この人物は会話からどれくらい離れているか?」と問いかけます。彼らは、ビジュアルトークンと「言語特徴空間(テキストトークンのグループ)」との間の距離を測定します。
- いたずらっ子の特定: テキストから最も離れているトークン、つまり全く同期していないトークンが、OODトークンとしてフラグを立てられます。これらがトラブルの原因となるものです。
- 完璧なタイミング: 研究者たちは、いつでも好きな時に人を追い出せるわけではないことも発見しました。そこには、特定の「ロバスト・プルーニング・レイヤー(頑健なプルーニング層)」(これは会話における特定の瞬間のようなものと考えてください)が存在し、そこで悪いトークンを取り除くのが最も効果的です。早すぎたり遅すぎたりすると効果はありませんが、適切なタイミング(彼らのテストにおけるレイヤー13や17など)で行うと、AIは突如として非常に強固になります。
結果:より安全に、より賢く、より速く
チームは、この用心棒戦略を2つの人気のあるAIモデル、LLaVA-OneVisionとQwen-2.5-VLに対してテストしました。そして、7つの異なるベンチマークを用いてその効果を検証しました。
- ジェイルブレイクの阻止: AIに悪いこと(爆弾の作り方を説明させたり、マルウェアを埋め込ませたりするなど)をさせようとする試みに対し、OOD-VTP法は大きな成功を収めました。平均して、モデルが「いいえ、それはできません」と言う能力を**13.29%向上させました。特にQwen-2.5-VLモデルにおいては、「拒絶率(不適切な要求をブロックできた割合)」が20.38%から33.67%**へと跳ね上がりました。
- ハルシネーションの阻止: この手法は、AIが作り話をするのを止めるのにも役立ちました。HallusionBenchにおいて、Qwenモデルの精度は**8.00%**向上しました。
- スピード: おまけとして、トークンを削除したことにより、AIはより高速に動作しました。処理するトークン数が減少し(16,128から10,512へ)、計算量(TFlopsが4.29から2.78へ)も減少したため、賢さを失うことなく効率性が高まりました。
彼らが「行わなかったこと」(および否定したこと)
この論文が「行わなかったこと」に注意することが重要です。彼らはAIを一から再学習させたわけではありません。新しい安全ルールを追加したり、モデルの脳の重み(weights)を変更したりもしませんでした。彼らは単に、プロセスの中で悪いビジュアルトークンを削った(プルーニングした)だけです。
また、彼らは「いかなるトークン・プルーニングもAIを安全にするわけではない」という考えを明確に否定しました。実際、もし「間違った」トークン、つまり整合性が取れていて役に立つトークンを削ってしまうと、AIはむしろ安全性が低下することを示しました。彼らは「距離が最小の」トークン(=良いトークン)を削除するテストを行いましたが、その結果、モデルの安全性パフォーマンスは急落しました。これは、単に削ればよいという問題ではなく、トラブルを引き起こす「特定のノイズ」を削ることが重要であることを証明しています。
結論
この論文は、マルチモーダルAIをより安全にする鍵は、視覚的なノイズを掃除するというシンプルなことにあるかもしれない、と示唆しています。テキストと適合しないビジュアルトークンを特定して取り除くことで、モデルはより安定し、騙されにくくなり、事実を捏造する可能性も低くなります。これは「プラグアンドプレイ」のソリューションであり、大規模なオーバーホールを行うことなく、既存のモデルに追加できることを意味します。論文は、これらの結果が複数のテストを通じて測定され、一貫していることを示していますが、これはあくまで堅牢性を高めるための手法であり、世界のあらゆるセキュリティ問題を解決する魔法の杖ではないことも付け加えておく必要があります。しかし、好奇心旺盛なティーンエイジャー(あるいは安全性を重視するAI開発者)にとって、これは、少しの「剪定(せんてい)」がいかにデジタル上の友人を守るために大きな違いを生むかを示す、非常に興味深い研究です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。