← 最新の論文
💬 NLP

Model Confidence Under Answer-Preserving Attacks: An Informativeness-Manipulability Frontier

本論文は、配備されたビジョン・ランゲージ・システムにおける確信度の読み出し値が、回答を維持する攻撃に対して極めて脆弱であることを示しており、それらが、誤った回答を受け入れさせたり、全体の精度をベースラインを下回るレベルまで低下させたりするように操作可能な、堅牢な監視信号ではなく完全性に敏感な信号として機能することを証明している。

原著者: Reza Khanmohammadi, Ivan Brugere, Simerjot Kaur, Charese H. Smiley, Kundan Thind, Mohammad M. Ghassemi

公開日 2026-08-10
📖 1 分で読めます☕ さくっと読める

原著者: Reza Khanmohammadi, Ivan Brugere, Simerjot Kaur, Charese H. Smiley, Kundan Thind, Mohammad M. Ghassemi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは宇宙船の船長になったと想像してください。しかし、あなたは星も見えず、操作パネルも見えません。その代わりに、非常に賢いロボットの副操縦士がいます。そのロボットは計器を見て、「私は90%の確率で正しい経路にいると確信しています」と言ったり、「確信度は50%しかありません。一旦停止したほうがいいかもしれません」と言ったりします。あなたは、飛行を続けるか、あるいは人間を呼んで助けを求めるかを決めるために、このロボットの「確信度スコア」を信頼して判断を下します。これは、今日の多くの現代的なAIシステムの仕組みです。彼らは単に答えを出すだけでなく、その答えをどの程度信頼すべきかを伝えるための「確信度スコア」を提示するのです。

しかし、ここからが厄介なところです。もし、誰かが答え自体は変えずに、ロボットの「確信度」だけを変えて、考えを変えさせることができたらどうなるでしょうか?それはまるで、重さは全く変えていないのに、天秤の目盛りを「重い」から「軽い」へと傾けてしまう手品師のようなものです。もし、ロボットの確信度スコアが、あなたが誤った判断を下すのを防ぐ唯一の手段であり、もしそのスコアが偽装できるものだとしたら、あなたの安全網には穴が開いていることになります。この論文は、まさにその穴について掘り下げ、恐ろしくも重要な問いを投げかけています。「これらのAIロボットを、答えは全く同じまま、確信度について嘘をつくように騙すことはできるのだろうか?」

この研究の研究者たちは、いくつかの強力な視覚言語モデル(画像を見て質問に答えることができるAI)を用いて、ハイステークスな「弱点探し」のゲームを行うことに決めました。彼らの目的は、AIの最終的な回答(一文字一文字、スペース一つに至るまで)を完全に同一に保ったまま、画像の極めて微細で、ほとんど目に見えない変化を加えることで、AIの確信度スコアを激しく変動させることができるかどうかを確かめることでした。彼らは、AIの確信度スコアを「壊れやすいガラス窓」のように扱いました。つまり、フレーム(答え)を壊すことなく、ガラス(確信度)だけを粉々に砕くことができるかどうかを見たのです。

彼らが発見したのは、そのガラスは予想よりもはるかに脆いということでした。「回答保存型攻撃(answer-preserving attacks)」と呼ばれる手法を用いることで、彼らはテストを行ったほぼすべてのケースにおいて、AIの内部的な確信度スコアを操作することに成功しました。実際、テストした多くのAIモデルにおいて、画像をわずかに調整して確信度メーターを欺くだけで、間違った答えを正しいものとして受け入れさせたり、正しい答えを間違っているものとして拒絶させたりできることが分かりました。

この発見の中で最も驚くべき点は、これが画像自体の問題だけではないということです。研究者たちは、画像に一切触れることなく、AIの内部の脳(隠れ状態)を直接「押し」、特定の方向へ思考を促すように動かすことで、同じ結果が得られることを示しました。これは、問題がAIの画像認識における単なる不具合ではなく、AIが自身の確信度を算出する方法における、より深いレベルの問題であることを示唆しています。

彼らはまた、画像にノイズを加える、あるいはAIが変化に対して鈍感になるよう訓練するなど、確信度スコアをより堅牢にするための「防御」戦略もテストしました。残念ながら、これらの防御策のどれもが、このトリックを防ぐほど十分に機能することはありませんでした。彼らのシミュレーションでは、これらの操作された確信度スコアを使用して現実世界の意思決定を行った場合、システムは、確信度スコアを完全に無視してすべての答えを受け入れた場合よりも、実際にはパフォーマンスが悪化しました。

では、これは将来にとって何を意味するのでしょうか?論文は、AIの内部的な確信度スコアを、特にAIにデータを与える人間がそれを騙そうとしている可能性がある場合、安全信号として盲目的に信頼することはできないと結論付けています。確信度スコアは「完全性に敏感(integrity-sensitive)」、つまり容易に汚染され得るものです。著者らは、もし私たちがこれらの確信度スコアを用いて重要な意思決定を行いたいのであれば、AI自身にどれほど確信しているかを語らせるのではなく、それらを検証するための新しい外部的な方法を構築する必要があると提案しています。これは、AIの世界においては、ロボットが「確信しています」と言ったとしても、それが実際に確信しているとは限らないということを思い出させてくれるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →