← 最新の論文
💻 computer science

MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts

本論文は、主要な視覚言語モデル(VLM)が、固有のバイアスや学習データの不足により、物体の欠損を検出することに一貫して失敗することを示すベンチマークであるMissingBench-Verifiedを紹介しており、この限界は外部ツールの使用、推論の拡張、あるいはファインチューニングを用いても解消されず、現在のVLMにおける根本的なアーキテクチャ上の欠陥を明らかにしている。

原著者: Wenqi Marshall Guo, Qingyun Qian, Shiyu Zhou, Guoping Luo, Shan Du

公開日 2026-07-22
📖 1 分で読めます☕ さくっと読める

原著者: Wenqi Marshall Guo, Qingyun Qian, Shiyu Zhou, Guoping Luo, Shan Du

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたはロボットに世界の「見方」を教えているところだと想像してください。あなたは、猫、犬、飛行機の写真を100万枚見せました。するとロボットはルールを学習します。「猫には尻尾がある」「飛行機には翼がある」「iPhoneにはホームボタンがある」。これが**視覚言語モデル(VLM)**の世界です。これらは、写真を見てそれを言葉で説明したり、見たものについて質問に答えたりできる、非常に賢いコンピュータプログラムです。彼らは、宇宙中のあらゆる本を読み終え、本の表紙を見ただけで瞬時にその物語のあらすじを教えることができる司書のような存在です。

しかし、ここに厄きな点があります。時として、この司書は自分が知っていることに対して「自信過剰」になりすぎてしまうのです。もし、尻尾を失った猫の写真を見せたら、彼らの脳内では「そんなのありえない!すべての猫には尻尾があるはずだ!」と叫び声が上がり、目は明らかに尻尾がないことを捉えているにもかかわらず、尻尾はそこにあると言い張ってしまうかもしれません。これを**ハルシネーション(幻覚)**と呼びます。これはロボットが嘘をついているのではなく、彼らの内部知識があまりに強力すぎて、実際に目にしているものを取りこぼしてしまうのです。科学者たちがこの問題を重視するのは、もし私たちがこれらのロボットに、橋の点検や医療スキャンのチェック、工場の監視などをさせたいのであれば、彼らが「何かが見当たらない」と言えるようにする必要があるからです。勝手に作り話をしていてはならないのです。


「欠落したパーツ」の大ミステリー

ここで、まさにこの「頑固さ」をテストするために設計された新しい実験、MissingBench-Verifiedが登場します。この研究の背後にいる研究者たちは、こう問いたかったのです。「もし飛行機の写真からエンジンを外科的に取り除いたら、ロボットはエンジンがなくなったことを認めるだろうか? それとも、まだそこにあると幻覚を見るだろうか?」

これを確かめるために、チームは特別な118枚の画像セットを作成しました。彼らは、ホームボタンが消されたスマートフォンや、尾翼のない飛行機など、日常的な物体の実写を用意し、市場にある最もスマートな10種類のAIモデルに見せました。そして、「このパーツは見えますか?」という単純な質問を投げかけました。モデルは、「はっきりと見える」「見えにくい」「見えない」のいずれかを選択しなければなりませんでした。

結果は衝撃的でした。最も高度なAIモデルであっても、通常ならあらゆるテストで満点を取るようなモデルであっても、惨敗したのです。エンジンがなくなっているとき、モデルたちはエンジンがまだそこにあると主張しました。実際、ほぼ半数のモデルが50%以上の確率で間違えました。最悪の成績を収めたClaude Sonnet 4.6は、パーツが欠落していることを正しく識別できたのはわずか**44.1%**でした。まるで、ロボットたちが自分自身の記憶で作られた目隠しを装着しており、自分の目が見ているものを信じることを拒んでいるかのようでした。

効果のなかった「魔法の道具箱」

研究者たちは、単にロボットにもっと注意深く見るよう求めただけではありません。彼らは、ロボットを空想から引き戻すために、一連のトリックという「道具箱」を使って助けようと試みました。主に3つの戦略を試しました。

  1. 「探偵の報告書」(外部ツール): 彼らは、非常に正確な物体検出器からの「偽の報告書」をモデルに与えました。その報告書には「私は調べましたが、エンジンは確かに見つかりませんでした」と書かれていました。彼らは、モデルがこの報告書を信頼することを期待しました。しかし、ほとんどのモデルは報告書を無視し、自分たちの主張を曲げませんでした。たとって「完璧な検出器」が物体は消えたと言っても、モデルたちは依然としてそれはあると幻覚を見続けました。
  2. 「ズームレンズ」(画像処理): 彼らは、モデルに画像をクロップ(切り抜き)したり、明るさを変えたり、シャープにしたりするツールを使わせました。より近くで見れば真実が見えるのではないかと考えたのです。あるモデルは、クロップツールを使って、尾翼のない飛行機の空間をズームアップし、その空白を目にしたにもかかわらず、それでもなお、尾翼はそこにあると主張しました。そして、パーツが欠落しているのではなく「クロッピングによるエラー」のせいだと結論づけたのです。
  3. 「深い思考」(時間の確保): 彼らは、モデルに回答する前により長い時間をかけて思考することを強制しました。より多くの脳力を使えば間違いが修正されるのではないかと考えたのです。驚くべきことに、思考時間を長くしても効果はありませんでした。場合によっては、思考を長くさせることで、むしろ間違った答えに対する自信を深めてしまうことさえありました。

結論:これはバグではない、壊れた「機能」である

この論文は、これが単なるプロンプトや少しの思考で「教え込む」ことができる単純なミスではないことを示唆しています。問題はもっと深いところにあります。モデルは、飛行機には飛ぶためにエンジンが「なければならない」という強い信念、すなわち「事前分布(prior)」を学習してしまっています。視覚的な証拠(空白の空間)が、この根深い信念と衝突したとき、信念が勝利してしまうのです。モデルたちは実質的にこう言っているのです。「私は飛行機がどのようなものか知っている。だから、この写真は間違っており、私は『あるべき姿』として記述するのだ。現実の姿ではなく」

研究者たちは、モデルに優れたツールへのアクセスを与えたり、より多くの時間を与えたりすることで解決を試みましたが、論文では、これらの現在の手法は無視できる程度の改善しか提供できないと結論づけています。失敗率は頑固なほど高いままであり、ほとんどのモデルは助けがあっても欠落したパーツを正しく識別することができませんでした。

この研究は、問題を解決したと主張しているわけではありません。むしろ、警鐘を鳴らしているのです。機械の部品が足りないのか、あるいは安全装置が機能しているのかといったタスクにおいて、現在の最高のAIモデルが極めて信頼できないものであることを示しています。彼らは、目の前の証拠よりも自分たちの内部知識を信じすぎてしまい、それを覆すことができないのです。論文は、この問題の解決には、より良いプロンプトやより長い思考時間では不十分であり、モデルが「知っていること」よりも「見ていること」を信頼できるように、モデルの構築方法や訓練方法の完全な刷新が必要になるだろうと示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →