← 最新の論文
💻 computer science

Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models

本論文は、人間にとっては単純だがAIにとっては困難な235のタスクからなる新しいベンチマーク「Blind-Spots-Bench」を導入しており、これはクローズドソースモデルとオープンウェイトモデルの間の著しい性能差を明らかにし、既存のベンチマークでは検出できない現在のマルチモーダル・システムにおける持続的な弱点を浮き彫りにするものである。

原著者: Matteo Santelmo, Xiuying Wei, Israa Fakih, Felix Bauer, Juan Garcia Giraldo, Chengkun Li, Etienne Bamas, Emmanuel Abbé

公開日 2026-07-10
📖 1 分で読めます☕ さくっと読める

原著者: Matteo Santelmo, Xiuying Wei, Israa Fakih, Felix Bauer, Juan Garcia Giraldo, Chengkun Li, Etienne Bamas, Emmanuel Abbé

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたはビデオゲームをプレイしていると想像してみてください。AIのボスが、あなたがこれまでクリアしてきたすべてのレベルを次々と撃破していきます。高スコアを塗り替え、電卓よりも速く数学のパズルを解き、読めば涙が出るような詩を書き上げます。あなたはこう思うでしょう。「よし、このAIは実質的な超天才だ」と。しかし、そこであなたが単純な質問を投げかけたとしたとします。「正確に5本足の犬を描いて」あるいは「正確に31文字の文章を書いて」と。

突然、その超天才AIは自分の足に躓きます。犬を6本足で描いたり、32文字の文章を書いてしまったりするのです。それはまるで、世界クラスのチェスチャンピオンが、突然靴紐の結び方を忘れてしまったかのようです。

これは、EPFLの研究者たちが新しいテスト、blind-spots-benchを通じて発見したことそのものです。彼らは、誰もが話題にするような大規模で華やかな試験におけるAIモデルの賢さだけを見たのではありません。代わりに、人間にとっては非常に簡単なのに、最先端のAIさえも躓いてしまうような、235個の小さくてトリッキーなタスクからなる「ストレス・テスト」を作成しました。

「ブラインドスポット(死角)」の発見

研究チームは、これらのトリッキーな質問を大学院のAIコースの学生から集めました。学生たちは、最近の最もスマートなAIチャットボットがどうしても正解できなかった特定の事項を見つけ出すよう求められました。彼らはこれらの質問を整理し、回答を自動的に採点するシステムを構築しました。

テストを実行した結果、いくつかの驚くべきことが判明しました。

1. 「富裕層」の優位性
論文は、「クローズドソース」のモデル(自分でダウンロードして実行できないもの)は、「オープンウェイト」のモデル(誰でも利用できるもの)よりも、これらのブラインドスポットにおいて有意に優れていることを示唆しています。両方のタイプのモデルが通常のベンチマークでは同程度のスコアを出しているように見えても、この特定のストレス・テストにおいては、クローズドソースのモデルがオープンなモデルに対して約**10%**上回っています。それは、トラックの上ではどちらも同じくらい速く走れるランナーが、迷路の中をジャグリングしながら走るように指示されたとき、高価なトレーニングギアを着ている方が勝つようなものです。

2. 大きければ常に良いとは限らない
AIモデルを大きくすること(「脳の力」を加えること)で、こうした愚かなミスが修正できると思うかもしれません。しかし、論文はこの測定を行い、スケーリング(規模の拡大)が必ずしも役に立たないことを明らかにしました。場合によっては、巨大な兄弟モデルよりも、より小さなバージョンのモデルの方が優れた成績を収めることがありました。例えば、Qwen3.5ファミリーでは、350億パラメータのモデルが、特定の論理パズルにおいて、3,970億パラメータの巨大なバージョンよりも優れたパフォーマンスを示すことがありました。それは、巨大な象が、猫が簡単に通り抜けられる小さなドアを通るのに苦労する様子に似ています。

3. ツールはすべてを解決するわけではない
一部の人々は、「もしAIが数を数えられないなら、計算機を与えればいい」と考えました。研究者たちは、コード実行ツールを使わせることでこれをテストしました。結果はまちまちでした。一部のモデルでは、ツールを使用することで正解に到達し、時間を節約できました。しかし、GPT-5.4のような他のモデルでは、ツールを使うことで逆に性能が低下しました。それは、シェフに高級なナイフを与えるようなものです。それによって料理を早く切れることもあれば、単に指を切って料理を台無しにしてしまうこともあるのです。

4. 「カウント(計数)」の危機
論文が測定した最大のブラインドスポットの一つは、**カウント(数を数えること)です。画像内のオブジェクトを数えるのか、あるいは特定の数のアイテムを持つ画像を生成するのかに関わらず、モデルは苦戦しました。最高峰のモデルでさえ、これらのカウント・タスクを正解できたのはわずか60%**程度でした。これは、複雑な交響曲を演奏できるのに、単純な4/4拍子を刻むことができないミュージシャンのような、根深い弱点です。

このテストが「言っていないこと」

著者たちは、自分たちの結果を過大評価しないよう細心の注意を払っています。彼らは、これが「AIは永遠に壊れている」と証明する「ラスボス」的なテストではないことを明示しています。彼らは、データセットが比較的規模が小さく(わずか235問)、学生によって作成されたものであるため、テスト対象となった当時のモデルの特定の弱点に偏っている可能性があることを認めています。また、直接比較するための人間のベースラインを含めていないため、人間がどれほど「より優れている」のかの正確な差は分かっていません。ただ、人間にとってこれらのタスクが些細なものであるということだけが分かっています。

結論

この論文は、AIが一般的なタスクにおいては驚異的に進化している一方で、カウント、空間推論、厳格な文字制限の遵守といった、非常に具体的で具体的なスキルにおいては依然として「ブラインドスポット(死角)」を持っていることを示唆しています。クローズドソースのモデルは、現在これらの死角を克服する上でわずかにリードしていますが、これらすべてをマスターしたモデルはまだ存在しません。

blind-spots-benchを、「AIは失敗している」という成績表としてではなく、一つの診断ツールとして考えてください。それは、高速道路では完璧に走るものの、停止信号でエンストしてしまう車に対して、整備士が実施する特定のテストのようなものです。これは、車が速いからといって完璧だと決めつけるのではなく、エンジンがどこで失速しているのかを正確に見極めるための助けとなるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →