← 最新の論文
💻 computer science

Why MLLMs Struggle to Determine Object Orientations

本論文は、MLLM の物体向き推定における失敗が視覚エンコーダーの欠如によるものという仮説を否定し、向き情報がエンコーダー特徴量から線形モデルで復元可能であることを示す一方で、その情報が数万件の特徴量に拡散して存在しているため、MLLM がこれを活用できていない可能性を指摘しています。

原著者: Anju Gopinath, Nikhil Krishnaswamy, Bruce Draper

公開日 2026-04-16
📖 1 分で読めます☕ さくっと読める

原著者: Anju Gopinath, Nikhil Krishnaswamy, Bruce Draper

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「なぜ最新の AI(マルチモーダル大規模言語モデル)は、写真の中の『物の向き』を間違えてしまうのか?」**という謎を解明しようとした面白い研究です。

結論から言うと、**「AI の『目』(画像認識部分)は実は非常に鋭く、物の向きを正確に捉えているのに、なぜか『脳』(言語部分)がそれを理解できずに間違えている」**という意外な発見でした。

以下に、難しい専門用語を使わず、日常の例え話で解説します。


1. 問題:AI はなぜ「回転」が苦手なのか?

これまでの研究では、AI が写真の中の「犬が右を向いているか、左を向いているか」「90 度回転しているか」などを答えるのが非常に苦手だと分かっています。
例えば、15 個の AI にテストさせたら、正解できるのは 3 割程度しかいませんでした。

これまでの仮説(誤解):
「AI の**『目』**(画像を認識する部分)が悪いんだ。だって、AI の目は『写真と文章を一致させる』ように訓練されているだけで、『幾何学や回転』を学ぶように作られていないから、向きという情報が最初から失われているはずだ」と考えられていました。

2. 実験:AI の「目」に直接聞いてみた

この論文の著者たちは、「本当に『目』が悪いのか?」を確認するために、以下のような実験を行いました。

  • 実験方法:
    AI に写真を見せ、その写真の内部データ(AI が頭の中で持っている「特徴量」という数字の羅列)を直接取り出しました。
    そして、**「この数字の羅列から、物の回転角度を予測できるか?」**という単純な計算(線形回帰)を人間が試みました。

  • 結果:
    大成功!
    AI が「目」で見ている情報の数字さえあれば、人間が作った簡単な計算式で、「物の向き」を 3 度以内の誤差で正確に当てられることが分かりました。

👉 意味すること:
AI の「目」は、物の向きを完璧に、あるいは非常に正確に捉えているのです。仮説は覆されました。「目の問題」ではないのです。

3. 新たな謎:なら、なぜ AI は間違えるのか?

「目が良いのに、なぜ答えられないの?」という新しい疑問が生まれました。著者たちはさらに深く掘り下げ、2 つの重要な発見をしました。

発見①:情報が「バラバラ」に散らばっている

AI の頭の中にある数字(特徴量)は、何万個もあります。
著者たちは、この数字を一つずつ書き換えて「向き」の情報を探しましたが、「特定の 1 つの数字が『向き』を担っている」のではなく、何万個もの数字が「向き」
👉 アナロジー:
まるで、**「10 万個のピースがある巨大なパズル」のような状態です。
「この 1 つのピースが『犬の向き』を表している」と特定できるわけではなく、
「10 万個のピースの微妙な組み合わせ全体」**で初めて「向き」が表現されています。
AI の「脳(言語モデル)」は、この広大でバラバラな情報の中から「あ、ここが犬の向きだ!」とピンポイントで抽出して言葉にするのが、とても苦手なんだと考えられます。

発見②:背景が曲がると、AI はパニックになる

面白いことに、「前景(犬など)」の向きを正しく認識するには、「背景」がまっすぐな状態であることが必要でした。
もし背景自体も回転していたり、不自然な状態だったりすると、AI は前景の向きを全く理解できなくなります。
👉 アナロジー:
**「コンパス」を想像してください。
コンパス(AI)は磁石(物の向き)を正確に感知できます。しかし、コンパスの周りに
「巨大な磁石(回転した背景)」**を置くと、コンパスの針は狂ってしまいます。
AI は「背景」と「前景」の関係を整理する力が弱く、背景が少しおかしいと、全体のバランスを崩して正解を出せなくなってしまうのです。

4. 結論:AI の弱点はどこにある?

この研究から、AI が向きを間違える原因は「目が悪い」ことではなく、**「目が捉えた情報を、言語として整理して出力するプロセスが苦手」**であることが分かりました。

  • 目の性能: 優秀(向きを正確に捉えている)。
  • 脳の弱点:
    1. 情報が何万もの数字に散らばっており、それを一つにまとめるのが難しい。
    2. 背景の状況に敏感すぎて、少しの乱れで正解が出せなくなる。

まとめ

この論文は、**「AI は『見る』ことはできるのに、『考える(整理する)』ことが苦手」**という、AI の新しい弱点を浮き彫りにしました。

これまでは「AI の目はぼやけているからダメなんだ」と思われていましたが、実は**「目はハッキリ見えているのに、その情報を『言葉』に変換するところでつまずいている」**というのが真実だったのです。

今後の AI 開発では、単に「もっと多くの画像を見せる」だけでなく、**「このバラバラな情報をどう整理して、正解を導き出すか」**という脳の部分の改善が重要になるでしょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →