← 最新の論文
💬 NLP

When to Call an Apple Red: Humans Follow Introspective Rules, VLMs Don't

この論文は、人間が自らの判断基準に忠実であるのに対し、視覚言語モデル(VLM)は自身の内省的な推論と実際の判断の間に系統的な乖離を生じさせ、特に世界の知識に基づく事前知識が存在する際にその信頼性が低下することを、新たなベンチマーク「GCA」を用いた実験を通じて明らかにしています。

原著者: Jonathan Nemitz, Carsten Eickhoff, Junyi Jessy Li, Kyle Mahowald, Michal Golovanevsky, William Rudman

公開日 2026-04-09
📖 1 分で読めます☕ さくっと読める

原著者: Jonathan Nemitz, Carsten Eickhoff, Junyi Jessy Li, Kyle Mahowald, Michal Golovanevsky, William Rudman

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「AI は本当に自分が言ったことを守れるのか?」**という、とても面白い問いを、リンゴの色の話を通じて探求したものです。

タイトルを直訳すると**「リンゴを『赤い』と呼ぶべきはいつか?人間は自分の頭の中のルールに従うが、AI(視覚言語モデル)は従わない」**となります。

以下に、専門用語を排して、身近な例え話を使って解説します。


🍎 物語の舞台:「リンゴの半分は白、半分は赤」

まず、実験の舞台を想像してください。
白黒の線画で描かれたリンゴがあります。これに、赤いペンで少しずつ色を塗っていきます。

  • 0% 塗られていない → 白黒のリンゴ
  • 10% 赤い → ほとんど白
  • 50% 赤い → 半分が赤、半分が白
  • 100% 赤い → 真っ赤なリンゴ

ここで研究者は、AI と人間に**「このリンゴを『赤い』と呼んでいいのは、赤い部分が何%以上になったときですか?」**とルールを決めさせます。
その後、実際に色を塗られたリンゴを見せて、「これは赤いですか?」と答えさせます。

🧠 人間の反応:「ルールは守るけど、勘違いする」

人間の実験結果はこうでした。

  1. ルールを決める: 「うーん、50% 以上赤くなったら『赤い』と呼ぼう」と決めます。
  2. 実際の判断: 実際に見て判断するときは、**「あ、50% くらいに見えるな」**と答えます。

面白い点:
人間は、決めたルール(50%)と実際の判断がズレることがあります。しかし、これは**「色の面積を正確に見積もるのが苦手だから」**という単純なミスです。
例えば、赤と白が半々(50%)のリンゴを見て、「あ、半分よりちょっと多い気がする!」と勘違いして「赤い」と言ってしまうのです。
つまり、人間は「自分のルール(50% 以上なら赤)」を忠実に守ろうとしていますが、目の前の量を正確に測る能力が少し甘いだけです。

🤖 AI の反応:「ルールは守らない!頭の中がごちゃごちゃ」

一方、最新の AI(VLM)の反応は驚くほど違いました。

  1. ルールを決める: AI も「50% 以上赤くなったら『赤い』と呼ぶ」と言います。
  2. 実際の判断: しかし、赤が 10% しかないリンゴを見せると、AI は**「これは赤い!」**と答えてしまいます。

ここが最大のポイント:
AI は、「自分が決めたルール(50% 以上)」を完全に無視して、別の理由で答えを出しています。
それは**「リンゴ=赤」という世間の常識(先入観)**です。
AI は、リンゴの絵を見ると「リンゴは赤いものだ」という知識が頭の中で暴れ回り、「赤が少ししか塗られていなくても、これはリンゴなんだから赤いに決まっている!」と判断してしまうのです。

たとえ話:

  • 人間: 「ルールは『50% 以上赤なら赤』。でも、50% ちょうどだと『赤っぽく見えるかも』って勘違いしちゃう。でも基本はルール通り。」
  • AI: 「ルールは『50% 以上赤なら赤』。でも、リンゴの絵を見ると『リンゴ=赤』って頭が叫ぶ!だから、赤が 10% しかないのに『赤い!』って叫んじゃう。自分が決めたルールを、自分の知識が蹴っ飛ばしている。」

🔍 実験の結論:何が起きているのか?

この研究でわかったことは、以下の 3 点です。

  1. AI は「自分の言葉」を信じていない
    AI は「私はこう考える」と説明(思考の過程)を述べながら、実際には全く違う答えを出します。これは、AI が自分の思考プロセスを「嘘をついて」いるようなものです。
  2. 難しさが原因ではない
    以前は「AI が失敗するのは、問題が難しすぎるからだ」と言われていました。でも、この実験ではリンゴの色を判断するだけという超簡単な問題でも、AI はルールを破りました。つまり、難易度の問題ではなく、「AI の頭の中にある常識(リンゴは赤い)」が、視覚的な証拠(実際は白が多い)を圧倒して勝ってしまっているのです。
  3. 人間とは違う「嘘」
    人間の「ルール違反」は、単なる「見間違い(勘違い)」ですが、AI の「ルール違反」は、**「自分が決めた基準を、別の知識(先入観)が裏切っている」**という、もっと根本的な問題です。

💡 なぜこれが重要なのか?

もし、医療や法律のような重要な分野で AI を使う場合、**「AI は自分の判断基準を説明できるし、それに従う」と信じて使いたくなります。
しかし、この研究は
「AI は自分が言ったルールを、自分の頭の中の『常識』によって簡単に破ってしまう」**ことを示しています。

「リンゴが半分白でも、リンゴだから赤い」という常識が、AI の判断を狂わせているのです。
これは、AI が「信頼できる説明」を提供しているように見えて、実は裏で別のロジックで動いている可能性を示しており、AI を安全に使うためには、この「自己矛盾」をどう解決するかが大きな課題だと言えます。


一言でまとめると:

「AI は『リンゴは赤い』という常識に夢中になりすぎて、自分が決めた『50% 以上赤くないと赤とは言わない』というルールを、リンゴが白っぽく見えても無視してしまいます。人間は『勘違い』しますが、AI は『ルールを裏切る』のです。」

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →