← 最新の論文
🤖 machine learning

TRAPSBench: Vision-Language Models Encode but Fail to Express Epistemic Restraint

本論文は、視覚言語モデルが、視覚的証拠が決定を下すには不十分である場合にそれを検知する内部能力を備えている一方で、この認識論的な抑制を表現することには一貫して失敗しており、それが知覚の問題ではなく出力生成における決定的なボトルネックであることを示すために、TRAPSBenchおよびPECS指標を導入するものである。

原著者: Fnu Pramono, John Cai, Sourabh Kulkarni

公開日 2026-08-14
📖 1 分で読めます☕ さくっと読める

原著者: Fnu Pramono, John Cai, Sourabh Kulkarni

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたはロボットにビリヤードの遊び方を教えているところだと想像してください。あなたはボールが転がるビデオを見せながら、「8番のボールはどのポケットに入るでしょうか?」と問いかけます。もしビデオが鮮明であれば、ロボットは物理演算を行い、答えを出すはずです。しかし、もしビデオの途中で巨大で不透明なタープでテーブルが覆い隠されたり、あるいは、誰も予測できないほどボールが激しく跳ね回ったりしたらどうなるでしょうか?真に賢いロボットは、ただ推測するのではなく、手を挙げて「情報が足りないので分かりません」と言うべきです。自分が何を知らないのかを知っているこの能力は、「エピステミック・レストレイント(認識論的抑制)」と呼ばれます。それは、自信満々な嘘つきと、慎重な専門家の違いです。人工知能の世界、特にビデオを見てそれについて語ることができるコンピュータである「ビジョン・ランゲージ・モデル(VLM)」において、研究者たちは疑問を抱いています。これらのモデルは、本当に自分が暗闇の中にいることを理解しているのか、それとも単に壁越しに透けて見ているふりをしているだけなのか、と。

「TRAPSBench」と題されたこの論文は、まさにその問いを掘り下げています。研究者たちは、AIのための特別なビデオゲームであるTRAPSBenchを構築しました。これには1,404組の物理シナリオのペアが含まれています。各ペアにおいて、一方のビデオは結果が明確で予測しやすい「コントロール(対照群)」であり、もう一方は、隠れた壁や混沌とした混乱、あるいは意味をなさない質問によって答えを知ることが不可能な「ボイド(空虚)」となっています。彼らはその後、16種類の異なるAIモデルをテストし、答えが隠されている時に、それらのモデルが敗北を認めるかどうかを検証しました。

ここにひねりがあります。モデルたちは、答えが隠されていることを「知る」ことに関しては非常に優れているのですが、「分からない」と「言う」ことに関しては極めて稚拙なのです。それは、テストを受けている生徒が、自分には正しい答えがないことを内心では分かっているものの、先生を喜ばせたいあまり、自信たっぷりに作り話の答えを書いてしまうようなものです。研究者たちは、AIの内部的な「脳」(隠れ状態)を調べたところ、モデルが証拠が欠落していることに気づいているかどうかを、高い精度(AUROCという尺度で最大91%)で検出できることが分かりました。しかし、モデルが実際に言葉を発する際には、その内部的な警告を無視して、ただ当てずっぽうに答えてしまうのです。

この研究はまた、奇妙な不均衡も明らかにしました。これらのAIモデルは、テキストベースのナンセンスな質問(例えば「青色の重さは?」と尋ねるなど)を見抜くことは得意ですが、視覚的な証拠が欠落している場合を見抜くのは苦手です。彼らは、テキストによる不可能性を、視覚的な不可能性よりも4倍速く検知することができます。さらに、研究者たちはAIの内部信号を微調整することで、AIを「操舵」することを試みました。その結果、特定の方向にAIを押し進めることで、推測をやめさせて「分かりません」と言わせることが可能であることが分かりました。これは、抑制する能力はすでに備わっているものの、モデル自身が自ら開けることを拒んでいる扉の向こう側に閉じ込められているだけであることを証明しています。

要するに、この論文は、これらのAIモデルの問題は、彼らが盲目であったり愚かであったりすることではなく、あまりにも熱心すぎる(過剰に意欲的である)ことにあると示唆しています。彼らは自分が確信を持てていないという真実をエンコードしていますが、その出力は、無理にでも答えを出そうとする「ゲート」によってブロックされています。研究者たちは、これらのAIシステムを真に信頼できるものにするためには、より良く見る方法を教えるのではなく、何を言うかを決定するシステムの部分を修正する必要があるだろうと結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →