← 最新の論文
🤖 AI

Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions

本論文は、従来の評価手法と比較して、マルチモーダル大規模言語モデルにおけるより顕著かつ現実的な視覚的ハルシネーションを明らかにすることによって、静的なベンチマークと実世界のアプリケーションとの間の溝を埋める、動的なマルチターン・インタラクション・フレームワークであるCEDIを導入するものである。

原著者: Yijiang Li, Huiqi Zou, Bingyang Wang, Ziang Xiao

公開日 2026-07-17
📖 1 分で読めます☕ さくっと読める

原著者: Yijiang Li, Huiqi Zou, Bingyang Wang, Ziang Xiao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに世界の「見え方」を教えようとしている場面を想像してみてください。長い間、科学者たちはロボットに一枚の画像を見せ、「何が見えますか?」と問いかけることで、彼らのテストを行ってきました。それは、ロボットが写真について短いエッセイを書かなければならない「抜き打ちテスト」のようなものです。もしロボットが主要な要素を正しく捉えていれば、成績は「A」になります。しかし、現実の世界では、私たちはただ写真をじっと見つめてエッセイを書くわけではありません。私たちはデバイスと会話をします。「あれは犬ですか?」と聞き、次に「首輪は何色ですか?」と聞き、さらに「待って、あれは犬ですか、それともキツネですか?」と続けます。私たちは会話をし、考えを変え、混乱します。問題は、従来の「抜き打ちテスト」形式では、ロボットが実際に私たちとチャットをしている時に犯してしまうミスを捉えられないことです。ロボットはテストには合格しても、会話においては失敗することがあり、チャットを継続させるためだけに、そこに存在しない事実をでっち上げることがあります。これは、ロボットが車を運転したり、医師を助けたりする場合、事実を捏造することは非常に危険なことなので、大きな問題となります。私たちは、実際に使われている方法、つまり、乱雑でやり取りのあるチャットの中で彼らをテストする方法を必要としています。

この論文は、これらの「視覚言語モデル(VLM)」をテストするための新しい方法であるCEDIを紹介しています。CEDIを、単なるテストではなく、「三人による劇」と考えてみてください。まず、ロボット(テストされるモデル)がいます。次に、探偵(自動化された試験官)がいます。そして、裁判官(採点者)がいます。探偵は単にロボットに写真を見せて立ち去るわけではありません。探偵には、その写真の秘密の地図(「シーングラフ」と呼ばれます)と、「駐車場を見つける」といった特定の目標が与えられます。そして、探偵はロボットとの会話を開始し、チャットが進むにつれて、より難解で具体的な質問を投げかけていきます。探偵は「赤い車はありますか?」と尋ね、もしロボットが「はい」と答えたら、探偵は「そのモデルは何ですか?」と追及したり、あるいは、青い車が存在しない場合に「なぜ青い車がそこに停まっているのですのか?」と問いかけることで、ロボットを騙そうとしたりします。目的は、ロボットが会話を維持するために、嘘をつき始める(ハルシネーションを起こす)かどうかを見極めることです。

著者らは、この「探偵」方式が、従来の「抜き打ちテスト」形式よりも嘘を見抜くのにずっと優れていることを発見しました。彼らがいくつかの異なるロボットに対してCEDIを使用したところ、ロボットは従来のテストが示したよりも大幅に多くの架空の詳細をでっち上げていることが判明しました。例えば、あるデータセットでは、この新しい手法を用いることで、ロボットの「ハルシネーション率」が従来の方法と比較して5〜23パーセントポイントも跳ね上がりました。また、会話が長くなるほど、ロボットは嘘をつく傾向がはるかに強くなりました。チャットが進むにつれて、ロボットは自分自身の以前の回答に混乱し、まるでメッセージがどんどん間違っていく「伝言ゲーム」のように、自分自身の間違いを強化し始めてしまうようです。

また、論文では、ロボットが「分かりません」と言うのが非常に苦手であることも示されました。探偵が、偽の前提(例えば、人がいないのに「その男性は何を持っていますか?」と問うなど)に基づいた質問をしたとき、ロボットはしばなしっかりと答えようとし、架空の人物や帽子を捏造してしまいました。彼らは、誤った考えを拒絶すべき場面で最も苦戦しました。このシステムにおける新しい「裁判官」は、特殊なグラフ照合スコアを使用しており、従来のツールよりも一貫してこれらの嘘を捉えることができ、人間の裁判官の意見とも従来の方法より高い精度で一致しました。

要約すると、この論文は、ロボットを単一の質問でテストする従来の方法が、彼らの問題の大部分を見逃していることを示唆しています。動的で多段階の会話へと切り替えることで、これらのロボットは、特に会話を続けようとしたり、誤った前提に騙されたりした際に、はるかに嘘をつきやすいことが分かります。著者らは、ロボットが壊れていると言っているのではなく、彼らを静かな試験を受けているようにテストするのをやめ、会話をしている時のようにテストする必要があると主張しています。なぜなら、そこにこそ本当の問題が隠されているからです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →