← 最新の論文
🤖 AI

Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

本論文は、マルチモーダル大規模言語モデルが、既存のターゲットに対する位置特定精度を損なうことなく、汎用的な参照表現理解において存在しない物体を効果的に拒絶することを可能にする強化学習戦略である、Refusal-Calibrated Group Relative Policy Optimization (RC-GRPO) を提案する。

原著者: Xuzheng Yang, Jun Ling, Tao Huang, Caiyan Qin, Peng Wang

公開日 2026-08-06
📖 1 分で読めます☕ さくっと読める

原著者: Xuzheng Yang, Jun Ling, Tao Huang, Caiyan Qin, Peng Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたがロボットに、人間と一緒に「アイ・スパイ(目当てのものを当てるゲーム)」をする方法を教えていると想像してください。人間が絵を指さして、「赤いボールを探して」と言います。もし赤いボールがあれば、ロボットはそれを正確に指さすべきです。しかし、もし人間が「赤いボールを探して」と言ったのに、実際の絵には青い猫しか映っていなかったらどうでしょう?賢いロボットなら、「ここには赤いボールは見当たりません。存在しません」と言うべきです。しかし、今日の非常にスマートなコンピューターの脳(マルチモーダル大規模言語モデルと呼ばれます)の多くは、間違いを恐れるあまり、やる気だけが空回りしている熱心な生徒のようなものです。彼らは答えを出したくてたまらないので、赤いボールが見当たらないときでも、無理やり推測してしまい、青い猫を指さしながら「これです!」と言い張ってしまうのです。これは「ハルシネーション(幻覚)」、つまり事実ではないことをでっち上げることと呼ばれます。

この論文は、「汎用的な参照表現理解(Generalized Referring Expression Comprehension)」と呼ばれる、この問題の非常にトリッキーな側面に取り組んでいます。これは、もっと簡単に言えば、「ロボットは、対象物があればそれを見つけられるか、そしてもしなければ正直に『見えません』と言えるか?」ということです。研究者たちは、これらのロボットは物を見つけることは得意ですが、物がないことを認めるのが非常に苦手であることを見出しました。単に「ノー」と言うように訓練するだけでは、ロボットは臆病になりすぎてしまい、実際に存在する物まで見つけることができなくなってしまいます。チームは、ロボットが正しい時には「イエス」と言う能力を忘れることなく、本当に必要な時だけ「ノー」と言えるように教える方法を必要としていました。

著者らは、**RC-GRPO(Refusal-Calibrated Group Relative Policy Optimization)**と呼ばれる、巧妙で新しい学習手法を提案しています。ロボットの学習プロセスを「ホット・アンド・コールド(熱いか冷たいか、正解に近いかどうかを当てるゲーム)」のようなものだと考えてください。通常、ロボットのスコアは、その推測がどれくらい正解に近いかに基づいて決まります。しかし、対象物が存在しない場合、ロボットは推測し続けてしまうため、正しい答えを学ぶことができません。研究者たちの最初のトリックは、練習中に、たとえロボットが推測したくても、強制的に「なし、見えません」と言わせることでした。これにより、対象物が欠けている時に正しい答えを言ったロボットに対して、明確な「報酬」を与えることができました。

しかし、彼らは、単にロボットが「なし」と言うことを褒めるだけでは、対象物が存在する場合であっても、ロボットが何に対しても「なし」と言うようになってしまうことに気づきました。これを修正するために、彼らは特別なルールを追加しました。もしロボットが、実際には対象物が存在しているのに「なし」と言った場合、大きなペナルティを与えるというルールです。これは、ロボットにこう伝えているようなものです。「対象物がそこにない時に『見えない』と言うのは構わないけれど、目の前にあるのに『見えない』と言うなら、ポイントを没収するよ」。彼らはさらに、ロボットがなぜ対象物が見当たらないと考えているのかを説明しなければならない(例:「青い猫しかいないので、赤いボールは見えません」)という第2段階も追加しました。これにより、ロボットが単にパターンを暗記するのではなく、実際に画像を理解するように仕向けています。

結果は、この手法が非常にうまく機能することを示しています。3つの異なる困難なテストで検証したところ、ロボットは物を見つける能力と、存在しない場合に推測を拒否する能力の両方において、格段に向上しました。例えば、あるテストでは、彼らの手法によってロボットの総合的な精度が45%から62%に向上し、他の高度な手法を大幅に上回りました。この論文は、このアプローチがロボットに完璧なバランスをもたらすことを示唆しています。つまり、存在しない物体に対して架空の場所をでっち上げることを止めつつ、実在するものを探す能力を失わないようにしているのです。これは、単に賢いだけでなく、自分が見ているもの、そして見ていないものについても正直になれるAIの実現に向けた一歩です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →