VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models
本論文は、ビデオの証拠へのアテンションを動的に再配分し、視覚的トークンを選択的に消去することで堅牢な対照的デコーディング・ブランチを構築することにより、ビデオ大規模言語モデルにおけるハルシネーションを軽減する、学習不要のフレームワークであるVADERを提案している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、何百万もの映画を観てきた、完璧な文章でそれらを説明できる超スマートなロボットと話していると想像してください。このロボットは「ビデオ大規模言語モデル(VideoLLM)」と呼ばれるものです。それは決して疲れを知らないストーリーテラーのようなものですが、厄介な癖があります。それは、自分自身の声に自信を持ちすぎて、実際には存在しない詳細を捏造してしまうことがあるのです。例えば、動画ではただ歩いているだけなのに、映画ではよくあることなので、キャラクターが「フェンスを飛び越えた」と語ってしまうかもしれません。これは「ハルシネーション(幻覚)」と呼ばれます。
この問題は、ビデオにおいては特に複雑です。一枚の写真とは異なり、ビデオは長いフレームのストリームです。もしロボットが一つの一フレームを見逃したとしても、その前後のフレームを見れば、通常は非常によく似ているため、そこから推測できてしまいます。それは、歌の中で一単語を聞き逃しても、前後の言葉が同じであれば推測できるのと似ています。そのため、ロボットが嘘をつくのを防ぐための古い手法、例えば画像の一部をぼかして隠すといった方法は、しばしば失敗します。ロボットは周囲のフレームを使って、その空白を埋めてしまうからです。科学者たちは、ロボットを一から教え直す(これには膨大な時間と費用がかかります)ことなく、この問題を解決する方法を求めています。彼らは、ロボットが話しているまさにその瞬間に、実際に目に映っているものにもっと注意を払わせる方法を必要としています。
そこで、ビデオロボットのためのスマートなエディター(編集者)として機能する新しい手法、VADERが登場します。VADERは、ロボットに新しいルールを強制的に学習させるのではなく、会話の最中に介入して、ロボットの注意力を優しく誘導します。VADERは、二つの巧妙なトリックを使って、ロボットが作り話をするのを防ぎます。
第一に、**視覚的フォーカス再配分(Visual Focus Reallocation: VFR)**というツールを使用します。ロボットの脳を、同時に働く多くのシェフ(レイヤー)がいる忙しいキッチンだと考えてみてください。ビデオを見ているシェフもいれば、レシピについてお喋りをしているだけのシェフもいます。時として、お喋りしているシェフの声が大きくなりすぎて、ビデオを見ているシェフの声がかき消されてしまうことがあります。VFRは、動的なボリュームノブのように機能します。特定のビデオと質問を聞き取り、どのシェフがビデオについて話しているかを正確に判断した上で、ビデオを見ているシェフの音量を上げ、お喋りの音量を下げます。これは、あらゆるビデオに対して固定の設定を使うのではなく、状況を診断して、「よし、この特定のシーンでは、ビデオの証拠を2割増しで聞く必要がある」と判断するのです。
第二に、VADERは**選択的証拠消去(Selective Evidence Erasure: SEE)**というトリックを使います。これは非常に遊び心のある手法です。例えば、あなたは映画のあらすじを当てようとしていますが、背景の景色だけを見ることは許され、メインの俳優は見ることができません。もしそれでも正解を当てられたなら、それはあなたが映画の「一般的な展開(事前バイアス)」に基づいて推測したことを意味します。もし間違えたなら、それはあなたが俳優に頼っていた証拠になります。VADERは、ロボットの脳の中で、フレームごとに、最も重要な視覚的手がかり(メインの俳優など)を密かに「消去」することでこれを行います。これにより、主要な証拠なしで推測しなければならない「もしも」のバージョンの物語を作り出します。もし、この「消去された」バージョンでもロボットが同じ答えを出すなら、VADERはそのロボットが実際のビデオではなく、習慣に基づいて推測しているのだと判断します。
最後に、VADERはロボットの「現実の」答えと「消去された」答えを比較します。もしロボットが両方のケースで自信満々であれば、その答えはハルシネーションである可能性が高いと判断し、それを抑制します。もし証拠が取り除かれたときに答えが変わるならば、VADERはそのロボットが実際にビデオに注意を払っていたのだと判断します。
結果は目覚ましいものです。研究者が人気の高いロボットであるLLaVA-Video-7Bでこれをテストしたところ、このロボットは実際の出来事を特定し、タイムラインを正確に把握する能力が大幅に向上しました。EventHallusionと呼ばれる特定のテストにおいて、ロボットの精度は**72.60%**へと跳ね上がりました。これは、高価な再学習を必要とする他の手法を打ち負かしたという点で、大きな成果です。この論文は、ロボットの注意力の向け方を調整し、その場で自身のバイアスをテストするだけで、ロボットに新しい言語を教え直すことなく、ビデオAIをより誠実なものにできることを示しています。それは、嘘つきを止める最善の方法は、時に「目をつぶって物語を語らせること」であるということを教えてくれます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。