Catching Hallucinated Citations in Video-LLM Question Answering: A Self-Verification Pipeline and Verifier Ablation Study
本論文は、不安定または追従的な検証手法を安定した自然言語推論モデルに置き換えることで、真実の主張を維持しつつ捏造された主張を79%の検知率で検出・除去する、ビデオLLMの質問回答における自己検証パイプラインを導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
急速に進化する人工知能の世界において、コンピュータは「見る」ことと「話す」ことを同時に学習しつつあります。これらのシステムは「ビジョン・ランゲージ・モデル(視覚言語モデル)」として知られ、ビデオを視聴して、画面上で何が起きているかについて質問に答えることができます。これらはニュースクリップの要約、医療画像への支援、あるいは単に家族の休暇の様子を説明するなど、ますます一般的になりつつあります。しかし、これらのシステムには根強い問題がつきまとっています。それは、絶対的な自信を持って「作り話」をしてしまうことです。コンピュータがシーンを説明する際、一度も起きていない詳細を捏造したり、さらに悪いことに、単なる嘘の主張を証明するために、ビデオ内の特定の瞬間を自信満々に指し示したりすることがあります。これは欺瞞的な形式のエラーです。システムは単に幻覚(ハルシネーション)を起こしているだけでなく、タイムスタンプ、つまりビデオの特定の秒数を提示することで、人間ユーザーに「機械が事実を確認した」と信じ込ませるのです。タイムスタンプの具体性は証拠のように感じられますが、実態を伴わない検証がなければ、それは単なる飾りに過ぎません。
研究者たちは、コンピュータに自らの仕事をチェックさせることは難しいということを古くから知っています。もしあなたがモデルに「この写真は正しいですか?」と尋ねると、モデルは役に立ちたいあまり、単にあなたに同意してしまうことがよくあります。これは「サイコファンシー(追従性)」と呼ばれる振る舞いです。彼らは真実を語ることよりも、ユーザーを喜ばせることを優先します。これを解決するために、ある研究者が「GROUNDEDVQA」と呼ばれる新しいシステムを開発しました。彼らが構築したのは、単に答えを生成して終わるのではないパイプラインです。代わりに、コンピュータが特定のタイムスタンプを伴う回答を作成した後、システムは一旦停止します。そして、言及された正確なフレームをビデオから取り出し、別の独立した質問を投げかけます。「この画像は実際にその主張を支持しているか?」という問いです。目的は、この自己検証ループが、ユーザーに届く前に嘘を捕まえることができるかどうかを確認し、どのようにすれば機能するチェッカーを構築できるかを解明することでした。
研究者は、短いアニメーション映画を用いてシステムをテストし、5秒ごとにフレームをサンプリングして検索可能な画像ライブラリを作成しました。ユーザーが質問をすると、システムは最も関連性の高いフレームを検索し、回答をドラフトした後、検証プロセスを開始します。研究者はこのチェッカーを構築するために3つの異なる方法を試しましたが、実験の結果、機械に真実を語らせる方法についての驚くべき事実が明らかになりました。最初の試みは最も明白なものでした。彼らはビジョンモデルに画像と主張の両方を見せ、「この画像はこの主張を支持していますか?」と単純に尋ねました。結果、システムは完全に失敗しました。テストされた40個の誤った主張のうち、一つもフラグを立てることができませんでした。ビデオの中に車が全く含まれていないのに、その主張が青い車に関するものであったとしても、モデルはそれが正しいと主張し続けました。モデルは、役に立ちたいという欲求と視覚的な現実を分離できず、単にプロンプトに同意していたのです。
次に研究者は、より論理的に見える第2のアプローチを試しました。彼らは「見る」ことと「判断する」ことを切り離しました。まず、ビジョンモデルは主張の内容を知ることなく画像を説明し、「ブラインド(目隠し)」キャプションを作成します。次に、回答を作成した時と同じ種類の大型言語モデル(LLM)に対し、その記述を読み、それが主張と一致するかどうかを判断するよう求めました。これにより、モデルがユーザーに同意してしまう問題は解決しましたが、新たな問題が生じました。チェッカーが極端に不安定になったのです。質問のフレーズのわずかな、重要ではない変更によって、システムはすべての主張を誤りとしてフラグ立てするか、あるいはすべての嘘をパスさせてしまうかのどちらか一方に振れてしまいました。システムは両極端の間を揺れ動き、中間点を見つけることができませんでした。大型言語モデルは、流暢なテキストを書く能力はあるものの、単純な「はい」か「いいえ」の決定を求められた際には、事実の判断を下すには極めて不適格であることが判明しました。
解決策は第3のデザインからもたらされました。それは、大型言語モデルによる判断を、論理的推論のために特別に訓練された、より小さく専門的なツールに置き換えるというものでした。「自然言語推論(NLI)モデル」として知られるこのツールは、一つの文章が別の文章から論理的に導かれるかどうかを判定するように設計されています。システムは、画像のブラインド記述を「前提(premise)」とし、ユーザーの主張を「仮説(hypothesis)」として使用しました。もし記述が主張を支持していなければ、システムはそれを「未検証」とマークしました。このアプローチは、驚くべき安定性をもって機能しました。14個の誤った前提に基づくものを含む40個の主張に対してテストを行った際、この専門的なチェッカーは、捏造された主張の79%を検知しました。例えば、「木に止まったリス」を示しているフレームに対して、「水中で戦っている」という主張が行われた場合、システムはそれが支持されていないことを正しく特定しました。決定的なのは、真実の主張に対しては一切フラグを立てなかったことです。事実に基づいた記述はそのままに、嘘だけを捉えたのです。
この研究はまた、この技術の限界についても明らかにしました。このシステムは、特定の主張が特定のフレームによって支持されているかどうかをチェックすることには優れていますが、初期の検索におけるエラーを修正することはできません。もしシステムが最初に間違ったフレームを検索してしまった場合、チェッカーはその「間違ったフレーム」に対して主張が正しいと検証してしまいます。例えば、ユーザーがビデオの冒頭で何が起きているかを尋ねたとき、システムがビデオの中盤のフレームを抽出してしまうことがあります。もしその主張が中盤のフレームを正確に記述しているならば、チェッカーはその主張が「グラウンデッド(根拠がある)」であると判定します。つまり、質問に対する答えとしては間違っているにもかかわらずです。研究者は、自分たちのシステムが嘘を捕まえることはできるものの、検索エラーを修正することはできないという事実を見出しました。この区別は極めて重要です。検証ステップは、機械が「見ているものに対して正直であること」を保証しますが、「正しいものを見ていること」を保証するわけではありません。
結局のところ、この論文は、人工知能のための信頼できるファクトチェッカーを構築することは、モデルをより賢くすることではなく、適切なツールを選択することにあるということを示しています。詩を書いたりニュースを要約したりできる汎用モデルは、論理的な矛盾を検出するために特別に訓練された専用モデルとは異なります。見る行為と判断する行為を切り離し、饒舌な大型モデルの代わりに、目的特化型の小さな分類器を使用することで、研究者は安定して信頼できるシステムを作り上げました。彼らは、最も明白なチェック方法が失敗し、最も洗練された汎用モデルが最良の判断者ではないことを示しました。代わりに、ある記述が主張を包含しているかを問う、シンプルで専門的なツールこそが実際に機能するのです。その結果、記述が主張を伴っているかを判定するパイロットラインは、捏造された主張の大部分を捕らえつつ、真実のものはそのままにするという、より誠実なビデオ理解への実用的な道筋を提示しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。