Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios
本論文は、ビデオ理解のシナリオにおいて、複雑でユーザー指定された制約に従うという、マルチモーダル大規模言語モデルにおける未開拓の能力を評価するために、1.5Kのサンプルと多様なインストラクション・タクソノミーを特徴とする包括的なベンチマークであるVideo-IFBenchを導入し、現在のモデルがマルチ制約および条件付きの指示に対して著しく苦戦していることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人工知能が急速に進化する世界において、見て、聞いて、話すことができる新世代のシステムが登場しました。これらのマルチモーダルモデルは、膨大な量のテキスト、画像、ビデオを用いて学習されており、シーンを説明したり、映画に関する質問に答えたり、ニュース映像を要約したりすることができます。長年、研究者たちは「答えが正しいか?」という単純な問いによって、それらの成功を測定してきました。もしモデルが料理番組のビデオを見て、材料を正しく挙げることができれば、高いスコアが得られます。しかし、現実世界では、正しい答えだけでは不十分なことがよくあります。ユーザーはモデルに対して、特定のルールを指定してビデオの説明を求めるかもしれません。「水が沸騰した後のことだけを教えて」「手順を順番にリストアップして」「鍋の色については言及しないで」「スペイン語だけで話して」といった具合です。これらの要求は、システムがコンテンツを理解するだけでなく、複雑な一連の指示に従い、真実であると分かっていても無視するように命じられた情報を排除することを要求します。これまで、これらの高度なシステムが、ビデオのシナリオにおいて、このような詳細で人間のような制約に従う能力については、ほとんどテストされてきませんでした。
ある研究チームは、Video-IFBenchと呼ばれる新しいテスト環境を構築することで、このギャップに対処しました。このベンチマークは、ビデオ理解AIが、指示がトリッキーな場合に、実際に言われた通りに動けるかどうかを確認するために特別に設計されました。研究者たちは、スポーツ、科学、ニュース、日常生活など10の異なるドメインをカバーする700以上のビデオを公開ソースから収集しました。これらのクリップは10秒から10分間の長さで、合計約49時間の映像に及びます。このコレクションから、1,500件のユニークなテストケースを構築しました。各テストケースは、ビデオと、タスクと制約の混合を含む特定の要求をペアにしています。単一の情報(例:「画面上のテキストは何ですか?」)を求めるものもあれば、複数のステップ(例:「動作をリストアップしてください。ただし、2秒以上続くもののみとし、番号付きリストとして提示してください」)を要求するものもあります。最も難しいテストは、条件付き論理を含むもので、モデルはまずビデオを見て、どの経路に進むかを決定しなければなりません。例えば、「もしビデオがノートパソコンの修理に関するタイトルで始まっていたら、修理の手順を説明してください。そうでなければ、最後の10秒間の人物の動作を説明してください」というプロンプトがあります。モデルは、正しい指示セットを選択するために、開始条件を正確に特定しなければなりません。
これらのテストが公平かつ正確であることを保証するために、研究者たちは、質問と回答のチェックルールを生成するための半自動化されたシステムを構築しました。彼らは人工知能を使用して、オブジェクトが存在するかどうかや特定のイベントがいつ発生したかといった事実をビデオから抽出し、それらの事実を用いて複雑な指示を作成しました。決定的なのは、すべての指示にチェックリストが付随していたことです。チェックリストの中には、回答がJSON形式で書かれているか、あるいは正確に5つの箇条書きが含まれているかなど、コンピュータプログラムによって確認できる項目もありました。一方で、回答の意味を理解する必要がある他の項目は、裁判官として機能する別の非常に高性能な言語モデルによってチェックされました。このハイブリッドなアプローチにより、研究者たちは、モデルが主要なタスクだけでなく、要求されたすべての制約を満たしているかどうかを評価することができました。
この評価の結果、現在利用可能な最も高度なビデオモデルにおいてさえ、重大な弱点が明らかになりました。ベンチマーク全体でテストした際、最も優れた性能を示したモデルの総合スコアは、わずか54.5パーセントでした。これは、モデルがビデオの内容を正しく理解していたとしても、約半数のケースにおいて、一連の指示を完全には守れなかったことを意味します。研究によると、モデルは一度に多くの制約が含まれている場合や、回答する前にビデオの内容に基づいて判断を下す必要がある場合に、最も苦戦することが分かりました。例えば、ビデオで起きたことに基づいて異なる経路を選択するよう求められると、モデルは頻繁に間違った経路を選んだり、条件を完全に無視したりしました。指示が複雑になるにつれて難易度は上がり、深い「もし〜ならば」の論理チェーンを含む要求になると、成功率は急激に低下しました。
研究者たちはまた、制約の種類が極めて重要であることも発見しました。モデルは、特定の言語を使用することや単語数を制限することといったフォーマットのルールに従うことには比較的優れていました。しかし、ビデオの意味を理解して情報をフィルタリングする必要があるセマンティック(意味的)な制約については、性能が低いことが分かりました。例えば、特定の人物の動作のみを記述し、他の全員を無視するように求められたり、正確な時間枠内で起きた出来事をリストアップするように求められたりした場合です。これらのケースでは、モデルは除外するように指示された情報を含めてしまったり、見つけるべき詳細を見逃したりすることがよくありました。研究は、単にモデルを大型化したり、より多くの計算能力を与えたりしても、この問題は解決しないことを示しました。大型のモデルは一般的に優れた性能を発揮しますが、それでも厳格な指示に従うことは依然として困難であり、ビデオの内容を理解する能力と、複雑なルールに従う能力は、現在のテクノロジーがまだ完全には融合できていない二つの異なるスキルであることを示唆しています。
この研究は、人工知能が真に実世界のアプリケーションで有用であるためには、見た通りに聞く(指示に従う)ことも同様に学ぶ必要があることを示唆しています。今回の知見は、現在のシステムは、ユーザーが特定のニーズに対する正確な遵守を期待するシナリオにおいて、まだ十分に信頼できるレベルには達していないことを示しています。研究者たちは、Video-IFBenchが明確な指標を提供することで、世界を見るだけでなく、人々が使うニュアンスを含んだ、時には矛盾するような指示にも従うことができるモデルへと、将来の開発を導くことを期待しています。進むべき道は、単に正しい答えを得ることから、ユーザーが求めた通りの方法で正しい答えを得ることに焦点を移すことです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。