← 最新の論文
⚡ electrical engineering

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

本論文は、大規模な新しいデータセット、段階的な3ステージの学習カリキュラム、および新規の時系列インターリーブ型思考の連鎖(temporal interleaved chain-of-thought)フレームワークを活用することで、長く複雑な現実世界のビデオに対する共同理解と推論を実現する、完全にオープンな最先端の大規模言語モデルであるAudio-Visual Flamingo(AV-Flamingo)を紹介するものである。

原著者: Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon K
公開日 2026-07-20
📖 1 分で読めます☕ さくっと読める

原著者: Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon Kim, Sungwon Kim, S Sakshi, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

映画を観ているところを想像してみてください。俳優の顔、設定、そしてアクションが見えますが、同時に台詞やバックグラウンドミュージック、足音、木の葉の擦れる音も聞こえてきます。長い間、コンピュータは、目をつぶって音声トラックだけを聞いているか、あるいは逆に音声だけを聞いて映像を見ているような人間に似た状態でした。彼らは写真の中の猫を認識したり、スピーチを書き起こしたりすることには長けていましたが、猫が画面を横切って走っている間に鳴いているような、「シーン全体」を理解することには苦労していました。この研究分野は「マルチモーダル」知能と呼ばれ、機械が人間と同じように世界を理解するために、視覚や聴覚といった異なる感覚を組み合わせようとする試みです。研究者たちが抱いてきた大きな問いは、「単にビデオを見たりポッドキャストを聴いたりするだけでなく、音と映像がどのように組み合わさっているかを、特に物語が長く複雑な場合に、実際に『考える』ことができるAIを構築できるか?」というものでした。

そこで登場したのが、NVIDIAとメリーランド大学の研究者によって設計された、新しい種類のAIの脳、Nemotron-Labs-Audio-Visual Flamingo(あるいは短縮してAV-Flamingo)です。これまでのビデオAIを、教科書のたった1ページを読んで素早い質問に答えることができる学生だと考えてください。もし彼らに映画全体を要約させたり、15分間で変化する複雑なシーンを説明させたりしたら、彼らは迷子になったり、最初の方を忘れてしまったり、登場人物を混同してしまうでしょう。AV-Flamлоingoは異なります。それは、映画全体を観て、サウンドトラックを聴き、そして音楽がどのようにムードを変えたのか、なぜキャラクターがあのような反応をしたのか、あるいは特定の音が視覚的な出来事に対して正確にいつ発生したのかについて、詳細なエッセイを書くために座ることができる、非常に注意深い学生のようなものです。

研究者たちは、これを実現するためには、単に従来と同じデータを大量に投入するだけでは不十分であることを発見しました。彼らはAIに3つの新しいテクニックを教えなければなりませんでした。第一に、音と視覚を時間軸に沿って結びつけるAIの能力をテストするために特別に設計された、約700万個の実世界のビデオ例(480万組の質疑応答ペアを含む)からなる膨大なライブラリを作成しました。彼らはこれをAudio-Visual-Skillsと呼びました。第二に、彼らは単にAIを深いところに放り込んだわけではありません。短いクリップから始めて基礎的なスキルを教え、次に徐々に長い複雑なビデオへと移行して、時間の経過とともにストーリーを追跡する方法を教えるという「カリキュラム」を用いました。第三に、おそらく最も巧妙な点として、彼らはTemporal Audio-Visual Interleaved Chain-of-Thoughtと呼ばれる「思考プロセス」を使うようにAIを教えました。AIがビデオを観ながら、数秒ごとに「よし、この正確な瞬間にドラムが鳴り、それからキャラクターが跳んだ」と言う場面を想像してみてください。これは、AIの思考を時間に根ざしたものにし、何が最初で何が最後かについて混乱しないように助けます。

結果は非常に印象的です。音楽や音声の理解から、長いビデオの分析、そしてトリッキーな質問への回答に至るまで、15種類以上の異なる課題でテストされた際、AV-Flamingoは同程度のサイズの他のオープンソースモデルを明確な差で上回りました。実際、それは現在世界で最高峰である、コードが見えない「クローズド」な(より大きく高価な)モデルとも競い合い、時にはそれらを打ち負かすことさえできました。論文は、このモデルが、手がかりが時間の経過とともに散らばっているような、長く複雑な実世界のビデオを扱うことに特に優れていることを示唆しており、適切なデータとトレーニング方法があれば、オープンソースのAIが巨人たちに追いつけることを証明しています。これは、コンピュータに、世界をただ眺めるのではなく、真に「見て、聴く」能力を与えるための大きな一歩です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →