LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
本論文は、合成生成されたキャプションを備えた8,000万本のビデオ(1,000万時間)からなる大規模なオープンデータセットであるLAION-BVDを紹介しており、これによりビデオ、オーディオ、および画像・テキストのタスクにわたる最先端のマルチモーダル事前学習が可能になります。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
現代の人工知能の時代において、コンピュータはルールを教え込まれるのではなく、膨大な数の例を吸収することによって、世界を見聞きすることを学んでいます。長年、研究者たちは画像とテキストによる説明を組み合わせた巨大なライブラリを構築し、写真の「犬」にはしばしば「犬」という言葉が伴うことを機械に教えてきました。マルチモーダル学習として知られるこのプロセスにより、コンピュータは「見ているもの」と「読んでいるもの」を結びつけることが可能になり、画像の記述、画像に関する質問への回答、さらにはテキストから新しい画像を生成するシステムの基礎となっています。しかし、これらの静止画のライブラリが数十億件にまで拡大した一方で、動画や音声に相当するコレクションは驚くほど小さなままです。動画は静止画よりもはるかに複雑です。動画には動き、変化するシーン、そして視覚情報とともに物語を伝えるサウンドトラックが含まれています。課題は、これらの強力なシステムを訓練するために十分なビデオデータを集めることが非常に困難であることでした。なぜなら、動画はしばしば商業的なプラットフォームの壁の向こう側に閉じ込められており、処理するために膨大な計算能力を必要とするからです。
研究チームは今、LAION-BVDと呼ばれる前例のない規模のデータセットを公開することで、この障壁を打ち破りました。このコレクションは、1,000万時間のビデオを提供するオープンサイエンスにおける大きな飛躍を象徴しています。これを分かりやすく例えるなら、もし誰かがこの映像のすべての時間を一度も休まずに視聴しようとしたら、完了するまでに1,000年以上かかるということになります。このデータセットは、まずYouTube、Vimeo、Dailomotionといった主要なプラットフォームを含む公開ウェブから13億件のビデオへのリンクを集めることから構築されました。この膨大なリストから、研究者たちは8000万個の異なる動画のダウンロードに成功しました。その後、彼らは自動化されたツールを使用して、これらの長い動画をシーンの変化に基づいて短い意味のあるクリップへと切り分け、各セグメントがバラバラで無関係なショットの寄せ集めではなく、一貫した瞬間を捉えるようにしました。
この研究の真の革新は、研究者がどのようにしてコンピュータにこれらのクリップを理解させたかという点にあります。人間が1,000万時間のビデオをすべて視聴して、毎秒ごとに説明文を書くことは到底不可能であるため、チームは人工知能を使用してテキストラベルを自動的に生成しました。彼らは、ビデオクリップを「見て」、動作を説明する短い合成キャプションを書き出す特化したモデルを訓練し、同時に別のモデルがオーディオトラックを「聴いて」、音楽から音声、環境音に至るまでの音を説明するようにしました。また、ビデオから個々のフレームを抽出することで、3億枚の画像コレクションを作成し、それぞれに独自の記述を付与しました。このプロセスにより、コンピュータがビデオとテキスト、オーディオとテキスト、さらには単一の画像とテキストを、同じソース素材から結びつけて学習できる、豊かで多層的なデータセットが作り上げられました。
研究者たちがこの新しいデータを用いてコンピュータモデルを訓練し、その結果をテストしたところ、驚くべき結果が得られました。モデルは、既存のより小さなデータセットで訓練されたモデルと同等、あるいは場合によってはそれ以上に、ビデオとオーディオを理解することを学びました。研究者がより多くのデータを投入し、より大きなコンピュータアーキテクチャを使用するにつれて性能は一貫して向上しており、この巨大なライブラリが機械を教えるための高品質なリソースであることを示唆しています。ビデオ訓練を受けたモデルは、バスケットボールをしたり特定のダンスを踊ったりしている人を識別するなど、人間の動作を認識することに長け、テキストによる記述が与えられた際に適切なビデオを見つけ出すスキルも向上しました。同様に、オーディオ訓練を受けたモデルは、鳥のさえずりから車のエンジンの始動音に至るまで、話し言葉や書かれた記述を正しい音と一致させる強い能力を示しました。
おそらく意外なことに、ビデオから抽出された画像もまた、新たな学習源として強力であることが証明されました。ビデオ由来の画像で訓練されたモデルは、教科書的なスタイルで特定の物体を識別するという点では最高峰ではありませんでしたが、別のタスク、すなわち「与えられた記述に対して正しい画像を見つける」という点において極めて優れていました。これは、ビデオの中で捉えられた視覚的世界が、標準的なウェブ画像とは異なる種類の多様性を提供しており、コンピュータが世界をより広く理解するためのユニークな視点を与えていることを示唆しています。研究者たちは、自動化されたシステムによって生成されたキャプションは十分に正確であり、大多数がクリップの内容を正しく記述していることを発見しました。
この研究は、単に新しいデータセットを提供するだけではありません。高度なビデオおよびオーディオAIを訓練するためのボトルネックは、もはや利用可能なデータの不足ではなく、それを処理するために必要なエンジニアリングの努力にあるということを証明しています。大規模でオープンに利用可能なウェブ動画のコレクションが、最先端のモデルを訓練するために正常にキュレーションされ、使用できることを示すことで、研究者たちは新しい世代の人工知能への扉を開きました。彼らは、適切なツールがあれば、ウェブ上の広大で混沌とした動画の海を、構造化された教育的リソースへと変容させることができ、機械が静止している姿だけでなく、動き、音が鳴る人間体験の全スペクトラムから学ぶことを可能にすると証明したのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。