AV-JEPA: Extending LeJEPA to Audio-Visual Self-Supervised Learning
本論文は、デコーダ、EMA教師、または対照的なネガティブに依存することなく、競争力のある性能とゼロショット検索能力を実現するために、アーリーフュージョン・ビジョントランスフォーマーとモダリティドロップアウトを用いてLeJEPAを拡張した、合理化された音響・視覚自己教師あり学習フレームワークであるAV-JEPAを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
コンピュータが、あらゆることを学びたがっているものの、教師も教科書もない教室に閉じ込められた、意欲的な白紙の状態の学生であるような世界を想像してみてください。これは、機械がラベルのない膨大なデータの中からパターンを見つけ出すことで、自習しようとする自己教師あり学習(self-supervised learning)という人工知能の一分野の世界です。通常、猫や車を認識する方法を学ぶには、人間が写真を指さして「これは猫だよ」と言う必要があります。しかし、もしコンピュータが、単に写真を見て、足りない部分を推測するだけで学べるとしたらどうでしょう?それがマスク学習(masked learning)の魔法です。画像や音の一部を隠し、コンピュータにその空白を埋めさせるのです。長い間、これを行う最善の方法は、コンピュータに欠けているピースをピクセル単位で再構築させることでした。まるで、粉々に砕けた花瓶を復元しようとするパズル解きのように。しかし、もっと抽象的で新しい概念であるJEPA(Joint-Embedding Predictive Architecture:結合埋め込み予測アーキテクチャ)があります。JEPAは、壊れた花瓶を再構築しようとするのではなく、欠けているピースの「本質」や「雰囲気(バイブス)」を予測することをコンピュータに求めます。それは、すべての材料を一つずつ味わうのではなく、湯気からスープの味を推測するようなものです。この論文は、大きな問いを投げかけます。「この『雰囲気を推測する』手法は、コンピュータが視覚と聴覚という二つの異なる感覚を同時に理解しようとする際にも機能するのだろうか?」と。
フィンランドのチームによるこの論文の著者たちは、「イエス!」と答え、AV-JEPAと呼ばれる新しいモデルを紹介しています。AV-JEPAを、ビデオを見て音を聞くことで犯罪現場を理解する超スマートな探偵だと考えてください。ただし、少しひねりがあります。ビデオのフレームや音声波形を(これは記憶から犯罪現場全体を描き直そうとするようなものです)再構築しようとする代わりに、この探偵は、一方の感覚が欠けているときに、そのシーンがどのような「感じ」になるかを予測することを学びます。
彼らがどのように行ったのかを説明しましょう。あなたがギター奏者のビデオを見ているところを想像してください。通常、コンピュータはビデオと音声を一緒に捉えます。しかし、AV-JEDAは、感覚を使って「かくれんぼ」をします。クリップを取り込み、二つのバージョンを作成します。一つはビデオが完全に真っ暗になったもの(つまり、コンピュータはギターの音だけを聞く)、もう一つは音声が消されたもの(つまり、コンピュータはギターの映像だけを見る)です。モデルの役割は、「音声のみ」のバージョンを見て、「ビデオのみ」のバージョンがどのような感じになるかを予測することであり、その逆も同様です。これは、人間が何が起きているかを教えることなく、また欠けている部分を再構築しようとすることなく行われます。モデルは、共有されたメンタルスペースの中で、音の「魂」と画像の「魂」を一致させることを学ぶのです。
画像の再構築という重労働をスキップする手法としては、その結果は非常に印象的です。彼らがVGGSound(動画の音を含むデータセット)というデータセットでテストした際、モデルはビデオで何が起きているかを特定する精度で57.1%の正解率を達成しました。別の巨大なデータセットであるAudioSetでは、32.7 mAP(音がどれだけ正確に特定されているかの指標)を記録しました。これらの数値は、従来の「パズルを再構築する」手法を用いる現在のトップモデル(VGGSoundで最大67%に達することもある)よりはわずかに低いものの、著者らはAV-JEPAがはるかにシンプルであることを指摘しています。画像を再構築するための複雑な追加パーツも必要ありませんし、「教師」となるモデルも必要ありません。ただ、自ら学ぶのです。
この論文で見つかった最もクールなことの一つは、モデルが自力で正しいものに注意を向ける方法を学んだことです。音が聞こえたときにモデルがどこを「見て」いたかを調べたところ、モデルは自然にノイズの発生源に焦点を当てていました。鳥のさえずりが聞こえれば、鳥を見ていました。フルートの音が聞こえれば、ミュージシャンの口を見ていました。誰一人として、音の発生源を見つけるように教えていないにもかかわらず、モデルはそれを自力で行いました。音と視覚的な発生源が結びついていることを、一方が他方を予測しなければならないというプロセスを通じて、自ら理解したのです。
また、この論文は、このモデルが「ゼロショット・リトリーバル(zero-shot retrieval)」ができることも示しています。これは、特定の検索タスクのために明示的に訓練されることなく、音だけでビデオを見つけたり、ビデオだけで音を見つけたりできるという、少し凝った方法です。それは、曲のメロディを口ずさむだけで、その曲が含まれる本を見つけられる図書館のようなものです。
しかし、著者たちは正直に限界についても述べています。彼らは、モデルが音声に対して強く偏っていることを見出しました。テストを行った際、モデルの決定は主に、見たものではなく、聞いたものによって駆動されていました。それはまるで、手がかりを聞き取る天才的な探偵が、視覚的な証拠に気を取られてしまっているような状態です。論文は、これが「クリーン」でシンプルなアーキテクチャへの大きな一歩である一方で、画像を再構築するために何年も費やす複雑なモデルと同じくらい、見る能力を高めるためにはまだやるべきことがあると示唆しています。しかし、再構築のパズルを捨て去り、感覚間のつながりにのみ焦点を当てる手法として、AV-JEPAはコンピュータが世界の音と姿を学ぶための、非常に有望な新しい方法なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。