Robust Motion Generation using Part-level Reliable Data from Videos
本論文は、信頼できるパーツレベルの情報のみを活用して高品質な人体動作を生成する堅牢なパーツ認識型自己回帰モデルを提案することで、ビデオベースのモーションデータにおけるオクルージョンおよび画面外キャプチャの課題に対処し、K700-Mと呼ばれる新しい大規模ベンチマークの導入を併せて行うものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
文章を読むだけで、デジタル上の人間を動かす方法をコンピュータに教えることを想像してみてください。「その人は踊っている」と入力すれば、画面に流暢でリアルなパフォーマンスが表示されることを期待するでしょう。テキスト・トゥ・モーション生成(text-to-motion generation)として知られるこの分野は、目覚ましい進歩を遂げてきましたが、一つの壁に突き当たっています。これまでの最高の結果は、制御されたスタジオ内で高価なセンサーを用いて、実在の人物の動きを捉えた特別な高品質の録画データを用いてコンピュータを訓練することで得られてきました。これらの録画は完璧ですが、希少であり、多様性に欠け、現実世界における人々が実際に行う複雑で乱雑な動きを見落としがちです。この障壁を打ち破るために、研究者たちはインターネットに目を向け、オンライン上で利用可能な何十億もの普通の動画から学ぶことを試みました。考え方は単純です。もしコンピュータがウェブ上の膨大なライブラリから学ぶことができれば、より幅広い動作を理解できるようになるはずだというものです。しかし、そこには落とし穴があります。コンピュータが普通の動画の中で人がどのように動いているかを理解しようとする際、全身が見えていないことがよくあります。人が木に隠れていたり、カメラのフレームの端で切れていたり、あるいは他の人に遮られていたりすることがあるのです。このような瞬間、コンピュータは欠けている手足がどこにあるのかを推測しなければなりません。
この推測は、学習における根本的な問題を生み出します。もしコンピュータが上半身しか見えていない動画を見せられ、全身の推測(見えない脚を含むもの)から学習することを強制された場合、間違ったことを学んでしまう可能性があります。見えない脚が、単なる推測ではなく、現実の証拠であると信じ始めてしまうかもしれないのです。長い間、研究者たちは難しい選択を迫られてきました。完璧にクリアでない動画クリップをすべて捨てて、データの大部分を失うか、それともすべてのクリップを保持して、コンピュータが悪い推測を無視できることを期待するか、という選択です。どちらのアプローチにも深刻な欠陥がありました。クリップを捨てることは、座っている時の腕の動きなど、特定の動きに関する貴重な情報を失うことを意味しました。一方で、すべてを保持することは、コンピュータに誤った情報を教えてしまうことを意味しました。ある研究チームは、コンピュータのデータの見方を変えることで、この問題を解決する方法を見出しました。ビデオクリップ全体を「良い」か「悪い」かのどちらかで扱うのではなく、身体の部位ごとに見るように教えたのです。
研究者たちは、注意深い編集者のように機能する新しいシステムを開発しました。システムが動画を分析する際、まずどの身体部位が実際に表示されており、どの部分が隠れているかを確認します。もしテーブルによって脚が遮られている場合、システムは腕や胴体の動きは信頼すべきだが、脚についてのコンピュータの推測は無視すべきであると判断します。システムは、見える部分を確かな事実として扱い、隠れた部分を後で埋めるべき空白として扱います。このアプローチにより、以前は使い物にならないほど乱雑だと考えられていた何千もの動画から学習することが可能になりました。カメラが実際に捉えている身体の一部にのみ焦点を当てることで、システムは自身の推測に惑わされることなく、動きに対する信頼できる理解を構築できるのです。これは、尾の部分が隠れている時に、翼の部分だけを研究して鳥を認識することを学ぶのと似ています。尾を含めた鳥全体の絵を丸暗記しようとするのではなく、翼を学ぶのです。
このアイデアをテストするために、チームはインターネットから、ビデオクリップとテキストによる説明のペアを約20万組含む、大規模な新しいデータコレクションを作成しました。彼らがこれらのクリップを分析したところ、フレームの4分の3以上において、少なくとも一つの身体部位が完全には見えていないことが判明しました。これは、欠落した情報という問題が珍しいことではなく、ウェブ動画においては常態であることを裏付けています。このデータセットを使用して、彼らは新しいシステムを訓練し、乱雑なクリップを捨てるか、あるいはフィルタリングせずにすべてのデータを学ぼうとする古い手法と比較しました。結果は明白でした。どの部分が見えているかに注意を払う新しいシステムは、古い手法よりもはるかに正確でリアルな動きを生み出しました。生成された動きは、テキストの説明により忠実であるだけでなく、より滑らかで自然なものでした。
研究は、乱雑なクリップを保持し、目に見えない部分を無視するようにコンピュータに教えることが、クリップを捨ててしまうよりもはかに優れていることを示しました。研究者が20万個のクリップからなる大規模なプールに対してシステムをテストしたところ、既存の最高の手法を大幅に上回る結果を出しました。すべてのデータを保持する古い手法は、見えない部分から学ぼうとしたために多くの間違いを犯しましたが、データを捨ててしまう手法は多様性を失いました。新しいシステムは、大規模なデータセットの多様性を維持しながら、間違いを回避することに成功しました。システムは、ドラムを叩きながら座っている人は脚が隠れているかもしれないが、腕の動きは依然としてリアルであり、学習に有用であることを学びました。信頼できる部分に焦点を当てることで、システムは欠けているピースに惑わされることなく、動きの完全な姿を組み立てることができたのです。
この研究は、不完全なデータを用いてコンピュータに物理的な世界を教える新しい方法を示唆しています。機械に動きを教えるために、完璧なスタジオ品質の録画を必要とするわけではないということを示しています。代わりに、機械に何が信頼できるかを賢く判断させる方法さえあれば、インターネット上の膨大で乱雑な動画のコレクションを利用できるのです。システムは、人の動きを理解するために全身を見る必要はありません。行動を理解するために、身体の十分な部分が見えていればよいのです。このアプローチは、将来、より大規模でより有能なシステムを訓練するための扉を開き、これまで以上に幅広い人間の行動を理解できるシステムへとつながります。研究者たちは、カメラが見える範囲の限界を尊重することで、コンピュータはより多くを学べるのであり、決して少なくはないのだということを発見しました。完璧なデータを求めることから、部分的な証拠から学ぶことへのこの戦略の転換は、機械に人間の動きを理解させるための重要な一歩となります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。