Learning to Understand Body Language from Flight through Robust 3D Avatar Placing
本論文は、軽量な幾何学的ワールドモデルを用いて、コミュニケーション上の意図を持つ3Dアバターを実写のドローン映像内にロバストに配置することで作成された新しいデータセットであるDrones2BodyLanguageを紹介するものであり、これは長距離UAVビデオから人間のボディランゲージと意図を学習・理解する空飛ぶロボットの能力を大幅に向上させるものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、賑やかな都市や静かな田舎の上空を高く飛行しているドローンであると想像してください。あなたは「社会的に知的な」ロボットです。つまり、地上にいる小さな人々が何を伝えようとしているのかを理解したいと考えています。例えば、ハイカーが助けを求めて手を振っていたり、グループが特定の方向を指し示していたりする場合です。科学の世界では、これを「ボディランゲージ」や「コミュニケーションの意図」を理解することと呼びます。通常、コンピュータは、自撮りのように至近距離であれば、こうした信号を読み取るのが得意です。しかし、50メートルから100メートルの距離までズームアウトすると、人物は画面上のわずか数ピクセルになってしまいます。その動きはぼやけ、コンピュータは混乱してしまいます。それは、まるでフットボール競技場の向こう側から本を読もうとするようなものです。文字はそこにありますが、小さすぎて意味をなしません。
これらの小さく遠い信号をコンピュータに読み取らせるために、科学者たちは通常、何千もの例を必要とします。しかし、ここに落とし穴があります。100メートル離れた場所からドローンに向かって手を振っている人々の動画を、何千本も撮影した人は誰もいないのです。それを撮影するのは非常に困難ですし、人々が遠すぎて明確に見えない可能性もあります。そのため、科学者には2つの悪い選択肢があります。実在の人間の動画を大量に撮影しようとする(これはほとんど不可能です)か、あるいは、完全に架空の世界にコンピュータ生成の偽の人々を作り出す(これは完璧すぎて、現実のビデオの乱雑さに一致しません)かです。この論文はこの賢明な中間策を見つけようとしています。彼らはこう問いかけます。「もし、現実世界のビデオを使いつつ、そこに実物そっくりの人間を魔法のように貼り付けることができたら、コンピュータは遠くからの信号を読み取る方法を学べるのではないだろうか?」
この研究の背後にいる研究者たち、ドラゴシュ・コステア(Dragoş Costea)とそのチームは、Drones2BodyLanguageと呼ばれる新しいツールを構築しました。これは、ビデオのためのハイテクな「切り貼り」マシンのようなものですが、非常に特別なひねりが加えられています。通常、ビデオに人の写真を貼り付けると、まるで平面のステッカーが奇妙に滑っているように見えます。カメラが動くと、その人は地面と一緒に動かず、ただ浮いているように見えてしまいます。それでは学習には使えません。チームの大きなブレイクスルーは、デジタルな人々を地面にしっかりと立たせ、ドローンが飛行しても正しい場所に留まり、さらには実在の人間と同じように、正しい方向を向いて体を回転させるように配置する手法です。
彼らの「魔法」がどのように機能するかを説明しましょう。まず、ドローンによる実際の4Kビデオを使用します。次に、スマートなシステムを使用して、建物の角や木のように、地面上の安定した点である「アンカー」を見つけ出します。たとえ地面が模様のない単調なアスファルトであっても、彼らのシステムは特殊な深度センサーを使用して、これらの点が3D空間でどの程度の高さにあるかを推測します。その後、デジタルアバターを配置するための「スイートスポット」を計算します。秘訣は数学的なトリックです。彼らは人の足を直接追跡するのではなく(足は滑らかな道路の上で消えてしまう可能性があるため)、人物の周囲にある安定したアンカーを追跡し、ドローンがどのように動いても、人物の足が正確にどこにあるべきかを予測する数式を使用します。また、地面がどちらに「傾いている」かも算出し、人物が横に傾いて見えることがないようにします。
人物が完璧に配置されたら、チームは膨大なトレーニングデータのライブラリを作成するために、3つの異なる方法でその人物をビデオに追加します。
- リアル(Real): 俳優の実際のビデオを取り込み、切り抜いて、そこに貼り付けます。
- リターゲット(Retargeted): 実在の俳優の動きを取り、それをリアルな3Dコンピュータキャラクターに適用します。
- 生成(Generated): AIを使用して、これまで一度も撮影されたことのない、全く新しい動きを創り出します。
彼らは、3,500以上の「配置された」ビデオクリップを含むデータセットを作成しました。これには、10種類の異なるコミュニケーション信号(手を振る、指をさす、「止まれ」の合図を送るなど)が、33メートルから98メートルの距離で示されています。
チームは、この「偽の」データが実際にコンピュータに現実の人間の理解を教えることができるかどうかをテストしました。彼らは12種類の異なるコンピュータ・ブレイン・モデル(アーキテクチャ)を取り、この新しいデータセットを用いて学習させました。結果は有望でした。配置されたビデオでコンピュータを学習させたところ、モデルは遠くにいる人々が何を伝えようとしているのかを推測するのが非常に上手くなりました。実際、この種のデータを見ていないモデルと比較して、精度は大幅に跳ね上がりました。
興味深いことに、彼らは「人物の見え方」よりも「動きの種類」の方が重要であることを発見しました。完全に偽の(生成された)動きを用いたモデルは最も苦戦しましたが、リターゲットされた(実在の動きを偽の体に適用したもの)モデルは非常によく機能しました。これは、コンピュータが単なる3Dキャラクターの外見ではなく、人間の動きのリズムと形状を学ぶ必要があることを示唆しています。
彼らはまた、見たことがない2つの新しい現実世界のビデオ(田舎とリゾート地)を用いてシステムをテストしました。コンピュータはこれらの特定のシーンを見たことがありませんでしたが、彼らの混合データセット(リアルとリターゲットの両方を使用)で学習したモデルが最高のパフォーマンスを発揮しました。これは、彼らの「配置」手法が、ロボットに空からの人間の信号を理解させるための確実な方法であることを示唆しています。
しかし、著者たちは、これがまだあらゆる状況における完璧な解決策ではないことも注意深く指摘しています。彼らの手法は、平坦で固い地面で最も効果的に機能し、地面がある程度硬直していることに依存しています。また、ビデオから切り出した「リアルな」人々は、プロセス全体をやり直さない限り、簡単に変更したり再アニメーション化したりすることはできません。しかし全体として、この論文は、現実のビデオと巧妙なデジタル配置を組み合わせることで、ドローンが私たちのボディランゲージをより良く読み取れるように教える、強力な新しい方法を示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。