SocioGesture: Real-Time and Adaptive Social Gesture Perception for Human-Robot Interaction
本論文は、エッジデバイス上での堅牢かつ低遅延な認識を実現するために、オクルージョンを考慮した破損を用いた軽量なデュアルストリームモデルを用いて学習された、オフライン適応を通じて語彙を継続的に拡張する、人間とロボットの相互作用のためのリアルタイムかつ適応的な社会的ジェスチャ知覚システムであるSocioGestureを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットは私たちの世界を動き回る方法を学びつつありますが、私たちと自然に交流するためには、単に言葉による命令に従うだけでは不十分です。彼らは人間の動きという「沈黙の言語」、つまり、挨拶としての手を振る動作、停止を伝えるための手のひらを上げる動作、あるいは「忙しい」ことを示すために耳に電話を当てる動作などを理解する必要があります。これが人間とロボットの相互作用(ヒューマン・ロボット・インタラクション)の課題であり、機械にこれらの社会的合図を読み取る方法を教えることに特化した分野です。困難さは、現実世界の混沌とした現実にあります。静かなオフィスで視聴するビデオとは異なり、ロボットは動いている角度から人々を見ることになり、手は体の後ろに隠れていたり、影の中に紛れていたりすることがよくあります。さらに、ロボットは立ち止まって長い時間考える余裕はありません。ジェスチャーの解釈に時間がかかりすぎると、相互作用が途切れ、不自然に感じられてしまうからです。目標は、会話に追いつくほど速く、欠落した情報を扱うほど賢く、そして毎回人間に再プログラミングを必要とせずに間違いから学習できるシステムを構築することです。
OpenMindの研究者たちは、この問題を解決するために「SocioGesture」と呼ばれる新しいシステムを開発しました。これは、移動しながら作業しているロボットが社会的ジェスチャーを認識できるように特別に設計された、リアルタイム知覚ツールです。このシステムは、衣服や背景を分析しようとするのではなく、人のスケルトン(関節と骨のマップ)を観察することで機能します。このアプローチが選ばれたのは、照明が変わったり、人が異なる服を着ていたりしても、スケルトンは識別可能なままだからです。しかし、研究者たちは、標準的なスケルトントラッキングが、手が遮蔽されたりカメラの角度が変わったりすると失敗しやすいことを知っていました。これを修正するために、彼らはすべての関節の「確信度」に注目するモデルを構築しました。ロボットのカメラが手の位置を確信できていない場合、システムは盲目的に推測するのではなく、その不確実性を記録します。そして、身体の大きな動きと手の細かな詳細を組み合わせ、それらを一つの、電光石火の計算として統合し、ロボットに搭載されたコンピュータ上で直接実行します。
SocioGestureの核心的な革新は、避けられないデータの欠落をどのように扱うかにあります。従来の多くのシステムでは、手首のような主要な関節が欠けると、認識の試み全体が失敗していました。この新しいシステムは、それらの欠落を想定するように訓練されています。研究者たちは、コンピュータ・シミュレーションの中で手や腕を隠すことで、意図的にトレーニングデータを「破損」させ、パーツのスケルトンが見えない状態でもジェスチャーを認識する方法をモデルに強制的に学習させました。このトレーニングはロボットが研究所を出る前に行われるため、ロボットが堅牢であるために追加の計算能力を必要とすることはありません。現場にいるとき、ロボットは目に見えるものに基づいて判断を下します。もしジェスチャーに対して非常に高い確信があれば、即座に行動します。もし確信が持てない場合は、推測するのではなく、その相互作用の瞬間を後日の検討用に保存します。これにより、ロボットが「止まれ」としている人に近づくといった危険な間違いを避ける一方で、より賢くなるためのデータを収集するという、セーフティ・ループが生まれます。
このシステムは、様々な屋内および屋外の環境において、実際の人々を用いてテストされました。研究者たちは、ロボットを近づけるための手を振る動作、ロボットを止めるための手を挙げる動作、あるいは利用不可を示すために電話をしているふりをする動作など、7つの一般的な社会的ジェスチャのデータセットを収集しました。また、「頭をかく」といった「ディストラクター(妨害)」となるジェスチャも含まれており、ロボットがそれを電話の動作と混同しないようにしました。これまでロボットを見たことがない人々に対してテストを行った際、システムは、手が部分的に隠れている場合でも、ほぼすべてのケースで正しくジェスチャを特定しました。手がデータから完全にマスクされた特定のテストでは、システムの精度が低い31パーセントから強力な85パーセントへと跳ね上がり、このトレーニング手法が有効であることを証明しました。また、システムは標準的なビデオカメラの速度に追いつくほど高速に動作し、ロボット搭載型コンピュータでフルフレームをわずか25ミリ秒で処理できました。これは人間にとって瞬時に感じられる速度です。
おそらく最も重要な発見は、展開後の学習能力です。研究者たちは、ロボットが確信を持てなかった瞬間をフラグ立てし、そのビデオクリップをクラウド上のより強力なコンピュータに送信するプロセスを構築しました。その強力なコンピュータがジェスチャにラベルを付け、ロボットはその新しい情報を使用して自身の「脳」を更新します。ロボットが「サムズアップ」「握手」「敬礼」という3つの新しいジェスチャを学んだテストでは、元の7つのジェスチャを忘れることなく、それらを正常に学習しました。システムは古いジェスチャに対して高い精度を維持したまま、新しいジェスチャを約3分の2の割合で正しく識別しました。これは、ロボットがシャットダウンしてゼロから再学習させることなく、時間の経過とともに社会的合図の語彙を広げ、新しい状況に適応できる道筋を示しています。
研究者たちはまた、ライブロボットであるヒューマノイドマシン「Unitree G1」を用いて、トレーニングに参加していない5人の新しい人々とのテストを行いました。150回の試行において、ロボットは97パーセントの割合でジェスチャを正しく認識しました。ロボットが行動を決定したとき、接近する、あるいは停止するといった正しい行動を選択したのは98パーセントでした。行動しなかった数少ないケースは、間違いを犯したからではなく、慎重であったためです。つまり、間違った動きをするリスクを避けるために「待機」を選択したのです。この保守的なアプローチこそが、設計者が公共の場におけるロボットに意図したものです。この研究は、軽量で高速なモデルと、セーフティ・ファーストの戦略、そしてオフライン学習のためのループを組み合わせることで、効率的であるだけでなく、社会的意識を持ち、予測不可能な人間との相互作用に適応できるロボットを構築できることを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。