PAMoR: Parameterized Affective Motion Generation in Real Time for Humanoid Robots
本論文では、運動学から導出されるバレンス・アローザル座標を用いて情動的な動きを定量的にパラメータ化することで、指示された感情を正確に伝えつつ高い動作忠実度を維持する、表現力豊かな全身運動の生成を可能にするヒューマノイドロボット向けリアルタイムシステム、PAMoRを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ショッピングモールからコンサートステージに至るまで、私たちの日常生活の混雑した空間において、ロボットが私たちの間を動き始めています。私たちは単に、彼らが箱を持ち上げられるか、あるいは部屋を歩き回れるかを見るために見守っているのではなく、彼らがどのように「感じている」のかを見るために見守っています。人間は、動きの中に感情を読み取るようにできています。丸まった肩は悲しさを暗示し、弾むような足取りは喜びを暗示します。これは言葉を使わずに理解できる身体の言語であり、私たちが他者と交流する際に絶えず使用しているスキルです。しかし、ロボットがこの言語を話すためには、単にタスクを実行するだけでなく、特定の感情的なトーンを持ってそのタスクを実行しなければなりません。これまで、機械にこれを教えることは困難でした。デジタルキャラクターに感情的な動きを作り出すほとんどのシステムは、人間の俳優に参照ビデオを提供させたり、「幸せ」のような単純なラベルを使用したりすることに依存していました。これらの手法は硬直しています。ラベルでは、動きを少しだけ興奮させたり、少しだけ緊張を解いたりといった微調整ができませんし、ビデオ参照は時間に固定されており、その場の気分に応じて変化させることはできません。さらに、これらのデジタルな動きが物理的なロボットに転送される際、そのプロセスによって、本来伝えられるはずだった感情そのものが歪められ、感情を運ぶ速度や姿勢の微妙な変化が失われてしまうことがよくあります。
研究チームは、この問題を解決するための新しい方法を開発し、物理的なロボットがリアルタイムで感情的な動きを生成し、動きながら気分を調整できるシステムを作り出しました。彼らはこのフレームワークをPAMoRと呼んでいます。人間のラベルや録画されたビデオに頼る代わりに、このシステムは感情を測定可能な物理量の一組として扱います。それは「バレンス(価数)ーアローザル(覚醒度)平面」として知られる心理学モデルを使用しており、感情を2つの単純なスケール上にマッピングします。第一のスケールであるバレンスは、感情がどれほどポジティブかネガティブかを測定し、悲しみから幸福まで及びます。第二のスケールであるアローザルは、感情がどれほど活動的か穏やかかを測定し、退屈から興奮まで及びます。研究者たちは、これら2つの数値をロボット自身の身体の動きから直接計算できることを発見しました。彼らは、ポジティブで幸せな感情は開いた、拡張した姿勢に対応し、ネガティブな感情は収縮した、折りたたまれた姿勢に対応することを見出しました。同様に、高いエネルギーと速度は高いアローザルを示し、遅く静止した動きは低いアローザルを示します。これらの物理的な観察を数学的な公式に変換することで、システムは、人間が観察して書き留める必要なく、目にするすべての動きに正確な感情の座標をラベル付けすることができるのです。
研究者たちは、このシステムを29個の関節を持つヒューマノイドマシンであるUnitree G1で活用できるロボットを構築しました。ロボットの脳は、同時に3つの異なる指示を聞くように設計されています。一つの指示は、歩く、あるいはパンチするといった、実行すべきアクションを伝えます。他の2つの指示は、バレンスとアローザルの数値を設定することによって、そのアクションをどのように実行するかを伝えます。これらが混乱しないように、システムは3つの独立した学習モデルを組み合わせる特別な手法を使用しています。一つのモデルはアクションを学習し、他の2つは異なる感情的なトーンでそのアクションを形作る方法を学習します。動きの生成の各ステップにおいて、これらのモデルは協力して、コマンドに適合する動作を生み出します。これにより、ロボットは動きながら気分を変えることができます。ユーザーはロボットに歩くよう命じることができ、その後、歩いている最中にコマンドを「穏やかでニュートラル」から「興奮して幸せ」へと変更すると、ロボットは即座に歩幅や姿勢を調整して新しい感情に合わせることができます。
この研究の結果は、システムが極めてうまく機能していることを示しています。研究者が特定の感情座標を持って動くよう命じたとき、ロボットの実際の動きは高い精度でそれらのコマンドに一致しました。システムは、苦悩した状態からリラックスした状態まで、フルレンジの感情を生成することができ、ロボットのボディランゲージはこのスペクトラムに沿って滑らかに変化しました。人間が実際にこれらの感情を読み取れるかどうかを確認するため、研究者は、人々が異なる感情的なトーンで手を振ったりパンチしたりするロボットのビデオを視聴する調査を実施しました。観察者は、ロボットがどのような感情を表現しようとしているかを推測するよう求められました。システムは、意図した感情を視聴者に明確に伝えることに成功しました。試行の約40パーセントにおいて、視聴者はロボットが伝えようとしていた特定の感情を正しく特定しました。これは、テキストのプロンプトやビデオ参照に依存していた従来の手法よりも大幅な改善であり、人間の俳優が感情的な動きを演じる際に人々が達成する認識レベルに近づいています。また、この研究は、ロボットの動きが機械的であったり硬かったりするのではなく、自然で人間らしいと感じられることも確認しました。
このアプローチは、私たちがロボットの動きをどのように考えるかという考え方の転換を意味しています。感情をタスクの上に付け加えられた別個のレイヤーとして扱うのではなく、研究者たちはそれをロボットの身体の物理的な現実に根ざしたものにしました。姿勢や速度を直接測定することで、彼らは感情を単なるラベルではなく、音量や速度と同じ容易さで調整できる制御可能なパラメータとして扱うシステムを作り上げたのです。システムはリアルタイムで動作するため、ロボットは環境に反応し、感情的な表現を即座に変更することができます。研究者たちは、現在のシステムが身体の形状と感情の関係についてのプログラムされた理解に依存しており、将来的な作業では、物理的なコントローラーが小さなエラーを起こしたときに、どのようにこの表現を維持するかに対処する必要があると指摘していますが、基礎は強固です。彼らは、ロボットがオンザフライで複雑かつ感情的な全身運動を生成できること、そして人間が驚くほどの正確さでそれらの感情を読み取れることを実証しました。これは、ロボットが単なる機能的な道具ではなく、身体という普遍的な言語を通じて自分自身を表現できることができる、社会的なパートナーとなる未来へと私たちを近づけています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。