PAMoR: Parameterized Affective Motion Generation in Real Time for Humanoid Robots
본 논문은 운동학으로부터 유도된 정서적 가치-각성 좌표를 사용하여 정동적 움직임을 정량적으로 매개변수화함으로써, 높은 동작 충실도를 유지하면서도 명령된 감정을 정확하게 전달하는 표현력 있는 전신 움직임 생성을 가능하게 하는 휴머노이드 로봇을 위한 실시간 시스템인 PAMoR을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
쇼핑몰에서부터 콘서트 무대에 이르기까지, 우리 일상의 북적이는 공간 속에서 로봇들이 우리 사이를 움직이기 시작했습니다. 우리는 단순히 로봇이 상자를 들어 올릴 수 있는지, 혹은 방을 가로질러 걸을 수 있는지를 보기 위해 그들을 관찰하는 것이 아닙니다. 우리는 그들이 어떻게 '느끼는지'를 보기 위해 그들을 관찰합니다. 인간은 움직임 속에서 감정을 읽도록 타고났습니다. 처진 어깨는 슬픔을 암시하고, 활기찬 발걸음은 기쁨을 암시합니다. 이것은 우리가 말 없이도 이해하는 몸의 언어이며, 다른 사람들과 상호작용할 때 끊임없이 사용하는 기술입니다. 하지만 로봇이 이 언어를 구사하기 위해서는 단순히 과업을 수행하는 것을 넘어, 특정한 정서적 톤을 가지고 그 과업을 수행해야 합니다. 지금까지 기계에게 이를 가르치는 것은 어려웠습니다. 디지털 캐릭터를 위한 감정적 움직임을 생성하는 대부분의 시스템은 인간 배우가 제공하는 참조 영상이나 "행복함"과 같은 단순한 레이블에 의존합니다. 이러한 방식은 경직되어 있습니다. 레이블은 움직임을 약간 더 흥분되게 하거나 약간 덜 긴장되게 미세하게 조정할 수 없으며, 영상 참조는 시간에 고정되어 있어 즉석에서 기분을 바꿀 수 없습니다. 더욱이, 이러한 디지털 움직임이 물리적인 로봇으로 전송될 때, 움직임이 전달하고자 했던 바로 그 감정을 왜곡하여, 감정을 실어 나르는 미세한 속도와 자세의 변화를 잃어버리는 경우가 많습니다.
연구팀은 이 문제를 해결할 새로운 방법을 개발하여, 물리적인 로봇이 실시간으로 감정적인 움직임을 생성하고 움직이는 동안 기분을 조절할 수 있는 시스템을 만들었습니다. 그들은 이 프레임워크를 PAMoR라고 부릅니다. 인간의 레이블이나 사전 녹화된 영상에 의존하는 대신, 이 시스템은 감정을 측정 가능한 물리적 양의 집합으로 취급합니다. 이 시스템은 감정을 두 가지 단순한 척도 위에 매핑하는 'valence-arousal(정서가-각성)' 평면이라는 심리학 모델을 사용합니다. 첫 번째 척도인 valence(정서가)는 감정이 얼마나 긍정적인지 또는 부정적인지를 측정하며, 슬픔에서 행복까지의 범위를 가집니다. 두 번째 척도인 arousal(각성)은 감정이 얼마나 활동적인지 또는 차분한지를 측정하며, 지루함에서 흥분까지의 범위를 가집니다. 연구진은 로봇 자신의 신체 움직임으로부터 이 두 숫자를 직접 계산할 수 있다는 것을 발견했습니다. 그들은 긍정적이고 행복한 느낌이 열려 있고 확장된 자세와 대응하는 반면, 부정적인 느낌은 수축되고 접힌 자세와 대응한다는 것을 발견했습니다. 마찬가지로, 높은 에너지와 속도는 높은 각성을 나타내고, 느리고 정지된 움직임은 낮은 각성을 나타냅니다. 이러한 물리적 관찰을 수학적 공식으로 변환함으로써, 시스템은 인간이 관찰하고 기록할 필요 없이 모든 움직임에 정밀한 감정 좌표를 부여할 수 있습니다.
연구진은 29개의 관절을 가진 휴머노이드 기계인 Unitree G1을 사용하여 이 시스템을 사용할 수 있는 로봇을 구축했습니다. 로봇의 뇌는 동시에 세 가지 서로 다른 명령을 듣도록 설계되었습니다. 한 가지 명령은 걷기나 펀치와 같은 동작을 수행하라는 것입니다. 나머지 두 명령은 valence와 arousal 숫자를 설정함으로써 그 동작을 어떻게 수행할지를 알려줍니다. 이 과정에서 명령들이 서로 혼동되지 않도록, 시스템은 세 개의 별도 학습 모델을 결합하는 특별한 방법을 사용합니다. 하나의 모델은 동작을 학습하고, 나머지 두 모델은 서로 다른 감정적 톤으로 그 동작을 형성하는 법을 학습합니다. 움직임 생성의 매 단계마다 이 모델들은 함께 작동하여 명령에 부합하는 동작을 만들어냅니다. 이를 통해 로봇은 움직이는 동안 기분을 바꿀 수 있습니다. 사용자가 로봇에게 걷으라고 명령한 뒤, 걷는 도중에 명령을 "차분하고 중립적인" 상태에서 "흥분되고 행복한" 상태로 바꾸면, 로봇은 즉시 새로운 기분에 맞춰 보폭과 자세를 조절합니다.
이 연구의 결과는 시스템이 놀라울 정도로 잘 작동한다는 것을 보여줍니다. 연구진이 특정 감정 좌표에 따라 움직이도록 명령했을 때, 로봇의 실제 움직임은 높은 정밀도로 그 명령과 일치했습니다. 시스템은 괴로움에서부터 편안함에 이르기까지 전체 감정 범위를 생성할 수 있었으며, 로봇의 바디랭귀지는 이 스펙트럼을 따라 매끄럽게 변화했습니다. 인간이 실제로 이러한 감정을 읽을 수 있는지 확인하기 위해, 연구진은 사람들이 다양한 감정적 톤으로 손을 흔들거나 펀치를 하는 로봇의 영상을 시청하는 연구를 실시했습니다. 관찰자들은 로봇이 어떤 감정을 표현하고 있는지 추측하도록 요청받았습니다. 시스템은 의도한 감정을 관찰자들에게 명확하게 전달하는 데 성공했습니다. 실험의 약 40%에서 관찰자들은 로봇이 전달하려던 특정 감정을 정확히 식별했습니다. 이는 텍스트 프롬프트나 영상 참조에 의존했던 이전 방식보다 유의미한 개선이며, 사람들이 인간 배우의 감정적 움직임을 볼 때 달성하는 인식 수준에 근접한 수치입니다. 또한 연구는 로봇의 움직임이 기계적이거나 딱딱하지 않고 자연스러우며 인간답게 느껴진다는 것을 확인했습니다.
이 접근 방식은 우리가 로봇의 움직임을 생각하는 방식의 변화를 의미합니다. 감정을 과업 위에 얹혀진 별개의 층으로 취급하는 대신, 연구진은 그것을 로봇 신체의 물리적 실체에 기반을 두었습니다. 자세와 속도를 직접 측정함으로써, 그들은 감정을 단순히 레이블이 아니라 볼륨이나 속도처럼 쉽게 조절할 수 있는 제어 가능한 파라미터로 만드는 시스템을 구축했습니다. 이 시스템은 실시간으로 작동하므로, 로봇은 환경에 반응하고 자신의 감정적 표현을 즉각적으로 바꿀 수 있습니다. 연구진은 현재 시스템이 신체 형태와 감정의 관계에 대한 사전 프로그래밍된 이해에 의존하고 있으며, 향후 작업에서는 물리적 제어기가 작은 오류를 범할 때 로봇이 어떻게 이 표현을 유지할 것인가를 다뤄야 한다고 언급했지만, 그 토대는 견고합니다. 그들은 로봇이 즉석에서 복잡하고 감정적인 전신 동작을 생성할 수 있으며, 인간이 놀라운 정확도로 그 감정을 읽을 수 있다는 것을 입증했습니다. 이는 로봇이 단순한 기능적 도구를 넘어, 신체의 보편적인 언어로 자신을 표현할 수 있는 사회적 파트너가 되는 미래에 한 걸음 더 다가서게 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.