← 최신 논문
💻 computer science

RoboGesture: Real-Time Semantic-aligned Co-Speech Gestures Generation for Humanoid Interaction

RoboGesture는 새로운 데이터셋, 계층적 오디오-모션 정렬, 그리고 모델 예측 제어 안전 필터링을 통해 휴머노이드 로봇이 실시간의, 의미론적으로 정렬된, 그리고 충돌 없는 동시 발화 제스처를 생성할 수 있도록 데이터 부족, 오디오 소홀, 그리고 안전 문제를 해결하는 포괄적인 프레임워크이다.

원저자: Zifan Wang, Ziang Ren, Pengyang Shi, Zirui Wang, Chenghuai Lin, Tianze Wang, Zekun Qi, Liangliang Zhao, He Wang, Li Yi

게시일 2026-09-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zifan Wang, Ziang Ren, Pengyang Shi, Zirui Wang, Chenghuai Lin, Tianze Wang, Zekun Qi, Liangliang Zhao, He Wang, Li Yi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간은 항상 말 이상의 것을 통해 소통해 왔습니다. 우리가 말을 할 때, 우리의 손은 움직이고, 어깨는 움직이며, 얼굴의 표정은 변화합니다. 이 모든 것은 목소리의 리듬 및 의미와 완벽하게 조화를 이룹니다. 이러한 움직임은 무작위적인 것이 아니라, 우리가 서로 연결되는 방식의 필수적인 부분입니다. 로봇이 학교, 병원, 혹은 가정에서 우리의 일상적인 파트너가 되기 위해서는, 로봇 또한 이와 동일한 동작의 언어를 배워야 합니다. 오랫동안 과제였던 것은 기계가 문장을 듣고 자연스럽고 안전하며 의미 있는 제스처로 즉각 반응하도록 가르치는 일이었습니다. 지금까지 로봇은 소리를 듣고 생동감 있게 느껴지는 방식으로 팔다리를 움직이는 것 사이의 간극을 메우는 데 어려움을 겪어 왔으며, 이는 종종 딱딱하고 반복적이거나 심지어 위험한 움직임으로 이어졌습니다.

한 연구팀은 휴머노이드 로봇이 인간의 음성을 듣고 실시간으로 동기화된 표현력 있는 신체 움직임으로 반응할 수 있도록 설계된 '로보제스처(RoboGesture)'라는 새로운 시스템을 개발했습니다. 연구진은 로봇이 특정 단어 및 감정에 맞춰 300가지 이상의 다양한 방식으로 팔과 손을 움직이는 법을 가르치기 위해 방대한 데이터 라이브러리에서 시작하는 완전한 프레임워크를 구축했습니다. 그런 다음, 연구진은 로봇이 말을 텍스트로 먼저 변환할 필요 없이 목소리의 톤과 리듬을 직접 들을 수 있도록 하는 컴퓨터 브레인을 만들었습니다. 이 접근 방식은 로봇이 단어가 완전히 발화되기 전에도 움직임을 예측할 수 있게 해주는데, 이는 마치 사람이 소리를 지르기 전에 몸을 뒤로 젖히는 것과 같습니다. 로봇이 자신이나 주변 사람들을 다치게 하지 않도록, 이 시스템에는 초당 수천 번 실행되는 안전 점검 기능이 포함되어 있어 충돌로 이어질 수 있는 모든 움직임을 차단합니다. 실제 로봇에 테스트했을 때, 이 시스템은 이전 방식보다 더 안전하면서도 리듬감 있고 의미론적으로 적절한 제스처를 생성하여, 기계가 진정으로 인간처럼 느껴지는 유동적인 대면 대화에 참여할 수 있게 했습니다.

이 여정은 기존의 데이터가 불충분하다는 인식에서 시작되었습니다. 로봇에게 제스처를 가르치려는 기존의 대부분의 시도는 작은 데이터셋에 의존하거나, 음성을 먼저 텍스트로 변환하는 방식을 사용했는데, 이는 질문이나 명령을 나타내는 톤의 상승과 하강 같은 목소리의 미묘한 음악성을 제거해 버렸습니다. 연구진은 로봇이 자연스럽게 움직이게 하려면, 단어가 발화되기 전 발생하는 아주 작은 휴지기나 에너지의 분출을 포함하여 원시 오디오 자체를 이해해야 한다는 것을 깨달았습니다. 이를 해결하기 위해 연구진은 로봇을 위한 새로운 대규모 데이터셋을 구축했습니다. 그들은 인간의 제스처를 기록하고 이를 로봇의 고유한 신체 구조에 정밀하게 매핑하여, 모든 움직임이 물리적으로 가능하고 자기 충돌이 없도록 했습니다. 이 과정에는 수백만 개의 오디오와 동작 쌍을 생성하여, 특정 소리 패턴이 특정 손 모양이나 팔의 흔들림을 유발해야 함을 로봇에게 가르치는 작업이 포함되었습니다.

시스템의 핵심에는 인간이 언어를 처리하는 방식을 모방한 2단계 프로세스가 있습니다. 첫째, '시맨틱-어쿠스틱 얼라이너(semantic-acoustic aligner)'라고 불리는 구성 요소는 들어오는 소리를 듣고 이를 두 가지 정보 계층으로 분해합니다. 한 계층은 언어의 빠른 리듬 비트를 포착하고, 다른 계층은 더 깊은 의미와 감정적 의도를 식별합니다. 이를 통해 로봇은 무엇이 말해지고 있는지뿐만 아니라, 그것이 어떻게 말해지고 있는지까지 이해할 수 있습니다. 두 번째 부분인 '모션 제너레이터(motion generator)'는 이러한 단서들을 가져와 연속적인 움직임의 흐름을 만들어냅니다. 여기서 핵심적인 혁신은 로봇이 자신의 과거 움직임에 너무 과하게 의존하여 단순히 똑같은 동작을 반복하는 루프에 빠지는 것을 방지하는 기술입니다. 시스템이 끊임없이 오디오를 다시 살펴보도록 강제함으로써, 로봇은 역동적이고 반응적인 상태를 유지하며 화자의 톤이 변하는 즉시 제스처를 바꿀 준비를 갖추게 됩니다.

안전은 이 프로젝트의 타협할 수 없는 요구 사항이었습니다. 로봇은 금속 팔과 관절을 가진 물리적인 기계이기 때문에, 계산 착오가 발생하면 충돌이나 충돌 사고로 이어질 수 있기 때문입니다. 연구진은 계획된 경로가 부드럽고 충돌이 없는지 확인하기 위해 매 순간 움직임을 검사하는 수호자 역할을 하는 최종 안전 필터를 추가했습니다. 이 필터는 실시간으로 복잡한 수학적 문제를 해결하여 계획된 경로가 매끄럽고 충돌이 없음을 보장합니다. 테스트 결과, 이 필터는 잠재적 자기 충돌 발생률을 4% 이상에서 0%에 가까운 아주 낮은 수치로 줄여, 시스템을 실제 상호작용에 충분히 안전하게 만들었습니다. 전체 과정은 매우 빠른 속도로 진행되어, 로봇이 인간의 대화 속도를 따라잡으며 지연 없이 연속적인 루프로 듣고, 생각하고, 움직일 수 있게 합니다.

연구진이 정교한 손을 갖춘 물리적인 휴머노이드 로봇에 이 시스템을 테스트했을 때, 결과는 놀라웠습니다. 다른 고급 방식들과의 나란한 비교에서, 그들의 로봇은 언어의 의미에 훨씬 더 정확한 제스처를 생성했습니다. 다른 시스템들이 특정 손 신호를 포착하지 못하거나 덜컥거리고 부자연스러운 움직임을 보였던 반면, 이 로봇은 유동적인 자신감을 가지고 움직였습니다. 이 로봇은 "OK"나 "정지"와 같은 단어에 대해 성공적으로 특정 제스처를 생성했으며, 신체 언어를 통해 흥분이나 강조와 같은 복잡한 감정을 표현할 수 있었습니다. 또한 이 시스템은 다른 모델들을 괴롭혔던 자기 침투적 움직임을 피하며 매우 안전하다는 것을 입증했습니다. 연구는 풍부한 데이터셋, 직접적인 오디오-투-모션 접근 방식, 그리고 엄격한 안전 점검을 결합함으로써, 로봇이 단순히 말하는 것을 넘어 자연스럽고 매력적인 방식으로 우리와 진정으로 상호작용하는 것이 가능하다는 결론을 내립니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →