SocioGesture: Real-Time and Adaptive Social Gesture Perception for Human-Robot Interaction
본 논문은 폐쇄 인지형 오염(occlusion-aware corruption)을 통해 학습된 경량 듀얼 스트림 모델을 활용하여 에지 장치에서 견고하고 저지연인 인식을 달성하는 동시에 오프라인 적응을 통해 어휘를 지속적으로 확장하는, 인간-로봇 상호작용을 위한 실시간 적응형 사회적 제스처 인지 시스템인 SocioGesture를 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇들이 우리 세상 속에서 움직이는 법을 배우고 있지만, 우리와 자연스럽게 상호작용하기 위해서는 단순히 말로 하는 명령을 따르는 것 이상의 능력이 필요합니다. 로봇은 인간 움직임의 무언의 언어, 즉 인사를 하기 위한 손 흔들기, 멈추라는 신호인 손바닥 들기, 혹은 "나는 바쁘다"는 신호인 귀에 전화기를 대는 동작 등을 이해해야 합니다. 이것이 바로 인간-로봇 상호작용(human-robot interaction)의 과제이며, 기계에게 이러한 사회적 신호를 읽는 법을 가르치는 데 전념하는 분야입니다. 어려움은 현실 세계의 무질서한 실체에 있습니다. 조용한 사무실에서 보는 영상과 달리, 로봇은 움직이는 각도에서 사람을 보게 되며, 종종 손이 몸 뒤로 숨겨지거나 그림자 속에 사라지기도 합니다. 더욱이, 로봇은 오랫동안 멈춰 서서 생각할 여유가 없습니다. 제스처를 해석하느라 너무 오래 망설이면 상호작용이 끊기고 부자연스럽게 느껴지기 때문입니다. 목표는 대화를 따라갈 수 있을 만큼 충분히 빠르고, 누락된 정보를 처리할 수 있을 만큼 똑똑하며, 매번 인간이 다시 프로그래밍할 필요 없이 실수로부터 배울 수 있는 시스템을 구축하는 것입니다.
OpenMind의 연구진은 이 문제를 해결하기 위해 SocioGesture라고 불리는 새로운 시스템을 개발했습니다. 이는 움직이며 작업하는 로봇이 사회적 제스처를 인식할 수 있도록 특별히 설계된 실시간 인지 도구입니다. 이 시스템은 사람의 의상이나 배경을 분석하는 대신, 사람의 골격(관절과 뼈의 지도)을 관찰하는 방식으로 작동합니다. 이러한 접근 방식이 선택된 이유는 조명이 변하거나 사람이 다른 옷을 입더라도 골격은 식별 가능한 상태로 유지되기 때문입니다. 하지만 연구진은 표준적인 골격 추적이 손이 가려지거나 카메라 각도가 바뀌면 실패할 수 있다는 점을 알고 있었습니다. 이를 해결하기 위해 그들은 모든 개별 관절의 신뢰도(confidence)에 주목하는 모델을 구축했습니다. 로봇의 카메라가 손의 위치를 확신하지 못할 경우, 시스템은 맹목적으로 추측하는 대신 그 불확inc성(uncertainty)을 기록합니다. 이 시스템은 신체의 큰 움직임과 손의 세밀한 디테일을 결합하여, 로봇에 탑재된 컴퓨터에서 직접 실행되는 단 하나의 번개처럼 빠른 계산으로 통합합니다.
SocioGesture의 핵심 혁신은 피할 수 없는 데이터의 공백을 처리하는 방식에 있습니다. 기존의 많은 시스템에서는 손목과 같은 주요 관절이 누락되면 전체 인식 시도가 실패하곤 했습니다. 이 새로운 시스템은 그러한 공백을 예상하도록 훈련되었습니다. 연구진은 컴퓨터 시뮬레이션에서 손과 팔을 의도적으로 가림으로써 데이터를 "오염(corrupted)"시켰고, 이를 통해 모델이 골격의 일부가 보이지 않더라도 제스처를 인식하는 법을 배우도록 강제했습니다. 이러한 훈련은 로봇이 실험실을 떠나기 전에 이루어지므로, 로봇은 견고함을 갖추기 위해 추가적인 컴퓨팅 파워를 필요로 하지 않습니다. 현장에 있는 동안 로봇은 자신이 보는 것에 기반해 결정을 내립니다. 만약 제스처에 대해 확신이 있다면 즉시 행동합니다. 만약 불확실하다면, 추측하는 대신 그 상호작용의 순간을 나중에 검토하기 위해 저장합니다. 이는 로봇이 자신을 멈추려는 사람에게 다가가는 것과 같은 위험한 실수를 피하면서도, 더 똑똑해지기 위한 데이터를 계속 수집할 수 있게 하는 안전 루프를 생성합니다.
이 시스템은 다양한 실내외 환경에서 실제 사람들을 대상으로 테스트되었습니다. 연구진은 로봇을 가까이 오도록 초대하는 손 흔들기, 로봇을 멈추게 하는 손 들기, 혹은 통화 중임을 알리기 위해 전화기를 든 척하는 동작 등 7가지의 흔한 사회적 제스처에 대한 데이터셋을 수집했습니다. 또한, 로봇이 전화 통화를 제스처와 혼동하지 않도록 머리를 긁는 것과 같은 "방해(distractor)" 제스처도 포함했습니다. 학습 데이터에 없던 사람들을 대상으로 테스트했을 때, 시스템은 손이 부분적으로 가려진 경우에도 거의 모든 경우에 제스처를 정확하게 식별했습니다. 특히 손이 데이터에서 완전히 가려진 특정 테스트에서, 시스템의 정확도는 형편없는 31%에서 강력한 85%로 급증하며 훈련 방식이 효과적임을 증명했습니다. 또한 시스템은 표준 비디오 카메라의 속도를 따라갈 수 있을 만큼 빨랐으며, 로봇에 장착된 컴퓨터에서 전체 프레임을 단 25밀리초 만에 처리했는데, 이는 인간 관찰자에게 즉각적인 느낌을 주기에 충분한 속도입니다.
아마도 가장 중요한 발견은 배포 후 학습할 수 있는 시스템의 능력일 것입니다. 연구진은 로봇이 불확실했던 순간을 표시(flag)하고 해당 비디오 클립을 클라우드의 더 강력한 컴퓨터로 보내는 프로세스를 설정했습니다. 그 강력한 컴퓨터가 제스처를 라벨링하면, 로봇은 그 새로운 정보를 사용하여 자신의 뇌를 업데이트합니다. 로봇이 세 가지 새로운 제스처(엄지 척, 악수, 경례)를 배우도록 가르친 테스트에서, 로봇은 기존의 7가지 제스처를 잊지 않으면서도 성공적으로 새로운 것을 배웠습니다. 시스템은 기존 제스처에 대한 높은 정확도를 유지하면서도 새로운 제스처를 약 3분의 2의 확률로 정확하게 식별했습니다. 이는 로봇이 멈추거나 처음부터 다시 훈련될 필요 없이, 시간이 지남에 따라 사회적 신호의 어휘를 확장하고 새로운 상황에 적응할 수 있는 길을 보여줍니다.
연구진은 또한 이 시스템을 휴머노이드 로봇인 Unitree G1에서 테스트하였으며, 이 로봇은 훈련 데이터에 포함되지 않은 5명의 새로운 사람들과 상호작용했습니다. 150회의 시행착오를 거치며 로봇은 제스처를 97%의 확률로 정확하게 인식했습니다. 로봇이 행동하기로 결정했을 때, 다가가거나 멈추는 것과 같은 올바른 행동을 선택한 비율은 98%였습니다. 로봇이 행동하지 못한 몇 안 되는 경우는 실수를 해서가 아니라 신중함을 기하기 위해서였으며, 잘못된 움직임을 감수하느니 기다리는 쪽을 택했습니다. 이러한 보수적인 접근 방식은 공공장소에 있는 로봇을 위해 설계자들이 의도한 바와 정확히 일치합니다. 이 연구는 가볍고 빠른 모델과 안전 우선 전략, 그리고 오프라인 학습 루프를 결적으로 결합함으로써, 우리가 효율적일 뿐만 아니라 예측 불가능한 인간의 상호작용에 사회적으로 인지하고 적응할 수 있는 로봇을 구축할 수 있음을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.