Perception-and-action system for humanoid robot task execution in construction
이 논문은 휴머노이드 로봇이 인간의 시연으로부터 건설 작업을 학습하고 안정적으로 수행할 수 있도록 하는 Humanoid-PoseNet과 Humanoid-ActionNet으로 구성된 새로운 인지-행동 시스템을 제안하며, 평균 동작 추적 오차 82.45mm를 달성하였다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇이 단순히 바퀴 달린 투박한 기계나 벽에 고정된 팔이 아니라, 우리처럼 보이고 움직이는 파트너가 되는 세상을 상상해 보십시오. 이것은 휴머노이드 로봇 공학의 영역으로, 건설 현장, 주방, 혹은 사무실과 같이 인간이 만든 공간 속으로 걸어 들어와 매 단계마다 매뉴얼을 필요로 하지 않고도 무거운 짐을 옮길 수 있는 기계를 만들려는 분야입니다. 가장 큰 과제는 무엇일까요? 인간은 불규칙하고 유연하며 독특하지만, 로봇은 정밀하고 경직되어 있으며 특정 설계도에 따라 만들어진다는 점입니다. 만약 인간의 움직임을 로봇에게 그대로 복사하려고 시도한다면, 로봇의 다리가 더 짧거나 골반이 다르게 꺾이기 때문에 로봇이 발을 헛디디거나 넘어지거나 관절이 부러질 수 있습니다. 이를 해결하기 위해 과학자들은 모션 리타겟팅(인간의 움직임을 로봇의 움직임으로 '번역'하는 세련된 방식)과 강화 학습(로봇이 시행착오를 통해 배우며, 똑바로 서 있으면 '보상'을 받고 넘어지면 '벌칙'을 받는 방식)을 사용합니다. 목표는 로봇이 우리를 관찰함으로써 학습하게 하여, 궁극적으로는 인간 노동자처럼 벽돌을 나르거나 사다리를 오르는 등 우리가 세상을 건설하는 것을 돕게 하는 것입니다.
여기서 이 새로운 연구는 Unitree G1이라는 로봇을 위한 숙련된 번역가이자 엄격한 코치 역할을 합니다. 연구진은 휴머노이드 로봇이 건설 노동자가 과업을 수행하는 것을 지켜보고, 그가 무엇을 하고 있는지 이해한 다음, 스스로 넘어지지 않고 그 일을 해낼 수 있는지 확인하고자 했습니다. 그들은 이를 실현하기 위해 두 부분으로 구성된 시스템을 구축했습니다. 먼저, 그들은 Humanoid-PoseNet이라 불리는 '번역기'를 만들었습니다. 이것을 매우 똑똑한 카메라 뇌라고 생각하십시오. 이 뇌는 인간의 영상을 관찰합니다. 단순히 사람을 보는 것이 아니라, 3D 공간에서 모든 관절이 정확히 어디에 있는지 계산합니다. 하지만 까다로운 점은 인간의 신체 구조가 로봇과 다르다는 것입니다. 따라서 이 뇌는 인간의 움직임을 로봇의 특정 신체 형태에 맞게 즉각적으로 재작성하여, 로봇이 불가능한 방식으로 관절을 비틀지 않도록 보장합니다.
로봇이 무엇을 움직여야 할지 알게 되었다면, 이제는 충돌하지 않고 어떻게 움직여야 할지를 알아내야 합니다. 여기서 두 번째 부분인 Humanoid-ActionNet이 등장합니다. 이것은 '교사-학생' 방식을 통해 훈련된 로봇의 내부 코치입니다. '교사'는 컴퓨터 시뮬레이션 속에 살며 물리 법칙(벽돌이 얼마나 무거운지 또는 바닥이 얼마나 미끄러운지와 같은 것들)에 대해 모든 것을 알고 있는 강력한 버전의 로봇입니다. 교사는 균형을 유지하며 움직이는 완벽한 방법을 배웁니다. 그런 다음, 교사는 '학생' 버전의 로봇을 가르칩니다. 학생은 실제로 세상 밖으로 나갈 로봇이지만, 물리 법칙의 비밀에 의존해서는 안 됩니다. 학생은 실제 로봇이 그러하듯, 자신의 관절을 느끼고 목표 움직임을 관찰하며 배워야 합니다. 이를 통해 로봇이 컴퓨터를 떠나 실제 건설 현장에 발을 내디딜 때, 시뮬레이션과 현실 사이의 차이로 인해 혼란을 겪지 않도록 합니다.
연구팀은 이 시스템을 무거운 파이프 운반, 자재 쌓기, 깃발 흔들기, 울퉁불퉁한 지면 걷기 등 30가지의 다양한 건설 과업으로 테스트했습니다. 그들은 먼저 모션 캡처 스튜디오에서 다섯 명의 자원봉사자가 이러한 과업을 수행하는 모습을 기록했습니다. 그 후, 로봇 시스템이 이 기록으로부터 학습하도록 했습니다. 결과는 유망했습니다. 로봇은 이 복잡한 건설 동작 중 8가지를 성공적으로 학습했습니다. 컴퓨터 시뮬레이션에서 로봇은 관절 전반에 걸쳐 평균 약 82.45mm(평균 관절 위치 오차)의 오차로 인간의 움직임을 추적했습니다. 실제 환경에서 테스트했을 때, 로봇은 균형을 유지하면서 파이프를 운반하고, 콘크리트 블록을 들고, 심지어 깃발을 흔드는 데 성공하며 '번역'과 '코칭'이 효과적임을 입증했습니다.
하지만 이 논문은 이 솔루션이 완벽하다고 단정 짓지는 않습니다. 연구진은 로로봇이 이러한 과업을 수행할 수는 있었지만, 결점이 없었던 것은 아니라고 언급했습니다. 시뮬레이션에서, 특히 현실 세계의 물리 법칙(마찰력이나 무게 등)이 컴퓨터 모델과 완벽하게 일치하지 않을 때 로봇이 균형을 잃거나 비틀거리는 등 일부 실패 사례가 있었습니다. 또한 그들은 로봇의 손이 인간만큼 정교하지 않다는 점을 지적했습니다. 즉, 블록을 '잡을' 수는 있지만 인간 노동자처럼 섬세하게 '쥐는' 것은 어렵다는 것입니다. 이 연구는 이러한 접근 방식이 건설 현장에서 우리와 함께 일할 수 있는 로봇을 만들기 위한 견고한 첫걸음임을 시사하지만, 그들이 모방하려는 인간만큼 신뢰할 수 있고 적응력이 높게 만들기 위해서는 여전히 많은 작업이 남아 있습니다. 이 시스템은 로봇에게 노동자처럼 움직이는 법을 가르치는 것이 가능하다는 것을 보여주었지만, "걷는 법을 배우는 것"에서 "마천루를 건설하는 것"으로 가는 여정은 이제 시작일 뿐입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.