← 최신 논문
💻 computer science

Tri-Manual Visuomotor Imitation Learning of Robot Policies

이 논문은 기존의 양팔 텔레오퍼레이션의 한계를 극복하기 위해, 작업 제약 조건을 유지하면서 독립적인 팔의 움직임을 오프라인 리타이밍(retiming)함으로써 단일 인간 운영자가 삼중 수동 로봇을 위한 동기화된 정책을 효과적으로 시연하고 학습할 수 있도록 하는 의존성 인식 삼중 팔 스케줄링(Dependency-Aware Tri-Arm Scheduling, DATS)을 특징으로 하는 모방 학습 시스템인 TriManPolicy를 소개한다.

원저자: James Zhao, Mingyuan Ba, Weiming Zhi

게시일 2026-08-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: James Zhao, Mingyuan Ba, Weiming Zhi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 시행착오를 거치는 대신 인간이 하는 것을 먼저 관찰함으로써 집안일을 배우는 세상을 상상해 보세요. 이 분야는 '모방 학습(imitation learning)'이라고 불리며, 이는 마치 당신이 채소를 썰고 냄비를 젓는 것을 보여줌으로써 로봇에게 요리하는 법을 가르치는 것과 같습니다. 보통 이 방식은 로봇과 인간의 손 개수가 같을 때 가장 잘 작동합니다. 만약 인간이 옷을 접기 위해 두 손을 사용한다면, 두 팔을 가진 로봇은 그 동작을 완벽하게 복사할 수 있습니다. 하지만 로봇이 초능력을 갖추어 팔이 세 개인데, 인간 스승은 손이 두 개뿐이라면 어떻게 될까요? 이것이 바로 과학자들이 해결하려는 퍼즐입니다. 그들은 로봇이 한 번에 두 팔만 제어할 수 있는 인간을 관찰함으로써, 세 번째 '보조' 팔을 사용하는 법을 배울 수 있는지 알고 싶어 합니다. 만약 로봇이 인간의 타이밍을 똑같이 따라 하려고 한다면, 로봇은 동시에 세 가지 일을 할 수 있음에도 불구하고 인간이 손을 바꾸기를 기다리며 멈춰 서게 될 수도 있습니다. 핵심 질문은 이것입니다. 우리가 로봇에게 인간의 '전환 지연(switching delays)'을 무시하고, 세 개의 팔을 동시에 사용하는 법을 깨우치게 할 수 있을까요?

여기에 두 손을 가진 인간 스승을 이용해 세 팔을 가진 로봇을 가르치기 위해 설계된 영리한 새로운 시스템인 TriManPolicy가 등장했습니다. 연구진은 인간이 세 팔 로봇을 제어할 때, 인간은 두 팔을 제어하다가 다른 한 쌍의 팔로 전환해야 하므로 교대로 움직여야 한다는 사실을 발견했습니다. 즉, 한 팔은 멈춘 상태로 두어야 합니다. 만약 로봇이 단순히 이 영상을 그대로 복사한다면, 로봇 역시 모드를 전환하기 위해 기다리는 인간처럼 멈추는 법을 배우게 됩니다. 이를 해결하기 위해 팀은 DATS(Dependency-Aware Tri-Arm Scheduling, 의존성 인식 삼중 팔 스케줄링)라는 디지털 '시간 여행' 도구를 만들었습니다. DATS를 영화 편집기라고 생각하면 쉽습니다. 이 편집기는 인간의 녹화 영상을 보며 타임라인을 재편집합니다. 이 도구는 인간이 한 손으로 가방을 벌리고 있는 동안 다른 두 손으로 수건을 접는 것과 같은 실제 움직임들은 모두 유지하지만, 인간이 제어권을 바꾸느라 멈췄던 어색한 일시 정지 구간들은 제거합니다. DATS는 어떤 동작이 특정 순서대로 반드시 일어나야 하는지(예: 상자 위에 뚜껑을 덮은 후 상자를 내려놓는 것)와 어떤 동작이 동시에 일어날 수 있는지(예: 한 팔이 상자를 고정하는 동안 다른 팔이 닦는 것)를 파악합니다. 이러한 동작들이 함께 일어나는 모습으로 영상을 재배치함으로써, 로봇이 진정한 세 팔의 슈퍼히어로가 되도록 훈련시킵니다.

결과는 인상적입니다. 연구진은 수건 접기, 봉투 테이프 붙이기, 지우개를 상자에 넣기 등 여섯 가지의 서로 다른 실제 과업을 대상으로 테스트를 진행했습니다. 각 과업당 25회의 실험을 수행했습니다. '시간 여행'을 거친 DATS 방식으로 훈련된 로봇들은 현저히 빨랐습니다. 실제로 모든 과업에서 DATS로 훈련된 로봇들은 편집되지 않은 원본 영상으로 훈련된 로봇들보다 더 짧은 시간 안에 작업을 마쳤습니다. 예를 들어, 지우개를 놓는 작업에서 DATS 로봇은 거의 50% 더 빨랐습니다. 또한, 이들은 다른 로봇들과 비슷하거나 혹은 더 자주 성공했습니다. 이 데이터는 로봇에게 인간의 전환 지연을 무시하고 과업의 논리적 흐름에 집중하도록 가르침으로써, 로봇이 세 팔을 매끄럽게 조율하는 법을 배워 투박하고 뚝뚝 끊기는 동작을 유연하고 동기화된 춤으로 바꿀 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →