← 최신 논문
💻 computer science

Decompose and Reorganize: Planning with Primitives and Visuomotor Policies Learned from Demonstrations

이 논문은 시각-운동 정책을 작업 및 모션 계획(TAMP)과 통합하여 데모를 원자적 기술로 분해함으로써, 전통적인 계획 방식의 취약성과 순수 모방 학습의 일반화 한계를 극복하고 견고하며 데이터 효율적인 장기 로봇 조작을 가능하게 하는 DR-LfD 프레임워크를 제안한다.

원저자: Yizhou Chen, Hang Xu, Dongjie Yu, Yupu Lu, Tengye Xu, Zeqing Zhang, Wei Zhang, Yi Ren, Ben M. Chen, Jia Pan

게시일 2026-07-29
📖 5 분 읽기🧠 심층 분석

원저자: Yizhou Chen, Hang Xu, Dongjie Yu, Yupu Lu, Tengye Xu, Zeqing Zhang, Wei Zhang, Yi Ren, Ben M. Chen, Jia Pan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 저글링을 하며 외줄 타기를 하는 것과 같은 복잡한 마술을 가르치는 것을 상상해 보세요. 오랫동안 과학자들은 로봇을 가르치는 두 가지 주요 방법을 시도해 왔습니다. 첫 번째 방법은 인간이 작성한 엄격하고 단계적인 레시피를 로봇에게 주는 것과 같습니다. 이는 논리적이지만, 로봇이 숟가락을 떨어뜨리거나 테이블이 약간만 움직여도 레시피가 깨져서 로봇이 동작을 멈추게 됩니다. 두 번째 방법은 로봇에게 사람이 마술을 하는 영상을 보여주고 로봇이 그것을 보고 배우기를 바라는 것입니다. 이는 동작을 모방하는 데는 뛰어나지만, 만약 로봇이 영상 속의 숟가락 위치와 아주 조금이라도 다른 곳에 있는 숟가락을 보게 되면 혼란에 빠져 실패하게 됩니다. 핵심 질문은 이것입니다: 어떻게 하면 두 가지 방식의 장점을 모두 취할 수 있을까요? 어떻게 하면 모든 가능성을 학습하기 위해 수백만 개의 영상을 볼 필요 없이, 앞을 내다볼 만큼 똑똑하면서도 현실 세계의 무질서함에 유연하게 대처할 수 있는 로봇을 만들 수 있을까요?

이 논문은 이 퍼즐을 풀기 위해 노력하는 DR-LfD(Demonstrations로부터 분해되고 재구성된 기술)라고 불리는 새로운 시스템을 소개합니다. 이것을 단순히 7코스 요리의 거대한 레시피 하나를 통째로 암기하는 것이 아니라, 양파를 다지거나, 스테이크를 굽거나, 달걀을 휘젓는 것과 같이 작고 완벽한 "기술(skills)"로 나누어 익히는 마스터 셰프라고 생각해 보세요. 셰프는 각 작은 기술을 완벽해질 때까지 몇 번 연습합니다. 그러고 나서 고객이 새롭고 생소한 요리를 주문하면, 셰프는 당황하지 않습니다. 그저 주문을 확인하고, 자신의 머릿속 목록에서 미리 연습해 둔 적절한 기술들을 골라 새로운 요리를 만들기 위해 그 순서를 재배열할 뿐입니다.

이 논문은 긴 복잡한 과업을 이처럼 작고 재사용 가능한 "기술"로 나눔으로써, 로봇이 훨씬 더 빠르게 학습하고 새로운 상황에 훨씬 더 잘 대対処할 수 있다고 제안합니다. 20단계의 과업이 가질 수 있는 모든 조합을 학습하는 대신(이는 시간이 너무 오래 걸릴 것입니다), 로봇은 20개의 개별 단계를 단 한 번씩만 학습하면 됩니다. 그러면 스마트한 "플래너(planner, 계획가)"(셰프의 두뇌)가 어떤 새로운 작업이 주어지든 그 단계들을 어떻게 조합할지 결정합니다.

DR-LfD가 작동하는 방식은 로봇이 복잡한 비디오 게임을 배우는 비유를 들어 설명하겠습니다.

1. 게임을 레벨로 나누기 (Decomposition, 분해)
인간이 로봇에게 어떤 과업(예: 드라이버를 챙기거나 친구에게 컵을 건네주는 것)을 보여줄 때, 시스템은 전체 과정을 하나의 긴 영상으로 기록하지 않습니다. 대신 특수한 "접촉 감지기(contact detector)"를 사용하여 로봇의 손이 물체에 닿거나 놓는 순간을 포착합니다. 이를 통해 영상을 작은 조각들로 자릅니다.

  • "단순 동작(Simple Moves)": 컵을 집거나 내려놓는 것과 같은 쉬운 부분의 경우, 로봇은 "프리미티브(primitive)"를 학습합니다. 이것은 테이블 위의 어디에 있더라도 물체를 잡기 위해 팔을 어떻게 움직여야 하는지 정확히 아는, 마치 프로그래밍된 근육 기억과 같습니다.
  • "어려운 동작(Hard Moves)": 컵을 닦거나 물체를 두 손 사이로 전달하는 것과 같은 까다로운 부분의 경우, 로봇은 "시각-운동 정책(visuomotor policy)"을 학습합니다. 이것은 카메라를 관찰하며 물체를 안정적으로 유지하기 위해 실시간으로 손을 조절하는 반사 신경과 같습니다.
  • "연결 동작(Bridge Moves)": 빈 공간을 이동하는 동안에는 표준 수학을 사용하여 경로를 계획합니다.

2. 스마트 플래너 (Reorganization, 재구성)
로봇이 이러한 기술들의 "도구 상자"를 갖추게 되면, 단순히 순서대로 맹목적으로 실행하지 않습니다. 로봇은 **과업 및 동작 플래너(TAMP)**를 사용합니다. 이 플래너를 로봇 두뇌의 GPS라고 생각하세요.

  • 만약 로봇이 사람에게 컵을 건네줘야 한다면, 플래너는 다음과 같이 확인합니다: "컵이 닿을 수 있는 거리인가? 사람의 손이 올바른 위치에 있는가? 의자가 길을 막고 있지는 않은가?"
  • 만약 컵이 너무 멀리 있다면, 플래너는 단순히 "실패"라고 말하지 않습니다. 대신 이렇게 말합니다: "좋아, 먼저 의자를 치우고, 그다음 컵을 집은 뒤, 그다음에 건네주자."
  • 만약 로봇이 컵을 잡으려다 컵이 움직여서 놓친다면, 플래너는 이를 알아차리고 동작을 멈춘 뒤 새로운 경로를 다시 계산합니다. 이는 교통 체증이 발생했을 때 경로를 재탐색하는 GPS와 같습니다.

3. 시스템 테스트
저자들은 컴퓨터 시뮬레이션과 실제 로봇(ALOHA라는 듀얼 암 로봇 사용) 모두에서 이 시스템을 테스트했습니다. 그들은 각 기술에 대해 단 20번의 시연 데이터만을 제공했습니다.

  • 결과: 로봇에게 본 적 없는 낯선 장소에 물체를 두었을 때, 기존 방식(단순히 영상을 보는 방식 등)은 자주 실패했습니다. 하지만 DR-LfD는 계속해서 성공했습니다. 예를 들어, "구멍에 끼우기(peg-in-hole)" 과업에서 구멍의 위치가 바뀌었을 때 기존 방식들은 절반 정도 실패했지만, DR-LFD는 표준 테스트에서 100%, 매우 어렵고 무작위적인 테스트에서 88%의 성공률을 보였습니다.
  • 장애물 처리: 한 테스트에서 로봇의 팔을 가로막는 막대기를 놓았습니다. 로봇은 목표물에 닿을 수 없다는 것을 깨닫고, 플래너는 막대기를 먼저 치운 다음 목표물을 향해 손을 뻗으라고 지시했습니다. 로봇은 장애물을 성공적으로 제거하고 작업을 마쳤습니다.
  • 긴 과업 수행: 그들은 심지어 세 개의 다른 테이프를 바구니에 전달하거나, 컵을 닦으며 드라이버를 챙기는 것과 같은 긴 다단계 과업을 수행하게 했습니다. 이러한 특정 실험에서 로봇은 19개에서 21개의 단계를 성공적으로 연결했는데, 이는 보통 로봇이 혼란에 빠져 실패하게 되는 데피트입니다. 다만, 논문에서는 이러한 성공이 플래너의 계산 능력 범위 내에 있으며 테스트된 특정 과업들에 국한된 것임을 명시하고 있습니다.

논문에서 밝힌 한계점 (아직 할 수 없는 것)
저자들은 이것이 마법이 아니라는 점을 분명히 하고 있습니다. 이 시스템은 여전히 인간이 목표를 지정하거나 선호도를 제공해야 하며, 그러한 입력 없이는 스스로 "무엇을 해야 할지" 알아낼 수 없습니다. 또한, 로봇은 물체를 보기 위해 3D 깊이 카메라에 의존하기 때문에, 카메라가 더럽거나 조명이 좋지 않으면 혼란을 겪을 수 있습니다. 논문은 또한 과업이 너무 많은 물체와 함께 지나치게 복잡해지면, 플래너가 생각하는 데 시간이 더 오래 걸린다는 점(마치 사람이 너무 많은 선택지 때문에 압도당하는 것과 같음)을 언급했습니다.

결론
이 논문은 로봇에게 작고 재사용 가능한 기술을 학습시키고, 이를 스마트한 플래너를 통해 조합하도록 가르침으로써, 우리가 훨씬 더 유연하고 훨씬 더 적은 학습 데이터를 요구하는 로봇을 만들 수 있다는 것을 시사합니다. 이는 로봇이 지저진 방에 들어가서 (인간이 목표를 알려준다면) 무엇을 해야 할지 파악하고, 모든 가능한 시나리오마다 수백만 번의 연습 영상을 볼 필요 없이 과업을 수행할 수 있게 하는 단계로 나아가는 길입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →