Learning to See While Learning to Act: Diffusion Models for Active Perception in Robot Imitation
이 논문은 로봇이 심각한 폐쇄 상황에서도 강건한 조작을 위해 유익한 카메라 각도를 능동적으로 추론할 수 있도록 액션 디노이징(action denoising)과 뷰포인트 정교화(viewpoint refinement)를 결합하여, 시뮬레이션에서의 상당한 성능 향상과 실제 세계 작업으로의 제로샷 전이를 가능하게 하는 모방 학습 프레임워크인 See2Act를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
선반 위에 있는 특정 장난감을 집으려고 하는데, 커다란 상자가 시야를 가로막고 있는 상황을 상상해 보세요. 그저 가만히 서서 선반만 뚫어지게 쳐다보고 있다면, 당신은 영영 그 장난감을 찾지 못할 수도 있습니다. 상자 주변을 돌아서 움직이고, 상자 너머로 고개를 내밀어 더 나은 각도를 확보해야만 비로소 손을 뻗을 수 있습니다.
이 논문은 정확히 이와 같은 동작을 수행하도록 학습하는 로봇의 두뇌인 See2Act를 소개합니다. 즉, 이 로봇은 손(팔)을 움직이는 법을 배우는 동시에 눈(카메라)을 움직이는 법을 배웁니다.
이 기술이 어떻게 작동하는지 쉬운 개념으로 나누어 설명하겠습니다.
문제점: "눈먼" 로봇
대부분의 로봇 학습 방식은 마치 눈가리개를 한 채 테이블 위의 아주 작은 한 구석만 볼 수 있는 사람이 퍼즐을 푸는 것과 같습니다. 이들은 필요한 모든 것을 이미 눈앞에 보고 있다고 가정합니다. 하지만 현실 세계에서는 물체들이 서로를 가리고 있습니다(폐쇄/occlusion). 로봇이 물체를 볼 수 없다면, 그것을 잡을 수도 없습니다.
해결책: "디노이징(Denoising)"의 춤
저자들은 **확산 모델(Diffusion Model)**이라는 유형의 AI를 사용합니다. 이것은 마치 조각가가 노이즈가 섞인 흐릿한 찰흙 덩어리에서 시작하여, 노이즈를 조금씩 깎아내며 완벽한 조각상을 드러내는 과정과 같습니다.
- 기존 방식: 로봇은 고정된 흐릿한 사진을 응시하면서, 그 사진 속에서 동작(손을 어디로 움직일지)을 찾아내기 위해 노이즈를 깎아냅니다.
- See2Act 방식: 로봇은 동작을 찾아내기 위해 노이즈를 깎아내는 동시에, 머리(카메라)도 함께 움직입니다.
로봇이 무엇을 할지 파악해 나갈수록, 동시에 어디를 보아야 할지도 함께 파악하게 됩니다.
- 시작: 로봇은 테이블 전체를 보여주는 넓고 흐릿한 뷰를 봅니다. 물체가 숨겨져 있기 때문에 로봇은 물체가 정확히 어디에 있는지 모릅니다.
- 춤: AI가 손의 움직임에 대한 추측을 "정화(clean up)"해 나감에 따라, 로봇은 동시에 카메라를 가까이 가져가고 각도를 조절하여 장애물 주변을 엿봅니다.
- 결과: 로봇이 손의 움직임에 대한 명확한 계획을 세울 때쯤, 로봇은 이미 카메라를 완벽한 근접 뷰로 이동시켜 숨겨진 물체를 찾아낸 상태가 됩니다.
훈련: "디지털 트윈"으로부터의 학습
로봇은 실제 세상에서 시행착오를 거치며 학습하지 않았습니다(그 방식은 느리고 위험합니다). 대신 연구진은 로봇과 방을 완벽하게 구현한 비디오 게임 버전인 **디지털 트윈(Digital Twin)**을 구축했습니다.
연구진은 누군가 물체를 집어 올리는 시연을 50번 보여주었습니다. 결정적으로, 단순히 로봇에게 손을 어떻게 움직이는지만 가르친 것이 아니라, 움직임의 매 단계마다 카메라가 어디에 있어야 하는지도 함께 가르쳤습니다. 로봇은 숨겨진 물체를 잡기 위해서는 먼저 카메라를 움직여서 그것을 봐야 한다는 점을 학습했습니다.
결과: 보는 것이 믿는 것
이 논문은 두 가지 방식으로 테스트를 진행했습니다.
비디오 게임 내에서의 테스트 (시뮬레이션):
- 물체가 상자 뒤에 숨겨져 있거나 통 안에 들어있을 때, 다른 로봇들은 완전히 실패했습니다(성공률 0%).
- See2Act는 약 **96%**의 확률로 성공했습니다. 로봇은 상자 주변을 돌아가고 통 안을 들여다보며 타겟을 찾아내는 법을 터득했습니다.
- 또한, 장애물이 없는 일반적인 작업에서도 다른 고급 로봇들을 능가하며, 움직이는 카메라가 정밀도를 높이는 데 도움이 된다는 것을 증명했습니다.
실제 환경에서의 테스트:
- 연구진은 비디오 게임에서 훈련된 로봇을 실제 실험실의 실제 금속 팔에 적용했습니다. 이 과정에서 실제 환경에 맞춰 다시 훈련하거나 미세 조정하지 않았습니다(이를 '제로샷 전이(zero-shot transfer)'라고 합니다).
- 로봇은 숨겨진 물체를 성공적으로 집어 올렸으며, 매우 높은 정밀도로 **95%**의 확률로 물체를 배치했습니다.
- 로봇은 물체를 밀어 넣기 전 근접 뷰를 얻기 위해 카메라를 움직임으로써, 1mm의 오차도 허용되지 않는 좁은 선반 틈에 베이스를 끼워 넣는 것과 같은 정밀한 작업도 수행해 냈습니다.
핵심 요약
See2Act는 매우 인간적인 기술을 학습한 로봇입니다. 즉, 보이지 않는다면, 볼 수 있을 때까지 머리를 움직이라는 것입니다. "보는 것(seeing)"과 "행동하는 것(acting)"을 하나의 연속적인 과정으로 결합함으로써, 이 로봇은 고정된 지점만을 응시하느라 단순한 작업에 갇혀 있는 다른 로봇들이 해결할 수 없는 문제들을 해결할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.