← 최신 논문
🤖 machine learning

TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning

이 논문은 광범위한 행동 범위를 위해 디퓨전 노이즈를 주입하는 컨텍스트 평활화 사전 학습(Context-Smoothed Pre-training)과 탐색을 동적으로 제어하는 타임스텝 변조 강화 학습(Timestep-Modulated Reinforcement Learning)을 사용하여 행동 복제와 강화 학습을 연결하는 통합 프레임워크인 TMRL을 소개하며, 이를 통해 샘플 효율성을 크게 향상시키고 1시간 미만의 시간 내에 실제 로봇 정책 미세 조정을 성공적으로 수행할 수 있게 한다.

원저자: Matthew M. Hong, Jesse Zhang, Anusha Nagabandi, Abhishek Gupta

게시일 2026-08-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Matthew M. Hong, Jesse Zhang, Anusha Nagabandi, Abhishek Gupta

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 샌드위치를 만들거나 잃어버린 장난감을 찾는 것과 같은 새로운 일을 가르치는 것을 상상해 보세요. 보통 이 과정은 두 단계의 댄스처럼 진행됩니다. 먼저, 인간이 그 일을 완벽하게 수행하는 수천 개의 영상을 로봇에게 보여줍니다. 로봇은 마치 교과서를 암기하는 학생처럼 그것을 똑같이 복제하려고 노력합니다. 이것을 "모방 학습(imitation learning)"이라고 부릅니다. 하지만 여기에는 함정이 있습니다. 만약 로봇이 본 적 없는 상황—예를 들어, 샌드위치가 이상한 모양의 접시 위에 놓여 있는 상황—에 직면하면, 로봇은 당황합니다. 왜냐하면 로봇은 "교과서"에 나온 접시에 맞춘 정확한 동작만을 암기했기 때문에, 상황이 엉망이 되었을 때 어떻게 해야 할지 배우지 못해 멈춰버리거나 불가능한 동작을 시도하게 됩니다.

이를 해결하기 위해, 과학자들은 종로히 로봇에게 무작위적인 노이즈를 추가하여 로봇이 "탐색"하도록 가르치려 노력하기도 합니다. 예를 들어, 로봇에게 팔을 무작위로 흔들어 보며 어떤 일이 일어나는지 확인하라고 말하는 식입니다. 하지만 이것은 마치 핸들을 무작위로 돌려가며 운전을 배우는 것과 같습니다. 결국에는 성공할 수도 있겠지만, 위험하고 비효율적입니다. 여기서 중요한 질문은 이것입니다. 어떻게 하면 로봇이 지시를 따를 만큼 정밀하면서도, 단순히 눈먼 움직임을 보이는 대신 막혔을 때 새로운 시도를 할 수 있을 만큼 유연하게 가르칠 수 있을까요?

여기에서 TMRL(시점 조절 강화 학습, Timestep-Modulated Reinforcement Learning)이라는 새로운 아이디어가 등장합니다. 워싱턴 대학교와 아마존의 연구진은 로봇을 가르치는 방식에 영리한 변화를 제안합니다. 단순히 완벽한 동작을 암기하거나 무작위적인 혼돈을 더하는 대신, 그들은 로봇에게 세상에 대한 시야를 의도적으로 약간 "흐릿하게(blur)" 만드는 법을 가르칩니다.

이렇게 생각해 보세요. 당신이 케이크를 굽는 법을 배우고 있다고 가정해 봅시다. 만약 당신이 정확히 밀가루 2컵을 사용하는 방식으로만 케이크를 구워봤다면, 실수로 2.1컵을 사용했을 때 실패할 수도 있습니다. 하지만 연습하는 동안, 만약 2.1컵, 2.2컵, 혹은 3컵을 사용한다고 가정하며 연습한다면 어떨까요? 이러한 "흐릿한" 레시피로 연습함으로써, 당신은 재료가 완벽하지 않더라도 케이크가 여전히 잘 만들어진다는 것을 배우게 됩니다. 당신은 정확한 숫자가 아니라 베이킹의 '본질'을 배우는 것입니다.

로봇의 세계에서 "레시피"는 지시 사항(예: "빨간 블록을 집어라")이고, "재료"는 로봇의 센서(로봇이 보고 느끼는 것)입니다. 이 논문의 방법론인 **문맥 평활화 사전 학습(Context-Smoothed Pre-training, CSP)**은 로봇의 지시 사항에 약간의 "디지털 안개"를 더합니다. 이는 로봇이 지시가 약간 흐릿하더라도 행동하는 법을 가르칩니다. 이를 통해 로봇은 더 넓은 범위의 동작을 배우게 됩니다. 만약 로봇이 "빨간 블록을 집어라"라는 흐릿한 버전의 지시를 받는다면, 로봇은 빨간 블록이 약간 더 멀리 있거나 약간 기울어져 있는 상황에서도 시도하게 될 것입니다. 로봇은 단순히 "좌표 X에서 빨간 것을 잡아라"가 아니라, "빨간 것을 가져가라"라는 목표를 배우게 되는 것입니다.

이러한 "흐릿한" 훈련을 마친 후, 마법의 두 번째 단계인 TMRL이 일어납니다. 이것은 로봇이 실제로 일을 하는 동안 돌릴 수 있는 특별한 다이얼을 주는 것과 같습니다. 로봇이 무엇을 해야 할지 확신할 때(예: 블록을 잡고 있을 때)는 다이얼을 "선명한 초점"으로 돌려 정밀하게 행동합니다. 하지만 만약 로봇이 막히거나 상황이 이상해지면(예: 블록이 새로운 위치에 있을 때), 다이얼을 "흐릿한 모드"로 돌립니다. 이는 로봇에게 "좋아, 잠시 교과서적인 정확한 동작은 잊어버려. 연습 때 배웠던 그 더 넓고 흐릿한 동작들을 시도해 봐"라고 말하는 것과 같습니다.

연구진은 컴퓨터 시뮬레이션과 실제 로봇을 통해 이 방법을 테스트했습니다. 그 결과, 이 "흐릿한" 방식으로 훈련된 로봇은 기존 방식으로 훈련된 로봇보다 새로운 퍼즐을 훨씬 더 잘 해결한다는 것을 발견했습니다. 시뮬레이션에서 이 새로운 방법은 로봇이 훨씬 빠르게 학습하도록 도왔으며, 다른 방법들이 완전히 실패하는 지점에서도 종종 완벽에 가까운 성공률에 도달했습니다. 더욱 인상적인 것은, 실제 세계의 실제 로봇에서도 이 효과를 입증했다는 점입니다. 한 테스트에서, 로봇 팔은 소시지를 냄비에 넣고 새우를 서랍에 넣는 법을 실제 실험 시간 1시간도 채 되지 않아 배웠습니다. 이 방법이 없었다면, 로봇은 물체를 어떻게 움직여야 할지 파악하지 못한 채 그저 물체를 빤히 바라보기만 했을 것입니다.

이 논문은 단순히 동작에 무작위 노이즈를 추가하는 기존 방식이 서투르고 비효율적이라고 주장합니다. 대신, "흐릿한" 지시 사항을 다루도록 가르침으로써, 로봇은 탐색을 똑똑하게 하는 법을 배웁니다. 로봇은 언제 정밀해야 하고 언제 창의적이어야 하는지를 알게 됩니다. 저자들은 이 접근 방식이 로봇을 경직된 규칙 준수자에서 유연한 문제 해결사로 변화시켜, 복잡하고 예측 불가능한 현실 세계에 적응하는 로봇을 만드는 데 있어 게임 체인저가 될 수 있다고 제안합니다. 이 로봇들이 모든 직업에 쓰일 만큼 안전하고 효율적인지 확인하기 위해 아직 할 일이 남아 있지만, 지금까지의 결과는 "흐릿하게 만들기"가 진정한 로봇 지능을 여는 비밀 소스가 될 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →