← 최신 논문
💻 computer science

Continual Domain Randomization

본 논문은 시뮬레이션 매개변수의 부분 집합에 대해 강화 학습 정책을 순차적으로 훈련함으로써 동시 무작위화의 비최적성을 극복하고 로봇 작업에서 견고한 시뮬레이션-현실 전이를 달성하기 위해 도메인 무작위화와 지속적 학습을 결합한 새로운 접근법인 지속적 도메인 무작위화 (CDR) 를 제안한다.

원저자: Josip Josifovski, Sayantan Auddy, Mohammadhossein Malmir, Justus Piater, Alois Knoll, Nicolás Navarro-Guerrero

게시일 2026-04-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Josip Josifovski, Sayantan Auddy, Mohammadhossein Malmir, Justus Piater, Alois Knoll, Nicolás Navarro-Guerrero

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 컵을 집어 올리도록 가르치려 한다고 상상해 보세요. 이를 수행하는 가장 현명한 방법은 보통 로봇이 실제 로봇을 손상시키거나 사람을 다치게 하지 않도록 컴퓨터 시뮬레이션에서 먼저 수백만 번 연습하게 하는 것입니다. 하지만 여기에는 문제가 있습니다. 컴퓨터 시뮬레이션은 현실 세계와 완벽하게 같을 수 없습니다. 실제 로봇은 약간 더 무거울 수 있고, 모터는 조금 더 느릴 수 있으며, 센서는 약간 "노이즈"가 있을 수 있습니다. 이 차이를 "현실 간극 (reality gap)"이라고 부릅니다. 완벽한 시뮬레이션에서 로봇을 훈련시키면, 로봇이 시뮬레이션의 완벽함에 의존하도록 학습했기 때문에 실제 세계에 배치했을 때 종종 처참하게 실패합니다.

이를 해결하기 위해 과학자들은 **도메인 무작위화 (Domain Randomization)**라는 트릭을 사용합니다. 시뮬레이션을 완벽하게 만들려고 노력하는 대신, 의도적으로 그것을 엉망으로 만듭니다. 한 번 실행에서는 로봇을 무겁게 만들고, 다음 실행에서는 가볍게 만들며, 가짜 센서 노이즈를 추가하거나 제어를 지연시킵니다. 아이디어는 로봇이 이러한 엉망인 버전들 모두를 처리하는 법을 학습한다면, 단지 또 다른 "엉망" 버전일 뿐인 현실 세계를 처리할 만큼 견고해질 것이라는 것입니다.

기존 방식의 문제점
전통적인 방법은 첫날에 강한 해류, 거대한 파도, 차가운 물이 모두 있는 폭풍우 치는 바다로 뛰어 들어 수영을 배우려는 것과 같습니다. 너무 어렵습니다! 로봇은 압도당하고 혼란스러워지며, 과제가 너무 어렵기 때문에 나쁜 전략을 학습하거나 (아예 아무것도 학습하지 못합니다).

새로운 해결책: 지속적 도메인 무작위화 (CDR)
이 논문의 저자들은 **지속적 도메인 무작위화 (Continual Domain Randomization, CDR)**라고 부르는 더 현명한 학습 방법을 제안합니다. 자동차 운전 배우기를 생각해 보세요:

  1. 쉬운 것부터 시작: 먼저 바람도 없고 다른 차도 없으며 타이어 상태가 완벽한 빈 주차장에서 운전을 배웁니다. 기본기를 다집니다.
  2. 한 번에 하나의 도전 과제 추가: 그걸 잘하게 되면, 갑자기 허리케인 속으로 던져 넣지 않습니다. 대신 하나의 새로운 도전 과제만 추가합니다. 아마도 비 속에서 운전해 보는 것일 수 있습니다. 비를 다스리게 되면 바람을 추가합니다. 바람을 다스리게 되면 무거운 교통량을 추가합니다.
  3. 모든 것을 기억하기: 까다로운 부분은 비 속에서 운전하는 법을 배울 때, 건조한 아스팔트에서 운전하는 법을 잊지 말아야 한다는 것입니다. 여기서 "지속적 학습 (Continual Learning)" 부분이 나옵니다. 로봇은 **탄성 가중치 통합 (Elastic Weight Consolidation)**이라고 불리는 특별한 기억 기술을 사용하여 "안전망" 역할을 합니다. 이는 로봇이 새로운 기술 (비 처리 등) 을 학습하면서도 이전 기술 (건조한 아스팔트 운전) 을 "잊지" 않도록 허용합니다.

테스트 방법
연구자들은 이 아이디어를 두 가지 작업에서 테스트했습니다:

  • 도달 (Reaching): 로봇 팔이 특정 지점을 만져 보려는 작업.
  • 잡기 (Grasping): 로봇 팔이 상자를 찾고, 그리퍼를 완벽하게 정렬하여 들어 올리는 더 복잡한 작업.

그들은 그들의 "단계별" 방법 (CDR) 을 두 가지 다른 접근법과 비교했습니다:

  • "완벽한" 시뮬레이터: 깨끗하고 완벽한 세상에서만 훈련하는 것 (현실에서는 실패함).
  • "혼돈" 시뮬레이터: 모든 문제 (비, 바람, 교통량) 를 로봇에게 동시에 던지는 것.
  • "망각" 방법: 문제들을 하나씩 추가하지만 기억 안전망을 사용하지 않는 것 (따라서 로봇이 이전 단계를 잊음).

결과
결과는 인상적이었습니다:

  • CDR로 훈련된 로봇은 시뮬레이션에서 효과적으로 학습했습니다.
  • 로봇을 현실 세계로 옮겼을 때, "혼돈" 모드로 훈련된 로봇보다 더 잘하거나 그와 똑같이 수행했습니다.
  • 결정적으로 CDR 은 더 안정적이었습니다. 도전 과제들을 다른 순서로 추가하더라도 (먼저 비, 아니면 먼저 바람), 로봇은 여전히 잘 학습했습니다. 반면 "망각" 방법은 도전 과제의 순서가 바뀌면 어려움을 겪었습니다.

한 줄 요약
이 논문은 로봇을 한 번에 무작위 변수들의 바다에 빠뜨리는 대신, 이전 것들을 처리하는 방법을 기억하도록 보장하면서 한 번에 하나의 난이도를 추가하는 단계별 방식으로 가르치는 것이 더 좋음을 보여줍니다. 이는 훈련 중 실제 세계에서 테스트할 필요 없이 엉망이고 예측 불가능한 현실 세계에 준비된 로봇을 만들어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →