← 최신 논문
💻 computer science

CycleRL: Sim-to-Real Deep Reinforcement Learning for Robust Autonomous Bicycle Control

본 논문은 시뮬레이션에서 실제 하드웨어로의 성공적인 전이를 달성하기 위해 NVIDIA Isaac Sim 내에서 근사 정책 최적화(Proximal Policy Optimization)와 도메인 무작위화(domain randomization)를 활용하여 강건하고 고성능인 자율 자전거 제어를 구현하는 심투리얼(sim-to-real) 심층 강화 학습 프레임워크인 CycleRL을 제시한다.

원저자: Gelu Liu, Teng Wang, Zhijie Wu, Junliang Wu, Songyuan Li, Xiangwei Zhu

게시일 2026-06-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Gelu Liu, Teng Wang, Zhijie Wu, Junliang Wu, Songyuan Li, Xiangwei Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

아이에게 자전거 타는 법을 가르치는 상황을 상상해 보세요. 만약 당신이 균형, 마찰력, 운동량의 복잡한 물리학을 교과서를 통해 설명하려 한다면, 아이는 혼란스러워하며 넘어질 가능성이 높습니다. 이것이 바로 기존 로봇 자전거가 직면한 본질적인 문제입니다. 엔지니어들은 자전거가 어떻게 움직여야 하는지에 대해 완벽한 수학적 "교과서"(모델)를 쓰려고 노력하지만, 현실 세계는 무질서하며 그 교과서들은 바람이 불거나 길이 울퉁불퉁해지면 종종 실패하곤 합니다.

이 논문은 로봇 자전거가 스스로 달리는 법을 배우게 하는 새로운 방법인 CycleRL을 소개합니다. 연구진은 자전거에게 교과서를 주는 대신, 인간 아이처럼 시행착오를 통해 배우도록 했습니다. 다만 그 속도는 초인적인 수준입니다.

연구진이 수행한 과정을 간단한 개념으로 나누어 설명하면 다음과 같습니다.

1. "가상 놀이터" (시뮬레이션)

로봇에게 자전거를 가르치기 위해 실제 자전거를 수백만 번 부수게 할 수는 없습니다. 자전거는 망가질 것이고 로봇의 학습 속도도 너무 느릴 것이기 때문입니다.

  • 비유: 이것은 비디오 게임과 같습니다. 연구진은 매우 사실적인 가상 세계(NVIDIA Isaac Sim 사용)를 구축하여 자전거의 디지털 트윈을 만들었습니다.
  • 과정: 이 비디오 게임 속에서 AI "아이"는 자전거를 타는 연습을 합니다. 넘어질 때마다 "게임 오버"가 됩니다. 반대로 중심을 잡고 경로를 잘 따라가면 점수를 얻습니다.
  • 학습: AI는 **심층 강화 학습(Deep Reinforcement Learning)**이라는 방법을 사용합니다. 이는 강아지에게 기술을 가르치는 것과 같습니다. 옳은 행동을 하면(균형을 잡으면) 간식(점수)을 주고, 넘어지면 간식을 주지 않는 방식입니다. 게임 속에서 수백만 번의 시도를 거치며, AI는 중심을 잡기 위해 핸들을 얼마나 돌리고 무게 중심을 어떻게 옮겨야 하는지 정확히 파악하게 됩니다.

2. "훈련 프로그램" (도메인 랜덤화)

비디오 게임의 큰 문제점 중 하나는 게임에서 배운 것이 실제 생활에서는 작동하지 않을 수 있다는 것입니다. 가상 세계의 풀밭이 너무 미끄럽거나, 가상의 바람이 너무 강할 수도 있습니다.

  • 비유: 축구 선수가 아주 평평하고 건조한 경기장에서만 훈련한다고 상상해 보세요. 실제 경기에서 비가 내려 진흙탕이 된 경기장에 가면 그 선수는 미끄러질 수 있습니다.
  • 해결책: 이를 해결하기 위해 연구진은 **도메인 랜덤화(Domain Randomization)**라는 기술을 사용했습니다. 단순히 하나의 완벽한 경기장에서만 연습하게 한 것이 아니라, 가상 세계를 혼란스럽고 예측 불가능하게 만들었습니다.
    • 때로는 자전거가 무거웠고, 때로는 가벼웠습니다.
    • 때로는 타이어가 끈적였고, 때로는 미끄러웠습니다.
    • 때로는 바람이 세게 불었고, 때로는 길이 울퉁불퉁했습니다.
    • 때로는 자전거가 약간 흔들리는 상태에서 시작했습니다.
  • 결과: AI가 가능한 모든 이상한 시나리오 속에서 타는 법을 배우도록 강제함으로써, AI는 마침내 실제 자전거 위에 올라섰을 때 차이점에 개의치 않을 만큼 강력한 내성을 갖게 되었습니다. 이미 시뮬레이션에서 "모든 것을 경험"했기 때문입니다.

3. "성적표" (보상 함수)

연구진은 AI에게 무엇이 "잘 타는 것"인지 어떻게 알려주었을까요? 그들은 다섯 가지 규칙이 담긴 복잡한 성적표를 만들었습니다.

  1. 생존하기: 넘어지지 말 것 (생존 보상).
  2. 속도 내기: 주어진 속도에 맞출 것 (속도 보상).
  3. 직진하기: 지시된 방향을 따를 것 (방향 보상).
  4. 부드럽게 움직이기: 핸들을 격하게 움직이지 말고 부드럽게 조작할 것 (동작 페널티).
  5. 효율적이기: 에너지를 너무 많이 쓰지 말 것 (동작 크기 페널티).

AI는 이 모든 규칙을 동시에 조절해야 했습니다. 넘어지는 것이 최악의 결과라는 것을 배우는 동시에, 거칠게 운전하는 것보다 부드럽게 운전하는 것이 더 낫다는 점도 함께 배워야 했습니다.

4. "실전 테스트" (Sim-to-Real)

AI가 가상 세계를 마스터한 후, 연구진은 실험실에서 만든 실제 물리적 자전거에 그것을 적용했습니다.

  • 하드웨어: 연구진은 컴퓨터 두뇌(NVIDIA Jetson), 균형을 감지하는 센서(IMU), 그리고 조향 및 구동을 위한 모터를 갖춘 커스텀 자전거를 제작했습니다.
  • 결과: 실제 자전거를 한 번도 만져본 적 없는 AI가 자전거에 올라타 달리기 시작했습니다. AI는 균형을 잡고 경로를 따라갔으며, 자갈길이나 경사로 같은 다양한 지형을 처리해 냈습니다.
  • 통계: 시뮬레이션에서 AI는 **99.9%**의 확률로 중심을 유지했습니다. 실제 자전거에서도 **95%**의 성공률을 보였습니다. 심지어 숙련된 사람처럼 누군가 밀어서 넘어뜨려도 다시 회복할 수 있었습니다.

이것이 왜 중요한가

전통적인 방식은 엄격한 수학 공식으로 자전거 문제를 해결하려 합니다. 만약 수학이 조금이라도 틀리면 자전거는 충돌합니다.
CycleRL은 다릅니다. 이것은 라이더에게 혼란스럽고 끊임없이 변하는 장애물 코스에서 연습하게 하여 전문가로 만드는 과정과 같습니다. 규칙에 의한 학습이 아닌 경험을 통한 학습을 했기 때문에, 예측 불가능한 현실 세계를 훨씬 더 잘 다룰 수 있는 것입니다.

요약하자면: 연구진은 로봇이 혼란스러운 비디오 게임을 수백만 번 플레이하게 함으로써 자전거 타는 법을 가르쳤고, 그 결과 로봇이 첫 시도에 실제 자전거를 완벽하게 탈 수 있을 만큼 강력한 능력을 갖추게 만들었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →