← 최신 논문
💻 computer science

Towards Bridging the Gap between Large-Scale Pretraining and Efficient Finetuning for Humanoid Control

이 논문은 대규모 병렬 시뮬레이션 기반의 SAC(Off-policy) 사전 학습과 물리 지향 세계 모델을 활용한 모델 기반 미세 조정을 결합하여, 인간형 로봇의 제어를 위한 대규모 전구동과 효율적인 적응 사이의 간극을 해소하는 방법을 제시합니다.

원저자: Weidong Huang, Zhehan Li, Hangxin Liu, Biao Hou, Yao Su, Jingwen Zhang

게시일 2026-02-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Weidong Huang, Zhehan Li, Hangxin Liu, Biao Hou, Yao Su, Jingwen Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🤖 핵심 아이디어: "가상 훈련 (Pretraining) + 현실 적응 (Finetuning)"

이 논문은 로봇이 새로운 일을 배울 때 두 단계를 거친다고 말합니다.

  1. 대규모 사전 훈련 (Pretraining): 로봇이 가상 세계 (시뮬레이션) 에서 수천 대의 로봇을 동시에 돌려가며 기초 체력을 기르는 단계입니다.
  2. 효율적인 미세 조정 (Finetuning): 실제 로봇이 새로운 환경 (예: 비포장도로, 새로운 속도) 에 적응할 때, 위험한 실수를 최소화하면서 빠르게 배우는 단계입니다.

이 두 단계를 연결하는 것이 바로 LIFT 프레임워크입니다.


🌟 1 단계: 가상 세계의 '마라톤 선수' 만들기 (대규모 사전 훈련)

기존에 로봇을 훈련시킬 때는 **'PPO'**라는 방법을 많이 썼습니다. 이는 마치 한 명씩 차례대로 운동을 시키는 것과 비슷합니다. 안전하고 튼튼하지만, 새로운 기술을 배우려면 시간이 너무 오래 걸립니다.

이 논문은 **'SAC'**라는 다른 알고리즘을 사용했습니다.

  • 비유: PPO 가 '한 명씩 운동'한다면, SAC 는 **'수천 명의 운동선수를 동시에 훈련시키는 대규모 캠프'**입니다.
  • 효과: GPU(그래픽 카드) 한 장만으로도 수천 개의 가상 로봇을 동시에 돌려가며, 단 30 분~1 시간 만에 로봇이 걷는 법을 완벽하게 익힙니다.
  • 결과: 이렇게 훈련된 로봇은 실제 세상 (실제 로봇) 에 나가서도 처음 보는 길 (잔디, 언덕, 진흙) 에서도 넘어지지 않고 걸을 수 있습니다. 이를 **'제로샷 (Zero-shot) 배포'**라고 합니다.

🛡️ 2 단계: 위험 없는 '현실 적응' 훈련 (미세 조정)

그런데 문제는, 훈련된 로봇이 완전히 새로운 환경 (예: 더 빨리 걷게 하거나, 완전히 다른 지형) 에 가면 다시 넘어질 수 있다는 점입니다. 이때 기존 방식대로 로봇에게 "임의대로 뛰어봐!"라고 하면, 로봇이 넘어져 다칠 수 있습니다.

이 논문은 여기서 두 가지 똑똑한 전략을 사용합니다.

① 현실에서는 '자동주행'만 시키기

새로운 환경에서 실제 로봇을 움직일 때는 실수할 확률이 높은 '랜덤한 움직임'을 아예 하지 않습니다. 대신, 훈련된 로봇이 가장 안전하다고 판단하는 **정해진 동작 (Deterministic)**만 실행합니다.

  • 비유: 운전면허를 갱신할 때, 초보자가 위험한 차선 변경을 시도하게 하지 않고, 안전한 코스를 따라만 운전하게 하는 것과 같습니다.

② 가상 세계 안에서만 '미친 듯이' 실험하기

실제 로봇은 안전하게만 움직이지만, 가상 세계 (World Model) 안에서는 로봇이 미친 듯이 다양한 시도를 해봅니다.

  • 비유: 실제 비행기를 조종할 때는 안전장치를 꽉 채우고 비행하지만, 비행 시뮬레이터 안에서는 추락해도 괜찮으니 온갖 위험한 기동을 다 해보며 익히는 것과 같습니다.
  • 핵심: 이 시뮬레이터는 단순히 그림을 그리는 게 아니라, 물리 법칙 (중력, 마찰력 등) 을 완벽하게 이해하고 있습니다. 그래서 시뮬레이션에서 배운 교훈이 실제 로봇에게도 그대로 적용됩니다.

🧠 왜 이 방법이 특별한가요? (물리 법칙을 가르치다)

기존의 AI 시뮬레이션은 "데이터를 많이 주면 알아서 배워요"라고 했지만, 로봇은 물리 법칙을 무시하면 넘어집니다.

이 논문은 시뮬레이션에 **물리 법칙 (라그랑주 역학 등)**을 직접 심어주었습니다.

  • 비유: 일반적인 AI 는 "이런 상황에서 넘어졌어, 다음엔 넘어지지 말아야지"라고 경험으로 배우지만, 이 방법은 **"중력이 있으니 넘어지면 안 돼"**라고 이론을 먼저 가르친 뒤 경험을 쌓게 합니다.
  • 덕분에 실제 로봇이 넘어질까 봐 두려워할 필요 없이, 수 분간의 짧은 데이터만으로도 새로운 환경에 완벽하게 적응합니다.

📝 한 줄 요약

"수천 대의 가상 로봇을 동시에 훈련시켜 기초 체력을 기르고 (Pretraining), 실제 로봇은 안전장치를 채운 채로 물리 법칙을 이해하는 시뮬레이터 안에서만 위험한 실험을 시켜 (Finetuning), 로봇이 새로운 환경에서도 넘어지지 않고 빠르게 적응하게 만든 방법입니다."

이 기술은 앞으로 우리가 만나는 휴머노이드 로봇이 공장뿐만 아니라, 복잡한 우리 일상 속에서도 안전하고 똑똑하게 일할 수 있는 토대를 마련해 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →