← 최신 논문
💻 computer science

Sampling Strategies for Robust Universal Quadrupedal Locomotion Policies

본 논문은 성능 기반 필터링과 균등 무작위화를 포함한 다양한 관절 이득 샘플링 전략을 조사하고 비교하며, ANYmal 로봇에 대한 제로샷 배포를 통해 시뮬레이션과 현실 사이의 간극을 성공적으로 메우는 보편적인 사족 보행 로코모션(locomotion)을 위한 단일 견고한 강화 학습 정책을 훈련하는 방법을 연구한다.

원저자: David Rytz, Kim Tien Ly, Ioannis Havoutis

게시일 2026-06-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: David Rytz, Kim Tien Ly, Ioannis Havoutis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

강아지에게 걷는 법을 가르치려 한다고 상상해 보세요. 만약 아주 작은 치와와만을 훈련시킨다면, 그 강아지는 그레이트 데인처럼 걷는 법을 배우지 못할 것입니다. 반대로 그레이트 데인만을 훈련시킨다면, 갑자기 크기가 줄어들었을 때 자신의 발에 걸려 넘어질 수도 있습니다.

이 논문은 컴퓨터 뇌(AI)가 로봇의 형태나 크기가 바뀔 때마다 매번 뇌를 다시 훈련시킬 필요 없이, 다양한 형태와 크기의 사족 보행 로봇을 제어하도록 가르치는 방법에 관한 것입니다.

다음은 이들의 발견을 쉬운 비유를 사용하여 정리한 내용입니다.

문제점: "맞춤형이 아닌" 함정

대부분의 로봇 컨트롤러는 맞춤 정장과 같습니다. 특정 로봇(예: 12kg 로봇)에 맞춰 설계된 컨트롤러는 매우 잘 작동합니다. 하지만 그 "정장"을 더 무거운 로봇(예: 50kg 로봇)에게 입히려 하면, 그 옷은 망가져 버립니다.

이를 해결하기 위해 과학자들은 보통 **강화 학습(Reinforcement Learning, RL)**을 사용합니다. 이것은 비디오 게임 캐릭터가 올바른 동작을 배울 때까지 수천 번 실패하게 함으로써 훈련하는 것과 같습니다. 문제는, 만약 특정 신체 유형으로만 캐릭터를 훈련시킨다면, 새로운 몸을 갖게 되었을 때 혼란에 빠진다는 점입니다.

해결책: "체육 수업" 전략

저자들은 어떤 신체에도 적응할 수 있는 로봇을 만들려면, 로봇의 무게, 다리 길이, 근력이 끊임없이 변하는 "체육 수업"에서 훈련시켜야 한다는 것을 깨달았습니다.

하지만 문제가 하나 있었습니다. 이 설정들을 어떻게 변경할 것인가?

단순히 무작위로 설정(주사위를 던지는 것처럼)을 정한다면, 실수로 로봇에게 관절이 감당할 수 없을 정도로 너무 강한 "슈퍼 근육"을 주거나, 움직일 수 없는 "약한 근육"을 줄 수도 있습니다. 이는 학생에게 발이 납으로 만들어졌거나 젤리로 만들어진 신발을 신고 마라톤을 하라고 말하는 것과 같습니다. 제대로 작동할 리 없습니다.

테스트한 세 가지 전략

연구팀은 훈련 중에 로봇의 설정을 "섞는" 세 가지 방법을 비교했습니다.

  1. "수학 공식" 접근법: 로봇의 무게에 따라 적절한 근력을 예측하기 위해 간단한 수학적 선(예: "무거울수록 근육도 강하다")을 사용했습니다.
    • 결과: 작은 로봇에는 효과가 있었지만, 큰 로봇에는 처참하게 실패했습니다. 수학 공식이 제시한 근력은 너무 공격적이어서, 로봇이 격렬하게 떨리거나 파손되는 원인이 되었습니다.
  2. "완전 무작위" 접근법: 모든 것에 대해 그냥 무작위 숫자를 뽑았습니다.
    • 결과: 이것이 더 나았지만, 가끔 로봇이 학습 불가능한 설정이라는 "나쁜 주사위 눈"을 뽑는 경우가 있었습니다.
  3. "스마트 코치" 접근법 (그들의 승리자): 이것이 그들의 새로운 방법입니다. 학생을 지켜보는 코치를 상상해 보세요.
    • 학생이 힘들어하면, 코치는 "좋아, 무게를 약간 가볍게 해서 감을 잡게 해보자"라고 말합니다.
    • 학생이 잘하고 있다면, 코치는 "좋아, 얼마나 더 멀리 갈 수 있는지 확인하기 위해 조금 더 어렵게 만들어보자"라고 말합니다.
    • 또한 그들은 **파티클 필터(Particle Filter)**라는 기술을 사용했습니다. 이것은 "최상의 연습 세션" 목록을 보관하는 것과 같습니다. 특정 무게와 근력의 조합이 잘 작동했다면, 코치는 처음부터 다시 시작하는 대신 그 특정 설정을 바탕으로 변형을 시도하며 기억합니다.

핵심 발견: "근육" 설정이 가장 중요하다

가장 놀라운 발견은 **PD 게인(PD Gains)**에 관한 것이었습니다. 로봇 용어로 이것은 기본적으로 로봇 관절의 "강성(stiffness)" 또는 "반사 신경"을 의미합니다.

  • 기존 방식은 이러한 반사 신경을 무게에 따라 계산하려고 했습니다. 논문은 이것이 위험하다고 밝혔습니다. 기존 방식은 로봇이 너무 "뻣뻣하게" 움직여서 관절을 바닥에 세게 부딪히게 만들어, 소음을 유발하거나 잠재적인 손상을 입힐 수 있다고 경고했습니다.
  • 그들의 방식은 로봇이 견고함(robust)을 갖추려면 매우 다양한 반사 신경 설정으로 훈련해야 한다는 것을 깨달았습니다. "젤리 다리"와 "강철 다리"를 모두 경험하며 훈련해야, 실제 환경에 맞닥뜨렸을 때 다리의 느낌이 어떻든 상관없이 걸을 수 있게 됩니다.

실제 세계 테스트

그들은 자신들의 AI를(시뮬레이션 환경에서만 본 상태) 실제 로봇인 ANYmal(무게 50kg)에 적용했습니다.

  • 결과: 로봇은 완벽하게 걸었습니다.
  • "제로샷(Zero-Shot)"의 마법: 그들은 로봇에게 "너는 이제 50kg 로봇이야"라고 말해주지 않았습니다. 로봇은 훈련 중에 50kg 로봇을 본 적이 없습니다. 단지 모든 가능한 변형을 통해 훈련받았기 때문에 걷는 법을 알고 있었던 것입니다.
  • 보너스: 그들은 로봇에게 13kg 배낭을 씌워(제조사 제한보다 무겁게 만들었음에도) 여전히 넘어지지 않고 걸었습니다.

요약

이 논문은 범용 로봇 보행기를 만들기 위해서는 단순히 수학 공식을 사용하여 로봇의 "근육"을 조절해서는 안 된다고 주장합니다. 대신, 난이도를 끊임없이 조정하고 무엇이 효과적이었는지 기억하는 스마트하고 적응 가능한 훈련 시스템이 필요합니다. 이를 통해 하나의 AI 뇌가 재훈련 없이도 작은 로봇, 거대한 로봇, 혹은 무거운 짐을 실은 로봇을 모두 제어할 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →