← 최신 논문
💻 computer science

Deep Reinforcement Learning for Quadruped Locomotion Controlled by Natural Language

본 논문은 경량 자연어 이해(NLU) 모듈을 목표 조건부 PPO 정책 및 교사-학생 증류(teacher-student distillation)와 결합하여, 시뮬레이션과 실제 실험 모두에서 견고하고 적응력 있으며 에너지 효율적인 보행을 달성함으로써 사족 보행 로봇이 자유 형식의 자연어 명령을 수행할 수 있도록 하는 엔드 투 엔드 프레임워크를 제시한다.

원저자: Shirin Ranjbaran, Yili Fu

게시일 2026-09-14
📖 5 분 읽기🧠 심층 분석

원저자: Shirin Ranjbaran, Yili Fu

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇 개가 원격 제어기나 조이스틱, 혹은 미리 프로그래밍된 스크립트 없이도 무엇을 해야 할지 알 필요가 없는 세상을 상상해 보십시오. 대신, 이 로봇은 사람의 목소리에 귀를 기울입니다. 이것이 바로 엔지니어들이 기계에게 복잡하고 울퉁불퉁한 세상을 헤쳐 나가는 법을 가르치는 로봇 공학이라는 분야의 최전선입니다. 수년 동안 네 발 달린 로봇을 걷게 만드는 가장 신뢰할 수 있는 방법은 자신의 몸과 그 아래의 지면에 대한 엄격한 수학적 모델을 제공하는 것이었습니다. 이 방식은 평평한 바닥에서는 잘 작동하지만, 지형이 지저분해지거나 상황이 예상치 못하게 변하면 종종 무너집니다. 딥 강화 학습(deep reinforcement learning)으로 알려진 새로운 접근 방식은 판도를 바꾸어 놓았습니다. 고정된 규칙 세트에 의존하는 대신, 이 로봇들은 마치 강아지가 서는 법을 배우는 것처럼 시행착오를 통해 걷는 법을 배웁며, 결국 인간 엔지니어가 직접 설계할 수 없는 안정적인 움직임 방식을 발견하게 됩니다. 남겨진 과제는 이러한 학습된 시스템과 대화하는 방법입니다. 로봇에게 "앞으로 가"와 같은 간단한 명령을 내리는 것은 쉽지만, "턱을 피하면서 왼쪽으로 천천히 걸어가"라고 요청하는 것은 인간의 언어와 로봇의 저수준 운동 제어 사이의 가교를 필요로 합니다.

하얼빈 공업대학교의 연구진은 사족 보행 로봇이 자유로운 형식의 자연어 명령을 따를 수 있도록 하는 가교를 구축했습니다. 최근 연구에 상세히 기술된 이들의 작업은 로봇이 문장을 듣고, 사람이 무엇을 원하는지 파악한 뒤, 즉시 그 의도에 맞춰 걷기 스타일을 조정하는 방법을 제시합니다. 이 시스템은 로토가 선택해야 하는 "트롯(trot)"이나 "갤럽(gallop)"과 같은 특정 동작의 미리 작성된 라이브러리에 의존하지 않습니다. 대신, 단어를 속도와 방향에 대한 연속적인 조정으로 직접 번역합니다. 사용자가 "앞으로 천천히 걸어가"라고 말하면, 로봇의 두뇌는 전진 속도를 줄이면서 균형을 유지해야 한다는 것을 이해하고 실시간으로 이 변화를 실행합니다. 이는 두 가지 별개의 기술, 즉 인간의 말을 이해하는 언어 프로세서와 로봇의 근육을 제어하는 학습 알고리즘을 결합함으로써 달성됩니다.

시스템의 언어 부분은 번역가 역할을 합니다. 이 모델은 "왼쪽으로 급하게 회전해"와 같은 문장을 받아 이를 두 가지 정보, 즉 회전하라는 일반적인 목표와 회전하는 데 필요한 구체적인 숫자(예: 얼마나 빨리 회전할 것인가)로 분해합니다. 연구진은 이 작업을 수행하기 위해 현대적인 언어 모델의 경량 버전을 사용했습니다. 이 모델은 명령과 그에 따른 올바른 로봇 동작이 쌍을 이룬 수천 개의 사례를 통해 학습되었습니다. 또한 로봇의 속도를 늦추지 않고 실행될 수 있을 만큼 빠르게 설계되었습니다. 시스템이 명령을 이해하면, 이 정보는 로봇의 제어 두뇌로 전달됩니다. 이 제어 두뇌는 근사 정책 최적화(proximal policy optimization)라는 방법으로 걷도록 훈련된 신경망입니다. 이 훈련 과정에는 로봇이 고충실도 컴퓨터 시뮬레이션 속에서 걷기를 시도하며, 똑바로 서 있고 효율적으로 움직이는 것에 대해 보상을 받고, 수백만 번의 시도를 통해 점진적으로 전략을 개선하는 과정이 포함됩니다.

이 새로운 시스템이 독특한 점은 언어 번역기를 걷기 제어기와 어떻게 연결하느냐에 있습니다. 로봇에게 제한된 메뉴에서 정해진 행동을 고르도록 강요하는 대신, 시스템은 언어 입력을 사용하여 로봇의 목표와 보상 체계를 부드럽게 유도합니다. 만약 명령이 느리게 움직이는 것이라면, 시스템은 로봇의 목표 속도를 조정하고 스스로의 성공을 평가하는 방식을 변경하여, 빠르고 위험한 단계보다 느리고 신중한 단계가 더 보람 있게 느껴지도록 만듭니다. 이를 통해 로봇은 보행 방식을 연속적으로 적응시킬 수 있습니다. 로봇은 하나의 음성 지시 스트림에 기반하여 앞으로 걷다가, 속도를 줄였다가, 다시 왼쪽으로 회전할 수 있습니다. 이 시스템이 컴퓨터 속에서뿐만 아니라 실제 기계에서도 작동하도록 보장하기 위해, 연구진은 교수법(teaching strategy)을 채택했습니다. 먼저 시뮬레이션 내에서 지면의 정확한 마찰력과 같이 세상에 대한 완벽한 정보에 접근할 수 있는 매우 유능한 "교사(teacher)" 로봇을 훈련시켰습니다. 그런 다음, 실제 로봇이 가질 법한 노이즈가 섞인 불완전한 센서 데이터만을 사용하여 교사 로봇의 행동을 모방하도록 "학생(student)" 로봇을 훈련시켰습니다. 이 과정은 학생 로봇이 물리적 세계의 무질서한 현실에 대해 견고해지는 법을 배우는 데 도움을 주었습니다.

연구팀은 시뮬레이션과 작고 민첩한 사족 보행 기계인 Unitree A1 로봇을 사용하여 시스템을 광범위하게 테스트했습니다. 컴퓨터 시뮬레이션에서 로봇은 "왼쪽으로 천천히 걸어가" 또는 "장애물을 빠르게 피해 가라"와 같은 복잡한 지시를 포함한 다양한 명령을 성공적으로 수행했습니다. 시스템은 높은 성공률을 보였으며, 로봇은 시뮬레이션에서 앞으로 걷기나 왼쪽으로 회전하기와 같은 기본 과제를 96% 이상의 확률로 완료했습니다. 연구진이 시스템을 실제 로봇으로 옮겼을 때도 결과는 강력하게 유지되었습니다. 로봇은 명령에 따라 걷기, 회전하기, 멈추기를 수행했으며, 대부분의 동작에서 93%를 상회하는 성공률을 보였습니다. 또한 이 시스템은 에너지 효율적이었으며, 이 특정 언어 조건화(language conditioning)를 사용하지 않은 전통적인 제어 방식이나 다른 학습 기반 접근 방식보다 단계당 전력을 적게 소모했습니다. 연구진은 로봇이 새로운 명령을 받은 후 1초 미만 안에 움직임을 적응할 수 있다는 점에 주목했으며, 이는 기존의 제어 방식으로는 달성하기 어려운 유연한 반응성을 보여줍니다.

하지만 이 연구는 현재 가능한 것의 한계 또한 강조합니다. 이 시스템은 움직임과 속도에 관련된 명확하고 직접적인 명령에 가장 잘 작동합니다. 아직 긴 대화나 "멋진 것을 해봐"와 같이 매우 모호한 지시를 처리하도록 설계되지 않았습니다. 만약 사용자가 "달로 날아가라"와 같이 로봇이 물리적으로 수행할 수 없는 명령을 내린다면, 시스템은 아직 왜 그 요청이 불가능한지 설명하거나 명확한 설명을 요구할 만큼 똑똑하지 않습니다. 연구진은 로봇이 특정 움직임 지침을 따르는 데는 매우 뛰어나지만, 완전히 새로운 유형의 언어나 환경에 일반화하는 능력은 학습된 데이터에 의해 여전히 제한된다는 것을 발견했습니다. 또한 실제 세계에서의 테스트는 상대적으로 짧았고 통제된 조건에서 이루어졌으므로, 예측 불가능한 야외 환경에서의 장기적인 신뢰성은 아직 완전히 입증되지 않았습니다.

이러한 한계에도 불구하고, 이 작업은 더 자연스러운 인간-로봇 상호작용을 향한 중요한 진전을 의미합니다. 로봇이 미리 프로그래밍된 기술의 라이브러리 없이도 학습하고 단순한 음성으로 유도될 수 있음을 보여줌으로써, 연구진은 더 직관적으로 다룰 수 있는 기계로 가는 경로를 제시했습니다. 이 시스템은 사용자가 새로운 코드나 특정 명령 세트를 배울 필요가 없으며, 단순히 듣고 반응합니다. 시뮬레이션에서 실제 세계로 기술을 전이시키는 교사-학생 훈련 방법의 성공은 이 접근 방식이 향-후 더 복잡한 로봇으로 확장될 수 있음을 시사합니다. 기술이 성숙해짐에 따라 인간의 의도와 기계의 행동 사이의 간극은 계속 좁혀질 것이며, 로봇이 역동적이고 도전적인 환경에서 진정한 파트너가 될 수 있도록 할 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →