← 최신 논문
💻 computer science

Asymmetric physics enables efficient learning in quadrupedal robot swarms

본 논문은 비대칭 물리(asymmetric physics)—즉, 현실적인 접촉 역학을 위한 고충실도 비미분 시뮬레이터와 경사 하강법 기반 학습을 위한 미분 가능한 대리 모델의 결합—를 활용함으로써, 명시적인 통신이나 전역 지도 없이도 대규모 사족 보행 로봇 군집을 위한 시각 기반의 분산 제어 정책을 효율적으로 엔드 투 엔드 학습할 수 있으며, 이를 통해 실제 환경으로의 강건한 제로샷 전이를 달성함을 입증한다.

원저자: Yuang Zhang, Yunlong Song, Zhihao He, Zelin Ni, Kangyu Wang, Tianchi Liu, Yu Hu, Feng Yu, Danping Zou, Weiyao Lin

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuang Zhang, Yunlong Song, Zhihao He, Zelin Ni, Kangyu Wang, Tianchi Liu, Yu Hu, Feng Yu, Danping Zou, Weiyao Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

500마리의 새 떼가 나무에 부딪히거나 서로 충돌하지 않고 울창한 숲을 통과해 비행하는 법을 가르친다고 상상해 보십시오. 만약 한 마리씩 가르치거나, 지도와 중앙 지휘관을 제공하려 한다면, 그 방식은 느리고 서툴 것이며 실제 환경에서는 제대로 작동하지 않을 것입니다.

이 논문은 로봇 개(사족보행 로봇)에게 바로 그 능력을 가르치는 혁신적인 방법을 설명합니다. 즉, 서로 대화하거나 리더를 따르지 않고도 오직 자신의 눈만을 이용해 복잡하고 붐비는 환경 속에서 군집(swarm)으로서 함께 움직이는 법을 말입니다.

다음은 이들이 어떻게 수행했는지에 대한 간단한 요약입니다.

문제점: 로봇 군집의 "블랙박스"

일반적으로 과학자들이 인공지능(특히 강화 학습)을 사용하여 로봇을 훈련할 때는 "시행착오"라는 방법을 사용합니다. 로봇이 무언가를 시도하고, 충돌하면 그것이 잘못되었음을 배우고, 다시 시도하는 방식입니다.

  • 문제점: 로봇이 단 한 대라면 괜찮습니다. 하지만 수백 대의 로봇이 동시에 움직일 때, 이 "시행착오" 과정은 악몽이 됩니다. 컴퓨터는 어떤 로봇이 무엇을 했는지 파악하느라 과부하가 걸리며, 학습 과정은 믿기 힘들 정도로 느리고 비효력적입니다. 이는 마치 500개의 공을 하나씩 떨어뜨려 보며 저글링을 배우려는 것과 같습니다.

해결책: "두 개의 뇌" 전략

연구진은 **"비대칭 물리(Asymmetric Physics)"**라고 불리는 영리한 방법을 사용하여 이 과정을 가속화했습니다. 이것은 로봇 군집에게 두 가지 서로 다른 작업을 수행할 두 개의 서로 다른 "뇌"를 주는 것과 같습니다.

  1. "현실주의자"의 뇌 (행동용): 로봇이 실제로 움직이고 상호작용할 때, 이 뇌는 매우 정교하고 고도로 구현된 시뮬레이터를 사용합니다. 이 뇌는 울퉁불퉁한 지면, 풀, 충돌, 그리고 로봇의 다리가 흙에 닿는 복잡한 물리 법칙 등 세상을 있는 그대로 봅니다. 매우 현실적이지만, 수학적으로 학습하기에는 너무 복잡합니다.
  2. "단순화"의 뇌 (학습용): 컴퓨터가 어떻게 개선할지 결정해야 할 때, 이 뇌는 단순화된 "만화" 버전의 물리 법칙으로 전환합니다. 모든 근육과 바위를 시뮬레이션하는 대신, 로봇을 단순한 이동 점(항법용)이나 단단한 블록(움직임용)으로 취급합니다. 이 단순화된 버전은 매끄러우며, 컴퓨터가 경사도(로봇이 어떻게 나아질지 알려주는 수학적 지표)를 계산하기에 용이합니다.

비유: 비행기 조종사가 비행을 배우는 상황을 상상해 보십시오.

  • 현실주의자는 바람, 난기류, 엔진 소음이 포함된 실제 비행 시뮬레이터입니다.
  • 단순화 모델은 비행기의 경로를 보여주는 화이트보드 위의 기본적인 그림입니다.
  • 조종사는 (감각을 익히기 위해) 실제 시뮬레이터에서 연습하지만, 교관은 화이트보드를 사용하여 조종사가 왜 실수를 했는지, 그리고 어떻게 수정해야 하는지를 빠르게 설명합니다. 이 논문의 방식은 이를 자동으로 수행합니다. 즉, 로봇은 현실적인 세계에서 "행동"하지만, 단순화된 수학으로부터 "학습"합니다.

성과

이 팀은 이 방법을 사용하여 최대 512대의 로봇 개를 동시에 제어할 수 있는 단일 AI 정책(policy)을 훈련했습니다.

이들이 6대의 Unitree Go2 로봇 개를 가지고 실제 환경에서 테스트했을 때, 결과는 놀라웠습니다. 로봇들에게는 중앙 지휘관도, 서로 대화할 와이파이도, 지역 지도도 없었습니다. 그들은 오직 코 끝에 달린 카메라만을 가지고 있었습니다. 그럼에도 불구하고 그들은 마치 협동하는 동물 떼처럼 행동했습니다:

  • 우측 통행(Right-Side Yielding): 두 그룹의 로봇이 정면으로 마주쳤을 때, 자동차나 사람들이 그러하듯 서로를 지나치기 위해 자연스럽게 오른쪽으로 비켜갔습니다.
  • 예측 회피: 다른 로봇이 오는 것을 발견하면 좁은 틈에 진입하기 전에 속도를 줄이거나 멈춰 서서 교통 체증을 방지했습니다.
  • 벽 따라가기: 만약 길을 찾지 못하거나 막히게 되면, 통로를 찾을 때까지 자연스럽게 벽을 따라 미끄러지듯 이동했습니다.
  • 군집 흐로(Crowd Flow): 그들은 완전히 스스로 학습했음에도 불구하고, 울창한 숲, 좁은 다리, 미로 등을 충돌 없이 통과할 수 있었습니다.

이것이 중요한 이유

이 논문은 시각 기반 학습(vision-based learning)이 이토록 복잡한 물리적 환경에서 다리 달린 로봇 군집에 대해 이만큼 잘 작동한 것은 이번이 처음이라고 주장합니다.

핵심적인 결론은 "현실적인 행동"과 "단순화된 학습"을 분리함으로써, 거대하고 느린 문제(500대의 로봇을 가르치는 것)를 효율적인 문제로 전환했다는 점입니다. 연구진은 로봇에게 "오른쪽으로 비켜라"라거나 "기다려라"라고 프로그래밍하지 않았습니다. 대신, 이러한 행동들이 로봇이 목표에 도달하기 위한 가장 효율적인 방법이 되도록 학습 환경을 설계했습니다. 즉, 이러한 행동들이 자연스럽게 발현되도록 만든 것입니다.

요약하자면, 그들은 단순하게 생각하면서도 현실적으로 행동하는 기술을 통해, 별도의 안무가 없이도 숲속을 춤추듯 통과하는 로봇 개 군집을 가르쳐냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →