← 최신 논문
💻 computer science

Robot Squid Game: Quadrupedal Locomotion for Traversing Narrow Tunnels

본 논문은 전문화된 전문가 정책으로부터 지식을 통합된 학생 정책으로 전이함으로써 4족 보행 로봇이 복잡하고 제한된 3 차원 터널 환경을 견고하게 통과할 수 있도록 절차적 환경 생성과 정책 증류를 결합한 강화 학습 프레임워크를 제시한다.

원저자: Amir Hossain Raj, Dibyendu Das, Xuesu Xiao

게시일 2026-05-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Amir Hossain Raj, Dibyendu Das, Xuesu Xiao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

네 발 로봇 개가 다양한 모양의 좁은 터널을 기어가는 법을 가르친다고 상상해 보세요. 어떤 터널은 원형이고, 어떤 것은 삼각형이며, 어떤 것은 뒤집힌 반원형이고, 어떤 것은 바닥에 간격이 있어 로봇이 한 턱에서 다른 턱으로 뛰어넘어야 합니다.

이것이 논문 "Robot Squid Game"이 다루는 과제입니다. 저자 아미르 호세인 라지, 디벤두 다스, 그리고 쉬수 샤오는 로봇이 벽에 부딪히거나 갇히지 않고 이러한 좁은 3 차원 공간을 항해할 수 있도록 돕는 SQUID(Skill-fused Quadrupedal locomotion Using Imitation and Distillation, 모방과 증류 기반의 융합 사지 보행) 라는 시스템을 개발했습니다.

그들이 어떻게 했는지 간단히 설명해 드리겠습니다:

문제: "만능 해결책"의 함정

보통 로봇에 걷는 법을 가르칠 때, 우리는 특정 유형의 장애물 하나만 놓고 훈련시킵니다. 하지만 실제 세계의 터널은 지저분합니다. 모양, 크기, 각도가 끊임없이 변합니다.

  • 옛날 방식: 로봇에게 원형 터널, 그다음 정사각형 터널, 그다음 톱니 모양 터널을 모두 한 번에 통과하는 법을 가르친다고 상상해 보세요. 로봇은 혼란에 빠집니다. 고속도로, 흙길, 그리고 좁은 주차장을 한 수업 안에 모두 가르치려 하는 것과 같습니다. 각 환경의 규칙이 너무 달라서 실패하는 경우가 많습니다.
  • 한계: 기존 방법들은 경직된 패턴에 갇히거나 (일직선으로만 걷는 법만 아는 로봇처럼), 실제 세계 센서의 노이즈에 압도당합니다 (흐릿한 벽을 "눈"으로 보자마자 당황하는 로봇처럼).

해결책: "마스터 셰프"와 "견습생"

저자들은 교사 - 학생 접근법을 활용한 영리한 훈련 전략을 고안했습니다. 요리 학교를 생각해 보세요.

  1. 전문 셰프들 (교사들):
    한 로봇에게 모든 것을 한 번에 가르치려 하지 않고, 네 명의 서로 다른 "전문가" 로봇을 만들었습니다.

    • 전문가 A 는 삼각형 터널에서만 연습합니다.
    • 전문가 B 는 원형 터널에서만 연습합니다.
    • 전문가 C 는 반원형 터널에서만 연습합니다.
    • 전문가 D 는 간격 터널 (뛰어야 하는 곳) 에서만 연습합니다.

    이 전문가들은 완벽한 컴퓨터 생성 세계에서 "초시력"을 가지고 훈련받습니다. 실제 세계에서는 볼 수 없는 경로라 하더라도 터널의 정확한 모양과 가야 할 완벽한 경로를 볼 수 있습니다. 그들은 각자 특정 터널 유형의 대가가 됩니다.

  2. 절차적 주방 (환경):
    이 전문가들이 정말로 강건하도록, 컴퓨터는 터널 하나만 짓지 않습니다. "절차적 생성기"(랜덤 생성기) 를 사용하여 크기, 각도, 난이도가 다른 수천 개의 터널을 만듭니다. 요리사가 스토브가 움직이고, 바닥이 기울어지며, 벽이 모양을 바꿀 때마다 돌아설 때마다 연습하는 주방과 같습니다. 이는 로봇이 특정 경로를 단순히 외우는 것을 방지합니다. 로봇은 어떻게 움직일지 배워야 합니다.

  3. 견습생 (학생):
    네 명의 전문가가 대가가 되면, 팀은 최종 로봇인 학생을 만듭니다. 이 로봇이 실제로 현실 세계로 나가는 로봇입니다.

    • 학생은 "초시력"이 없습니다. 표준 깊이 카메라 (3D 눈) 와 다리 센서만 있습니다.
    • 학생은 네 명의 전문가를 지켜봅니다. 학생이 삼각형 터널에 있으면 전문가 A 로부터 배우고, 원형 터널에 있으면 전문가 B 로부터 배웁니다.
    • 증류라는 과정을 통해 학생은 네 명의 전문가의 "근육 기억"과 전략을 하나의 뇌로 흡수합니다.

결과: 무엇이든 기어갈 수 있는 로봇

논리는 이 시스템을 두 가지 방식으로 테스트했습니다:

  1. 컴퓨터 내부 (시뮬레이션): 로봇을 점점 어려워지는 터널에 던졌습니다. SQUID 로봇은 기존 방법보다 훨씬 뛰어났습니다. 터널을 더 빠르게 통과했고, 벽에 부딪히는 횟수가 적었으며, 배터리 소모도 적었습니다. 특히 다른 로봇들이 실패했던 까다로운 삼각형 터널과 간격 터널에서 특히 잘했습니다.
  2. 현실 세계: 훈련된 로봇 (Unitree Go2) 을 실제 테스트 터널에 넣었습니다. 현실 세계에는 "노이즈"(흐릿한 카메라 이미지, 고르지 않은 바닥) 가 있지만, 로봇은 좁은 원형, 기울어진 삼각형, 간격을 성공적으로 기어갔습니다. 터널 모양에 따라 약 60% 에서 80% 의 성공률을 달성했습니다.

이것이 중요한 이유

핵심 교훈은 거대하고 무서운 문제 (어떤 터널이든 항해하기) 를 작고 관리 가능한 수업 (한 번에 한 터널 유형을 마스터하기) 으로 나누고, 그 수업들을 결합함으로써 로봇이 훨씬 더 적응력이 있게 된다는 점입니다.

이상한 모양을 보면 얼어붙는 로봇 대신, 이 로봇은 움직임의 "도구 상자"를 가지고 있습니다. 낮은 천장을 위해 웅크리는 법, 높은 천장을 위해 늘리는 법, 턱 위에서 균형을 잡는 법을 모두 알고 있습니다. 이는 전문 교사들로부터 배운 뒤 그 기술을 하나의 똑똑하고 범용적인 전략으로 결합했기 때문입니다.

간단히 말해: 그들은 로봇 개에게 터널의 "오징어 게임"을 마스터하도록 가르쳤습니다. 실제 게임을 치르기 전에 전문 훈련 캠프에서 연습하게 함으로써요.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →