← 최신 논문
⚡ electrical engineering

Ground-JEPA: Learning Physically Grounded Latent World Models for Zero-Shot Dynamics Generalization of Legged Robots

Ground-JEPA는 태스크 특화된 보상에 의존하지 않고도 고차 자유도 환경의 다족 로봇을 위한 제로샷 역학 일반화와 우수한 제어 성능을 달고하는 최소한의 물리 기반 잠재 세계 모델을 도입함으로써, 보상이 없는 학습이 복잡한 로봇 시스템에 본질적으로 열등하다는 가설에 도전한다.

원저자: Yu-Xiang Wu, Yuyan Wu

게시일 2026-07-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yu-Xiang Wu, Yuyan Wu

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇의 내적 나침반

로봇에게 바위가 많은 들판을 가로질러 걷는 법을 가르친다고 상상해 보십시오. 여러분은 로봇에게 "발을 정확히 10센티미터 들어 올려라"와 같은 엄격한 규칙을 줄 수도 있겠지만, 현실 세계는 무질서합니다. 바위는 움직이고, 지면은 미끄러우며, 로봇의 다리는 예상보다 약간 더 무거울 수도 있습니다. 이것이 바로 **보행 로봇 제어(legged robot control)**의 과제입니다. 즉, 예측 불가능한 환경에서 기계가 부드럽고 안전하게 움직이도록 만드는 것입니다. 오랫동안 과학자들은 로봇 내부에 '역학 모델(dynamics models)'을 구축함으로써 이 문제를 해결하려 노력해 왔습니다. 이는 본질적으로 로봇이 특정 방식으로 움직였을 때 다음에 어떤 일이 일어날지를 예측하는 일종의 정신적 지도입니다.

전통적으로 이러한 정신적 지도는 로봇이 잘했을 때(예: 똑바로 서 있는 것) 보상을 주고, 잘못했을 때(예: 넘어지는 것) 벌을 주는 방식으로 구축되었습니다. 이를 **보상 기반 학습(reward-based learning)**이라고 합니다. 하지만 여기에는 함정이 있습니다. 만약 로봇이 예측에서 아주 작은 실수라도 한다면, 그 실수는 마치 언덕을 굴러 내려가는 눈덩이처럼 시간이 흐를수록 쌓여 결국 로봇의 정신적 지도를 완전히 잘못되게 만들고 충돌을 일으킬 수 있습니다. **결합 임베딩 예측 아키텍처(Joint-Embedding Predictive Architectures, JEPA)**라고 불리는 또 다른 접근 방식은 현실 세계의 번잡한 세부 사항을 건너뛰려고 시도합니다. 대신, 로봇의 카메라에 찍힐 모든 픽셀이 정확히 어디에 있을지를 예측하는 대신, 미래의 압축된 "요약본" 또는 "잠재적(latent)" 버전을 예측합니다. 이는 음악가가 공기의 정확한 진동을 계산하기보다는 리듬을 느낌으로써 다음 음표를 예측하는 것과 같습니다. 과학자들이 던져온 핵심적인 질문은 이것입니다. 로봇이 끊임없이 "잘했어" 또는 "다시 해봐"라는 선생님의 지시 없이, 단지 이 내적인 리듬을 이해하는 것만으로 완벽하게 걷는 법을 배울 수 있을 것인가?


Ground-JEPA: 리듬을 느끼며 걷는 법을 배운 로봇

한 연구팀은 Ground-JEPA라는 새로운 시스템을 도입하여, 로봇이 복잡한 움직임을 배우기 위해 끊임없는 칭찬이나 처벌이 필요하지 않을 수도 있다는 점을 시사했습니다. 대신, 로봇은 자신의 내적인 "미래에 대한 느낌"을 실제 움직임과 일치시키려는 노력만으로 배울 수 있습니다.

로봇이 "넘어지지 마"라는 말을 듣는 것이 아니라, 자신의 "내가 어디로 가고 있는가"에 대한 내적 감각이 실제 움직임과 일치하도록 노력하며 걷는 법을 배운다고 상상해 보십시오. 이 새로운 시스템에서 로봇은 미래의 완벽한 영상을 재구성하려고 애쓰지 않습니다. 대신, 자신의 경험을 작고 효율적인 "잠재 공간(latent space)", 즉 일종의 추상적인 정신적 약어로 압축합니다. 여기서 핵심적인 기술은 **물리 기반 프로브(physics-inspired probe)**입니다. 로봇의 내부 지도는 추상적이지만, 이 프로브는 번역기 역할을 하여 그 추상적인 생각들을 위치, 속도, 방향과 같은 실제 물리 법칙으로 변환합니다. 이는 순수한 개념으로 사고하지만, 그 개념들이 여전히 중력과 운동량의 법칙을 따르도록 보장하는 내장된 번역기를 가진 로봇과 같습니다.

연구진은 이 방식이 작동하는 비결이 단순히 번역뿐만이 아니라, **계획 지평(planning horizon)**에 있다는 것을 발견했습니다. 이전의 시도들이 실패했던 이유는 로봇이 마치 발끝만 보고 걷는 것처럼 아주 몇 단계 앞만 내다보았기 때문입니다. Ground-JEPA 시스템은 로봇이 훨씬 더 멀리, 구체적으로 12단계 앞을 내다보도록 강제합니다. 이는 매우 중요한데, 완전한 보행 주기(gait)가 대략 그 정도의 길이를 갖기 때문입니다. 전체 주기를 봄으로써 로봇은 단순히 다음의 작은 한 걸음을 최적화하는 것이 아니라, 움직임의 "큰 그림"을 볼 수 있습니다. 이를 통해 시스템은 외부 보상 없이도 자신의 내적 예측이 일관되는지 확인하는 **자기 지도 학습(self-supervision)**만을 통해 안정적인 보행 패턴을 학습할 수 있습니다.

시뮬레이션 결과는 상당히 놀랍습니다. 시뮬레이션된 4족 보행 로봇에서 이 보상 없는 시스템은 510 ± 68의 성능 점수를 기록했는데, 이는 전통적인 보상 기반 시스템이 기록한 450 ± 234보다 실제로 더 높은 수치였습니다. 더욱 인상적인 점은, 이 시스템을 시뮬레이션된 휴머노이드 로봇(인간과 유사한 신체를 가진 로봇)에 최초로 적용하여 보상 신호 없이 350 ± 50의 점수를 달성했다는 것입니다. 기존 방식은 이 설정에서 휴머노이드에 대해 완전히 실패했습니다.

가장 흥-미로운 발견 중 하나는 이 시스템이 "극한"의 변화를 얼마나 잘 처리하는가 하는 점입니다. 연구진은 로봇의 질량이 ±30% 변경되고, 지면 마찰력이 2.5배 증가하거나 0.4배로 감소하며, 모터에 50ms의 지연이 발생하는 등 물리 법칙이 급격히 변하는 시나리오에서 로봇을 테스트했습니다. 이 모든 변화가 동시에 발생하는 복합적인 시나리오에서 Ground-JEPA 모델은 원래 성능의 **78%**를 유지했습니다. 반면, 무작위 변동을 포함하여 훈련된 전통적인 보상 기반 모델은 성능의 **21%**만을 유지했습니다. 이는 로봇이 움직임의 근본적인 "매니폴드(manifold)" 또는 형태를 학습함으로써 세상의 변화에 훨씬 더 강력한 내성을 갖게 된다는 것을 시사합니다.

연구팀은 또한 모델의 크기가 거대할 필요가 없다는 것을 발견했습니다. 이 전체 시스템은 노트북 GPU에서 실행되며 약 130만 개의 파라미터만을 사용하는데, 이는 수십억 개의 파라미터를 필요로 하는 다른 거대 AI 모델들에 비하면 매우 작은 규모입니다. 그들은 이전 연구들에서 나타난 "붕괴(collapse, 학습이 멈추는 현 현상)"가 방법론의 결함 때문이 아니라, 로봇이 잘못된 유형의 내부 지도(구체적으로 SimNorm이라 불리는 정규화된 지도)를 사용하고 적절한 구조 없이 너무 먼 미래를 내다보았기 때문임을 보여주었습니다. 가공되지 않은 잠재 표현(raw latent representations)과 올바른 계획 지평을 사용함으로써 시스템은 아름답게 작동했습니다.

하지만 저자들은 이러한 결과가 현재 시뮬레이션에 기반하고 있다는 점을 주의 깊게 언급했습니다. 로봇이 극한의 변화가 있는 가상 세계에서는 걷는 법을 배웠지만, 이 시스템이 실제 세계의 물리적 로봇에 적용되어 테스트된 적은 아직 없습니다. 또한, 휴머노이드가 가만히 서 있게 하는 데는 성공했지만, 한 발로 균형을 잡는 복잡한 물리 법칙 때문에 휴노이드가 두 다리로 역동적으로 걷게 만드는 것은 여전히 과제로 남아 있습니다.

궁극적으로 Ground-JEPA는 로봇 공학의 새로운 경로를 제시합니다. 로봇에게 걷는 법을 가르치기 위해 수개월 동안 완벽한 보상 함수를 설계하는 대신, 우리는 단지 로봇이 자신의 내적 리듬을 물리 법칙과 일치시키도록 가르치기만 하면 될지도 모릅니다. 이는 고급 로봇 제어를 민주화하여, 거대한 슈퍼컴퓨터나 끝없는 시행착오의 보상 없이도 표준 노트북을 가진 작은 연구실들이 현실 세계에 적응할 수 있는 로봇을 구축할 수 있게 해줄 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →