← 최신 논문
💻 computer science

LEGS: Fine-Tuning Teleop-Free VLAs for Humanoid Loco-manipulation in an Embodied Gaussian Splatting World

이 논문은 3D 가우시안 스플래팅 배경과 메쉬 전경을 결합한 하이브리드 시뮬레이터인 LEGS를 제시하며, 이는 휴머노이드 로코매니퓰레이션(loco-manipulation) 작업에서 시각-언어-행동 정책이 인간의 시연으로 학습된 베이스라인을 능가할 수 있도록 하는 확장 가능하고 텔레오퍼레이션이 필요 없는 합성 데이터를 생성한다.

원저자: Hojune Kim, Timothy Chen, Jiankai Sun, Lars W. Osterberg, Qianzhong Chen, Ke Wang, Mac Schwager

게시일 2026-06-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hojune Kim, Timothy Chen, Jiankai Sun, Lars W. Osterberg, Qianzhong Chen, Ke Wang, Mac Schwager

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 휴머노이드 로봇(인간 형태의 기계)에게 방 안을 걸어 다니며 오렌지를 집어 접시에 놓는 법을 가르치고 싶다고 상상해 봅시다. 이를 수행하기 위해 로봇은 마치 학생이 선생님으로부터 배우는 것처럼, 예시로부터 "학습"해야 합니다.

보통 이러한 예시를 얻는 유일한 방법은 사람이 특수 슈트를 입거나 조이스틱을 사용하여 로봇이 과제를 수행하도록 반복적으로 물리적으로 안내하는 것입니다. 이를 **원격 조종(teleopration)**이라고 합니다. 이는 느리고, 비용이 많이 들며, 사람을 매우 지치게 만듭니다. 만약 로봇에게 새로운 작업을 가르치거나 다른 방에서 작업하게 하고 싶다면, 사람이 다시 모든 과정을 직접 안내해야 합니다.

이 논문의 저자들(스탠퍼드 대학교 소속)은 LEGS(Locomotion via Embodied Gaussian Splatting)라고 불리는 새로운 시스템을 구축했습니다. LEGS를 초현실적인 비디오 게임이라고 생각하면 쉽습니다. 이 시스템은 단 한 명의 인간도 컨트롤러를 만지지 않고도 로봇을 위한 무한한 훈련 데이터를 생성할 수 있습니다.

LEGS가 어떻게 작동하는지 몇 가지 간단한 비유를 통해 설명하겠습니다.

1. "마법 같은 배경" vs "실제 로봇"

영화 촬영을 한다고 상상해 보세요.

  • 배경: 가짜 세트장을 판지로 만드는 대신(가짜처럼 보이기 때문), 연구진은 실제 방의 영상을 찍어 이를 3D 사진 모자이크(3D Gaussian Splatting이라 불림)로 만들었습니다. 이 배경은 너무나 사실적이어서, 만약 당신이 그 속을 걸어 다닌다 해도 실제 세상과 똑같아 보일 것입니다.
  • 전경: 로봇과 물체들(오렌지와 접시 같은)은 디지털 3D 모델입니다.
  • 비결: LEGS는 디지털 로봇을 실제 사진 모자이크 배경 안에 배치합니다. 그런 다음, 디지털 로봇의 조명과 색상이 실제 배경과 완벽하게 일치하도록 특별한 "색상 필터"를 사용합니다. 이것이 "가짜"와 "실제" 사이의 간극을 메워줍니다.

2. "유령 감독"

일반적인 비디오 게임에서는 캐릭터를 움직이기 위해 버튼을 눌러야 합니다. 하지만 LEGS에는 유령 감독(절차적 생성기)이 있습니다.

  • 이 감독은 무엇을 할지 알려줄 인간을 필요로 하지 않습니다. 감독은 물리 법칙과 목표(예: "오렌지를 집어라")를 알고 있습니다.
  • 감독은 로봇이 걷고, 잡고, 물체를 놓는 수천 가지의 서로 다른 방식을 자동으로 생성합니다.
  • 로봇의 움직임이 배경과 별도로 기록되기 때문에, 연구진은 한 세트의 움직임을 가져와서 버튼 하나만 누르면 완전히 다른 방이나 다른 물체(예: 오렌지를 사과로 교체)가 있는 환경으로 즉시 "재렌더링"할 수 있습니다.

3. 결과: 인간 선생님보다 뛰어난 성능

연구진은 이 시스템을 실제 로봇(Unitree G1)과 세 가지 유형의 "두뇌" 소프트웨어(VLA 모델이라 불림)로 테스트했습니다. 그들은 LEGS를 두 가지 다른 방식과 비교했습니다:

  1. 인간 원격 조종: 사람이 로봇을 직접 안내하는 방식 (비싸고 느림).
  2. 기존 방식의 시뮬레이션: 그래픽이 가짜처럼 보이는 비디오 게임 (메쉬 기반).

결과는 놀라웠습니다:

  • LEGS가 인간을 이겼습니다: LEGS 데이터로만 학습한 로보트가 인간이 직접 안내하며 학습시킨 로봇만큼, 혹은 그보다 더 뛰어난 성능을 보였습니다.
  • LEGS가 가짜 그래픽을 이겼습니다: "사진처럼 사실적인" LEGS 배경에서 학습한 로봇은 "만화 같은" 기존 시뮬레이션에서 학습한 로봇보다 훨씬 더 자주 과제 수행에 성공했습니다. 이는 사실적인 세상을 보는 것이 로봇의 학습에 더 도움이 된다는 것을 증명합니다.
  • "마법 같은" 적응력: 과제를 변경했을 때(예: "오렌지 대신 사과를 집어라" 또는 "파란색 테이블으로 이동하라"), LEGS로 학습한 로봇은 기존 데이터를 재렌더링함으로써 즉각적으로 적응할 수 있었습니다. 반면, 인간이 학습시킨 로봇은 해당 물체를 본 적이 없었기 때문에 완전히 실패했습니다.

핵심 요약

LEGS는 스스로 돌아가는 로봇 훈련 체육관과 같습니다.

  • 인간이 필요 없습니다: 로봇을 안내하기 위해 지친 노동자가 필요하지 않습니다.
  • 무한한 다양성: 디지털 설정을 변경하는 것만으로 방, 가구, 또는 물체를 즉시 바꿀 수 있습니다.
  • 더 저렴하고 빠릅니다: 새로운 장면을 위해 데이터를 생성하는 데 드는 시간과 비용이 실제 현장에 가서 기록하는 것에 비해 극히 적습니다.

이 논문은 휴머노이드 로봇에게 걷기와 물건 잡기를 가르치는 데 있어, 사진처럼 사실적인 시뮬레이션이 이제 실제 세계의 인간 훈련을 완벽하게 대체할 수 있다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →