← 최신 논문
🤖 AI

Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models

Z-1은 추가적인 비공개 데이터 없이도 공개된 RoboCasa 데모를 활용하여 GRPO(Group Relative Policy Optimization)를 적용함으로써, flow 기반의 시각-언어-행동(Vision-Language-Action) 모델의 성능과 성공률을 크게 향상시키는 강화 학습 사후 학습 프레임워크입니다.

원저자: Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li

게시일 2026-07-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 커피를 타거나 까다로운 서랍을 여는 것과 같은 복잡한 요리를 가르치고 있다고 상상해 보세요.

문제점: "흉내쟁이" 로봇
지금까지 대부분의 로봇 훈련사들은 "행동 복제(Behavior Cloning)"라는 방법을 사용해 왔습니다. 이것은 마치 학생이 선생님의 완벽한 영상만을 보고 배우는 것과 같습니다. 로봇은 선생님이 성공하는 모습을 보고 그 모든 동작을 똑같이 따라 하려고 노력합니다.

  • 결함: 만약 학생이 작은 실수(예를 들어, 손잡이를 1밀리미터 더 멀리 잡으려 하는 경우)를 한다면, 영상에는 그것을 어떻게 수정해야 하는지 나와 있지 않습니다. 로봇은 갇혀버리게 됩니다. 어떻게 회복해야 할지 알지 못해 실패하게 되는 것이죠. 로봇은 스스로의 실수로부터 배울 수 없습니다. 왜냐하면 훈련 과정 중에 실수를 해볼 기회 자체가 없었기 때문입니다.

해결책: Z-1 ("시행착오" 코치)
이 논문은 로봇이 직접 해보고, 실패하고, 다시 시도하며 배울 수 있게 해주는 새로운 훈련 시스템인 Z-1을 소개합니다. 이것은 마치 코치가 학생에게 주방에서 연습하게 하고, 실패하면 다음에는 어떻게 더 잘할 수 있는지 구체적인 피드백을 주는 것과 같습니다.

Z-1이 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.

1. 시작 단계 (SFT)

먼저, 로봇은 인간이 문을 열거나 싱크대를 사용하는 등의 작업을 수행하는 공개 영상을 보며 "속성 과외"를 받습니다. 이는 요리하기 전에 레시피를 읽는 것과 비슷하며, 이를 통해 로봇은 무엇을 해야 하는지에 대한 기본적인 개념을 갖게 됩니다.

2. "그룹 연습" (GRPO)

Z-1은 로봇이 혼자 연습하게 두는 대신, **그룹 상대 정책 최적화(Group Relative Policy Optimization, GR도를 GRPO)**라는 방법을 사용합니다.

  • 비유: 코치가 8명의 학생을 동시에 커피를 만들도록 주방으로 보내는 것을 상상해 보세요.
  • 목표: 코치는 단순히 "잘했어" 또는 "못했어"라고 말하지 않습니다. 대신 코치는 8명의 학생을 서로와 비교합니다. 만약 7명의 학생이 커피를 쏟았는데 1명의 학생이 성공했다면, 코치는 성공한 학생에게 "너는 다르게 했구나, 네가 했던 방식을 계속 유지해봐"라고 말합니다. 이를 통해 로봇은 정확히 어떤 미세한 움직임이 차이를 만들어냈는지 파악할 수 있습니다.

3. 스마트한 기술들 (새로운 모듈)

이 논문은 이 연습 과정을 효율적이고 안정적으로 만들기 위해 네 가지 영리한 기술을 도입했습니다.

  • 공유 접두사 (Shared-Prefix, "같은 시작" 규칙):

    • 문제: 만약 학생 A는 왼쪽으로 걷기 시작하고 학생 B는 오른쪽으로 걷기 시작한다면, 그들의 최종 커피 제조 기술을 비교하는 것은 불공평합니다. 시작점이 달랐기 때문입니다.
    • 해결책: Z-1은 모든 학생이 정확히 같은 첫 몇 가지 동작(예: 카운터로 걸어가기)으로 시작하도록 강제합니다. 일단 모두가 카운터에 서게 되면, 그들은 각자 다른 방식으로 컵을 잡는 시도를 합니다. 이를 통해 로봇은 걷는 과정이 아니라, 작업의 핵심적인 부분(컵 잡기)으로부터 학습하게 됩니다.
  • 트리 구조 분기 (Tree-Structured Branching, "분기되는 경로" 규칙):

    • 문제: 때로는 "카운터로 걷는" 부분조차 연습이 필요할 수 있습니다. 만약 우리가 항상 똑같이 시작하도록 강제한다면, 로봇은 잘못된 걸음걸이를 바로잡는 법을 배우지 못할 것입니다.
    • 해결책: Z-1은 "트리" 구조를 사용합니다. 모든 학생은 함께 시작하지만, 이후 서로 다른 지점에서 작은 그룹으로 나뉩니다. 어떤 그룹은 일찍 갈라지고, 어떤 그룹은 늦게 갈라집니다. 이를 통해 로봇은 조직적인 연습을 유지하면서도, 작은 실수를 바로잡는 법을 연습할 수 있습니다.
  • 성공 인지 보상 감쇠 (Success-Aware Reward Decay, "속도 보너스"):

    • 문제: 만약 로봇이 문을 여는 데 10분이 걸렸든 1분이 걸렸든, 표준적인 시스템은 둘 다에게 "잘했어" 스티커를 줄 수 있습니다.
    • 해결책: Z-1은 더 빨리 끝낸 로봇에게 더 큰 "잘했어" 스티커를 줍니다. 느린 로봇을 처벌하는 것은 아니지만, 빠른 로봇에게 더 많은 보상을 줍니다. 이는 로봇이 두려움 없이 시도하면서도 효율적으로 움직이도록 독려합니다.
  • 선택적 공동 훈련 (Selective Joint Training, "뇌와 손의 스위치"):

    • 문제: 때때로 로봇이 실패하는 이유는 "손"(동작 전문가)이 서툴기 때문일 수도 있지만, 다른 때에는 "눈"(시각-언어 뇌)이 노브(손잡이)를 명확히 보지 못해서일 수도 있습니다.
    • 해결책: 보통 Z-1은 안정성을 위해 "손"만을 훈련시킵니다. 하지만 로봇이 물체를 제대로 보거나 이해하지 못해서 계속 실패한다면, Z-1은 스위치를 올려 "뇌"와 "손"을 함께 훈련시킵니다. 이는 "아, 학생이 서툰 게 아니라 손잡이를 잘 못 보고 있구나!"라고 깨닫고, 더 잘 볼 수 있도록 가르치는 것과 같습니다.

결과

연구팀은 Z-1을 24가지의 다양한 가사 작업(서랍 열기, 싱크대 사용하기, 커피 만들기 등)에 테스트했습니다.

  • Z-1 적용 전 (단순히 영상 시청): 로봇은 약 **67%**의 확률로 성공했습니다.
  • Z-1 적용 후 (새로운 기술로 연습): 로봇은 **80.6%**의 확률로 성공했습니다.

이 향상은 Z-1이 비밀스러운 비공개 데이터를 사용하지 않고 오직 공개된 영상과 자체적인 연습 세션만을 사용했음에도 불구하고, 현재 공개된 최고 수준의 로봇 모델들을 능가할 만큼 유의미했습니다.

요약하자면:
Z-1은 로봇을 단순한 흉내쟁이에서 문제 해결사로 변화시킵니다. 그룹 단위로 연습하게 하고, 같은 지점에서 시작하며, 속도에 보상을 주고, 눈과 손 중 무엇을 훈련해야 할지 판단하게 함으로써, 로봇은 이전보다 훨씬 더 잘 실제 가정집의 복잡하고 무질서한 도전 과제들을 처리할 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →