← 최신 논문
🤖 AI

Learning Native Continuation for Action Chunking Flow Policies

이 논문은 액션-청킹 비전-언어-액션 모델에 대한 학습 시간 연속성 방법인 Legato 를 소개하며, 이는 흐름 역학을 재구성하고 무작위화된 스케줄 조건화를 활용하여 더 매끄럽고 일관된 궤적을 생성함으로써 기존 실시간 청킹 접근법보다 실제 세계 조작 작업에서 더 우수한 성능을 발휘합니다.

원저자: Yufeng Liu, Hang Yu, Juntu Zhao, Bocheng Li, Di Zhang, Mingzhu Li, Wenxuan Wu, Yingdong Hu, Junyuan Xie, Junliang Guo, Dequan Wang, Yang Gao

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yufeng Liu, Hang Yu, Juntu Zhao, Bocheng Li, Di Zhang, Mingzhu Li, Wenxuan Wu, Yingdong Hu, Junyuan Xie, Junliang Guo, Dequan Wang, Yang Gao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡한 작업을 수행하도록 로봇을 가르친다고 상상해 보세요. 예를 들어, 한 컵에서 다른 컵으로 물을 따르는 작업입니다. 이를 위해 로봇은 장면을 보고 다음에 무엇을 해야 할지 결정하는 "뇌"(시각-언어-행동 모델) 를 사용합니다.

하지만 이 뇌는 느립니다. 매 밀리초마다 로봇에게 새로운 지시를 내릴 만큼 빠르게 생각할 수 없습니다. 따라서 엔지니어들은 **"액션 청킹 (Action Chunking)"**이라는 트릭을 사용합니다. 한 번에 하나의 지시만 내리는 대신, 뇌는 미래의 움직임 전체를 하나의 "청크"로 예측합니다 (예: 다음 2 초간의 운동).

문제: "떨림 (Stutter)"

이 논문은 현재 이러한 청크들을 어떻게 연결하는지에 관한 주요 결함을 지적합니다.

복도를 걷고 있다고 상상해 보세요. 한 걸음을 내디디고, 또 다른 걸음을 내딛습니다. 다음 세 걸음을 한 번에 계획하면 매끄럽게 걸을 수 있습니다. 하지만 그 세 걸음을 마치고 다음 세 걸음을 계획해야 할 때, 뇌는 멈추고 재평가하며 새로운 계획을 세워야 합니다.

현재의 로봇에서는 이 멈춤이 한 청크가 끝나고 다음 청크가 시작되는 경계에서 **"떨림"**이나 **"딸꾹질"**을 유발합니다. 로봇은 다음과 같은 행동을 보일 수 있습니다:

  • 망설임 (순간적으로 멈춤).
  • 갑자기 다른 방향으로 튕겨 나감.
  • 어떤 손을 사용할지, 또는 어떤 물건을 잡을지 결정 사항을 바꿈.

이 논문은 이를 **"불필요한 다중 모드 전환 (spurious multimodal switching)"**이라고 부릅니다. 쉽게 말해, 로봇은 전환 지점에서 혼란을 겪고 서로 다른 가능한 행동들 사이에서 흔들리며, 움직임이 날카롭고 부자연스럽게 보입니다.

이전 해결책: "실시간 청킹 (Real-Time Chunking, RTC)"

이 문제를 해결하려는 이전 시도인 실시간 청킹 (RTC) 은 포스트잇 메모와 같았습니다.

  • 로봇이 한 청크를 마치면, 시스템은 로봇이 직전 몇 번의 움직임을 살펴봅니다.
  • 새로운 청크가 이전 청크가 멈춘 지점에서 정확히 시작하도록 강제합니다.
  • 결함: 이는 로봇이 이미 생각한 후에 적용되는 외부 규칙입니다. 화가에게 "다음 붓질이 마지막 붓질과 연결되도록 하라"고 말하는 것과 같지만, 화가는 어떻게 자연스럽게 연결하는지 배우지 못했습니다. 로봇은 여전히 내부적으로 혼란을 겪어 망설임과 날카로운 움직임을 초래합니다.

새로운 해결책: "레가토 (Legato)"

저자들은 **레가토 (Legato)**라는 새로운 방법을 제안합니다 (이름은 "매끄럽게 연결된"을 의미하는 음악 용어에서 따왔습니다).

마지막에 규칙을 추가하는 대신, 레가토는 로봇의 뇌가 학습하는 동안 점들을 어떻게 연결할지 가르칩니다.

다음은 창의적인 비유를 통해 작동 방식을 설명한 것입니다:

1. "훈련용 바퀴가 달린 자전거" 비유
아이에게 자전거 타기를 가르친다고 상상해 보세요.

  • 기존 방식 (RTC): 아이가 타게 하고, 턴 끝에서 흔들리면 핸들을 잡아당겨 강제로 곧게 만듭니다. 아이는 흔들림을 고쳐주도록 당신에게 의존하는 법을 배웁니다.
  • 레가토 방식:중간에 균형을 느끼는 법을 가르칩니다. 턴의 매 초마다 얼마나 많은 지원이 필요한지에 대한 "일정"을 제공합니다. 턴을 더 진행할수록 천천히 손을 떼지만, 전체적으로 부드럽게 안내합니다.

2. "부드러운 경사면" 대 "단단한 벽"
레가토는 "일정 모양"의 안내를 사용합니다.

  • 로봇이 새로운 청크를 시작할 때, 이전 청크가 어떻게 끝났는지 정확히 알고 있습니다.
  • 레가토는 로봇에게 말합니다: "이 새로운 청크의 처음 부분에서는 이전 경로를 반드시 정확히 따라야 합니다."
  • 그다음, 천천히 말합니다: "좋습니다, 이제 조금씩 벗어나고 스스로 선택하기 시작할 수 있습니다."
  • 마지막으로: "이제 나머지 움직임을 계획할 자유가 있습니다."

이는 로봇이 갑자기 기어를 바꿔야 하는 단단한 벽이 아니라, 자유로움의 부드러운 경사면을 만듭니다.

3. "내재된 기술"
레가토의 가장 중요한 부분은 로봇의 내부 "흐름"을 변화시킨다는 점입니다. 로봇의 뇌 내부의 수학을 재구성하여 청크를 연결하는 것이 로봇이 생각하는 방식의 자연스러운 일부가 되도록 합니다.

  • 단순히 과거와 일치하도록 로봇을 강제하는 것이 아니라, 과거와 일관성을 유지하는 것이 로봇에게 가장 쉽고 논리적인 경로임을 가르칩니다.
  • 이로 인해 로봇이 망설이거나 서로 다른 아이디어들 사이를 오가는 것 (다중 모드 전환) 을 멈춥니다.

결과

연구자들은 실제 로봇을 사용하여 다섯 가지 다른 작업 (그릇 쌓기, 물건 따르기, 물체 집기, 서랍 열기, 수건 접기) 에서 이를 테스트했습니다.

  • 더 매끄러운 움직임: 레가토를 적용한 로봇은 유체처럼 흐르는 물처럼 움직인 반면, 기존 방법은 날카로운 일련의 단계처럼 움직였습니다.
  • 더 빠른 완료: 로봇이 "청크 경계"에서 망설이거나 멈추지 않았기 때문에, 작업을 약 10% 더 빠르게 완료했습니다.
  • 덜 혼란: 로봇은 흔들리지 않고 계획에 충실했습니다 (예: "나는 왼손을 사용할 것이다").

요약

액션 청킹을 로봇이 움직임을 계획하기 위해 일련의 사진을 찍는 것으로 생각하세요.

  • 문제: 사진들이 완벽하게 정렬되지 않아 영화가 떨리는 것처럼 보입니다.
  • 이전 해결책: 사진을 찍은 후에 편집하여 연결하려 합니다 (RTC). 하지만 떨림은 여전히 남아 있습니다.
  • 레가토: 촬영하는 동안 사진이 자연스럽게 완벽하게 정렬되도록 카메라가 어떻게 사진을 찍을지 가르칩니다. 그 결과, 로봇이 자신감과 우아함으로 움직이는 매끄럽고 연속적인 영화가 만들어집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →