← 최신 논문
💻 computer science

DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization

본 논문은 작업 간 잠재 표현을 포착하고 RL 잔차의 혼합을 통해 정책 최적화를 동적으로 정제함으로써 작업 간 전이 간섭을 완화하고 분포 변화 하에서 성능을 향상시켜, 비전-언어-행동 모델의 일반화 능력을 증진시키는 2 단계 최적화 프레임워크인 DyGRO-VLA 를 소개합니다.

원저자: Sixu Lin, Yunpeng Qing, Litao Liu, Ming Zhou, Ruixing Jin, Xiaoyi Fan, Guiliang Liu

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sixu Lin, Yunpeng Qing, Litao Liu, Ming Zhou, Ruixing Jin, Xiaoyi Fan, Guiliang Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇을 "만능 전문가"로 가르치려 한다고 상상해 보세요. 같은 두뇌를 사용하여 요리하고, 청소하고, 물이 새는 수도꼭지를 고르고, 선반을 만드는 등 모든 일을 할 수 있기를 원합니다. 이것이 VLA(시각 - 언어 - 행동) 모델의 목표입니다: 로봇이 보고, 언어를 이해하며, 팔을 움직여 일을 수행할 수 있도록 하는 것입니다.

그러나 큰 문제가 하나 있습니다. 연구자들이 강화 학습 (RL) 을 사용하여 이러한 로봇을 더 발전시키려 할 때—로봇이 시행착오를 통해 학습하고 성공 시 "보상"을 받는 방법—종종 역설에 부딪힙니다.

문제: "전문가"의 함정

로봇의 두뇌를 지식의 도서관으로 생각하세요. 처음 훈련할 때는 "물체를 잡는다"와 같은 일반적인 규칙을 배웁니다. 하지만 "빨간 블록을 쌓는다"와 같은 특정 작업을 가르치기 위해 RL 을 사용하기 시작하면, 로봇은 그 한 가지 작업에 너무 집중하여 자신의 도서관을 다시 쓰기 시작합니다.

이는 수학 시험을 위해 너무 열심히 공부하다 읽는 법을 잊어버리는 학생과 같습니다. 이 논문은 이를 "파괴적 망각 (Catastrophic Forgetting)" 이라고 부릅니다.

  • 과거의 방식: 로봇을 10 가지 다른 작업으로 훈련시키면, 한 가지 작업은 잘하게 되지만 나머지 아홉 가지는 잊어버립니다. 추가하는 작업이 많을수록 전체적인 성능은 더 나빠집니다. 이는 20 개의 공을 동시에 저글링하려는 것과 같습니다. 결국 뇌가 너무 많은 것들에 동시에 전문가가 되려고 애쓰다 모든 공을 떨어뜨리게 됩니다.

해결책: DyGRO-VLA

저자들은 DyGRO-VLA라는 새로운 방법을 제안합니다. 이것이 어떻게 작동하는지 이해하기 위해, 바쁜 부엌을 운영하는 마스터 셰프를 상상해 보세요.

1 단계: "마스터 셰프" (오프라인 사전 훈련)

먼저, 로봇은 인간이 모든 종류의 작업을 수행하는 방대한 비디오 라이브러리에서 학습합니다.

  • 트릭: 모든 비디오를 단순히 암기하는 대신, 로봇은 "노이즈"를 걸러내는 법을 배웁니다. 이동에 중요하지 않은 것들 (벽의 색상이나 조명 등) 은 무시하고 필수 정보만 (컵의 위치, 무게 등) 에 집중합니다.
  • 비유: 이는 마스터 셰프가 요리의 기본을 배우는 것과 같습니다. 피자를 만들든 수프를 만들든 "열은 치즈를 녹인다"와 "칼은 잘라낸다"는 사실을 배웁니다. 이는 모든 작업에 적용 가능한 공통된 기반을 만듭니다.

2 단계: "전문가 팀" (온라인 미세 조정)

이제 로봇은 현실 세계의 특정 작업에서 더 나아져야 합니다. 마스터 셰프의 두뇌를 다시 쓰는 대신, DyGRO-VLA 는 전문가 팀 (Residual Experts 라고 함) 을 추가합니다.

  • 작동 방식: 마스터 셰프 (기저 모델) 가 무엇을 할지 추측합니다. 그런 다음 "라우터 (head chef 와 유사)"가 현재 작업을 보고 "이 특정 작업에 가장 적합한 조수는 누구인가?"라고 묻습니다.
    • 작업이 "그릇 쌓기"라면, 라우터는 "쌓기 조수"를 부릅니다.
    • 작업이 "못 박기"라면, 라우터는 "망치 조수"를 부릅니다.
  • 마법: 이 조수들은 마스터 셰프의 계획에 작은 수정 (잔차) 만 가합니다. 책 전체를 다시 쓰는 것이 아니라, "손을 2 인치 왼쪽으로 움직여라"라는 메모를 붙이는 것입니다.
  • 도움이 되는 이유: 마스터 셰프의 두뇌는 대부분 건드리지 않기 때문에, 로봇은 다른 작업 수행 방법을 잊어버리지 않습니다. "쌓기 조수"는 "망치 조수"와 간섭하지 않습니다. 그들은 서로의 발을 밟지 않고 함께 일합니다.

결과

연구자들은 이 방법을 두 가지 주요 로봇 도전 과제에서 테스트했습니다:

  1. LIBERO: 물체 이동, 쌓기, 긴 행동 시퀀스 등 130 가지 다른 작업이 포함된 디지털 테스트 스위트.
  2. RoboTwin2: 듀얼 암 로봇을 사용한 현실 세계 테스트.

결과:

  • 남들보다 뛰어남: DyGRO-VLA 는 다른 모든 최상위 방법들을 능가했습니다. 가장 어려운 작업 (긴 행동 시퀀스) 에서 성공률은 거의 10% 향상되었습니다.
  • 현실 세계 성공: 로봇을 컴퓨터 시뮬레이션에서 실제 물리 로봇으로 옮겼을 때도 여전히 경쟁사보다 더 잘 수행하여 병을 집어 올리고 그릇을 쌓는 등의 작업을 성공적으로 완료했습니다.

요약

간단히 말해, 이전 방법들은 로봇을 각 작업마다 "초전문가"로 만들려 했기 때문에 다른 모든 것을 잊어버리게 했습니다. DyGRO-VLA는 로봇을 "일반주의자 (마스터 셰프)"로 유지하면서, 필요할 때만 도움을 주기 위해 동적인 전문가 팀을 고용합니다. 이렇게 하면 로봇은 다른 어떤 것도 잊지 않고 모든 것을 더 잘하게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →