Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
본 논문은 이질적인 다중 로봇 데이터를 활용하여 다양한 작업과 미학습 로봇에 대해 우수한 전이 가능성과 성능을 달성함으로써, 적은 컴퓨팅 예산과 제한된 다운스트림 데이터 환경에서도 효과적인 표현 중심의 지속적 사전 학습 접근 방식인 VLAct를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇은 오랫동안 인간처럼 경험으로부터 배우는 데 어려움을 겪어 왔습니다. 아이는 부모가 물을 따르는 모습을 보고 그 동작을 이해할 수 있는 반면, 로봇은 일반적으로 동일한 작업을 수행하기 위해 수천 개의 구체적이고 수동으로 코딩된 지침이 필요합니다. 수년 동안 과학자들은 엄청난 양의 데이터를 로봇에게 입력하여, 그 규모 자체가 로봇에게 움직이는 법을 가르쳐 주기를 바라며 이 문제를 해결하려 노력해 왔습니다. 이 접근 방식은 시각-언어-행동(Vision-Language-Action) 모델에 의존하는데, 이는 이미지를 보고, 문장을 이해하며, 물리적인 움직임을 결정할 수 있는 컴퓨터 시스템입니다. 지배적인 믿음은 단순히 충분한 양의 로봇 움직임을 수집한다면, 시스템이 어떤 상황도 처리할 수 있을 만큼 자연스럽게 똑똑해질 것이라는 것이었습니다. 그러나 로봇 데이터를 수집하는 것은 매우 어렵고 비용이 많이 듭니다. 인터넷상의 사진이나 텍ek스트와 달리, 로봇의 움직임은 종종 인간이 기계를 유도함으로써 실제 물리적 세계에서 기록되어야 하기 때문입니다. 이러한 희소성 때문에 가장 큰 로봇 데이터셋조차 물리적 세계의 광대함에 비하면 매우 작고 희박합니다.
한 연구팀은 이제 다른 길을 제시하며, 로봇이 보는 데이터의 양보다 무엇을 배우는지에 대한 질이 더 중요하다고 제안했습니다. 그들은 로봇이 단순히 특정 움직임을 암기하는 대신, 사물과 동작이 서로 어떻게 연관되는지에 대한 깊고 유연한 이해를 배워야 한다고 주장합니다. 이 "표상(representation)"—즉, 로봇이 구축하는 세상에 대한 내부 지도—에 집중함으로써, 그들은 로봇이 훨씬 더 잘 일반화할 수 있도록 하는 새로운 학습 방법을 만들어냈습니다. 그들의 연구는 로봇의 핵심 두뇌를 더 똑똑하게 가르치는 방법을 통해, 한 번도 본 적 없는 로в 로봇에서도 복잡한 작업을 수행할 수 있는 시스템을 구축할 수 있음을 입증했습니다. 이는 이전에 필요하다고 생각되었던 데이터의 아주 일부만을 사용하여 가능했습니다.
VLAct라는 이름으로 활동하는 연구진은 근본적인 질문에서 시작했습니다: 왜 로봇은 일반화에 실패하는가? 로로봇이 특정 움직임 세트에 대해 훈련될 때, 로봇은 근저에 깔린 물리적 법칙을 이해하기보다는 자신이 본 정확한 패턴을 모방하는 데 너무 특화되는 경면이 있습니다. 이를 조사하기 위해 연구팀은 로봇을 가르치는 다양한 방식이 로봇의 내부 이해에 어떤 영향을 미치는지 살펴보았습니다. 그들은 만약 로봇이 단 하나의 특정 방법만을 사용하여 동작을 예측하도록 훈련된다면, 그 방식에 "갇히게(locked in)" 된다는 것을 발견했습니다. 이는 마치 수학 문제를 풀 때 오직 하나의 특정 공식만을 배운 학생와 같습니다. 만약 시험에서 문제 형식이 바뀌면, 그 학생은 개념 자체를 배우지 못했기 때문에 문제를 풀지 못하게 됩니다. 연구진은 로봇의 두뇌가 훈련 중에 단일하고 경직된 구조에 지식을 맞추도록 강요받을 때 이러한 "갇힘 현상"이 발생한다는 것을 발견했습니다.
이를 해결하기 위해 연구팀은 로봇의 두뇌를 유연하게 유지하는 새로운 훈련 레시피를 개발했습니다. 그들은 먼저 방대한 양의 인터넷 이미지와 텍스트로 이미 훈련되어 세상에 대한 폭넓은 이해를 갖춘 강력한 시각-언어 모델(이미 학습된 형태의 인공지능)로 시작했습니다. 로봇 훈련이 이러한 폭넓은 지식을 덮어쓰지 않도록, 기본적인 시각 인식을 담당하는 두뇌의 하위 계층들을 보호했습니다. 그런 다음 연구팀은 로봇이 세 가지 서로 다른 수학적 방법을 동시에 사용하여 동일한 물리적 움직임을 예측하도록 요구하는 독특한 훈련 기술을 도입했습니다. 로봇이 세 가지 방법을 동시에 만족시키도록 강제함으로써, 연구진은 로봇이 단 하나의 방식에만 특화되는 것을 방지했습니다. 이 접근 방식은 로봇이 동작을 계산하는 단일한 방식에 얽매인 좁은 기술이 아니라, 보편적인 동작의 이해를 학습하도록 보장했습니다.
나아가, 연구팀은 서로 다른 로봇 신체의 문제도 다루었습니다. 두 팔이 있는 로봇은 한 팔이 있는 로봇과 다르게 움직이며, 그리퍼(gripper)가 있는 로봇은 손이 있는 로봇과 다르게 움직입니다. 기존 방식들은 이러한 차이를 별개의 문제로 취급하여 각 로봇 유형에 맞는 고유한 두뇌를 훈련시켰습니다. 대신 VLAct 팀은 움직임을 위한 공유된 언어를 만들었습니다. 그들은 한 기계에서 그리퍼를 여는 것이 물리적 메커니즘은 다를지라도 다른 기계에서 그리퍼를 여는 것과 동일한 개념임을 로봇에게 가르쳤습니다. 그들은 손을 펴고 닫는 것과 같이 물리적으로 유사한 동작 부분은 정렬시키되, 각 로봇 신체의 고유한 부분은 분리함으로써 이를 달성했습니다. 이를 통해 로봇은 자신이 배운 내용을 한 번도 접해보지 못한 완전히 다른 유형의 기계로 전이할 수 있었습니다.
이 접근 방식의 결과는 놀라웠습니다. 광범위한 작업에 대해 테스트했을 때, 새로운 시스템은 훨씬 더 큰 데이터셋으로 훈련된 기존 모델들을 포함하여 일관되게 우수한 성능을 보였습니다. 조명, 카메라 각도, 물체 배치의 변화를 테스트하는 LIBERO-Plus 시뮬레이션 벤치마크에서, 이 새로운 시스템은 82.6%의 성공률을 달ей했습니다. 이는 다른 선도적인 시스템들보다 현저히 높은 수치로, 로봇이 특정 시나리오를 암기한 것이 아니라 작업에 대한 견고한 이해를 학습했음을 증명했습니다. 두 개의 로봇 팔이 함께 작동하는 RoboTwin 2.0 벤치마크에서는 92.5%의 성공률을 기록하며, 독점 데이터와 막대한 컴퓨팅 파워에 의존하는 대규모 산업용 시스템을 능가했습니다.
이 방법의 위력을 보여주는 가장 설득력 있는 증거는 훈련 데이터에 전혀 없었던 휴머노이드 로봇을 이용한 테스트에서 나왔습니다. 연구진은 표준 로봇 팔의 데이터로 시스템을 훈련시킨 후, 다리와 몸통이 있는 휴머노이드 로봇을 제어하도록 요청했습니다. 이 기계는 훈련 데이터에 전혀 없던 것이었습니다. 해당 신체에 대해 통상적으로 필요한 데이터의 20%만을 사용했음에도 불구하고, 시스템은 해당 신체를 위해 100%의 데이터를 사용하여 훈련된 베이스라인 모델보다 더 나은 성능을 보였습니다. 이는 로봇이 단순히 훈련된 팔의 특정 움직임을 암기한 것이 아니라, 어떤 신체에도 적용될 수 있는 "움omo 하는 법"에 대한 근본적인 개념을 학습했음을 시사합니다.
연구진은 또한 실제 물리적 로봇 팔을 사용하여 블록 쌓기, 테이블 닦기, 옷 접기 등의 작업을 수행하며 시스템을 실제 환경에서 테스트했습니다. 이러한 실세계 실험에서도 시스템은 베이스라인을 지속적으로 능가하며 더 높은 안정성과 정밀도를 보여주었습니다. 시스템은 당근 대신 피망을 집는 것과 같이 이전에 본 적 없는 새로운 물체를 성공적으로 다루었으며, 콩을 퍼서 그릇에 담는 것과 같은 복잡한 다단계 작업을 단계 누락 없이 수행했습니다. 또한 소켓을 잡고 있는 동안 플러그를 뽑는 것과 같이 두 팔을 협응하여 사용하는 작업에서도 탁월한 능력을 보였는데, 이는 이전 모델들이 어려워했던 수준의 동기화를 보여준 것입니다.
이 연구가 특히 중요한 이유는, 16개의 그래픽 처리 장치(GPU)를 갖춘 적당한 양의 컴퓨팅 파워와 오픈 소스 데이터만을 사용하여 이 성과를 이루어냈다는 점에 있습니다. 이는 독점 데이터셋과 거대한 산업 규모의 컴퓨팅 자원에 의존하는 분야의 많은 상위 성능 시스템들과 대조적입니다. 연구진은 로봇이 단순히 데이터의 양을 늘리는 것이 아니라, 로봇이 세상을 내부적으로 어떻게 표상하는지에 집중함으로써 더 유능하고 적응력 있는 로봇을 구축할 수 있음을 보여주었습니다. 그들의 발견은 로봇 학습의 미래가 끝없는 데이터 스트림을 수집하는 것이 아니라, 로봇이 물리적 세계에 대한 더 깊고 유연한 이해를 구축하도록 돕는 훈련 방법을 설계하는 데 있다는 것을 시사합니다.
연구는 로봇을 가르치는 방식이 무엇을 가르치느냐만큼 중요하다는 결론을 내립니다. 사전 훈련된 두뇌의 폭넓은 지식을 보존하고, 단일한 방식이나 신체 유형에 얽매이지 않는 방식으로 동작을 학습하도록 장려함으로써, 연구자들은 예측 불가능한 실제 세계를 다룰 수 있는 훨씬 더 유능한 시스템을 만들 수 있습니다. 이 접근 방식은 대량의 새로운 데이터 없이도 새로운 작업을 빠르게 배우고 새로운 환경에 적응할 수 있는 범용 로봇을 향한 유망한 경로를 제시합니다. 이 연구 결과는 공개되어 다른 과학자들이 이 발견을 바탕으로 발전시키고, 기계가 생명체와 같은 유연성과 이해력을 가지고 움직이는 법을 가르치는 방법을 더욱 탐구할 수 있도록 개방되었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.