Reinforcement Learning for Real-Time Vision-Language-Action Policies
이 논문은 추론 지연에도 불구하고 대규모 시각-언어-행동 모델이 실제 세계의 역학에 샘플 효율적이고 고성능으로 적응할 수 있도록, 느리고 표현력이 풍부한 행동 생성과 빠르고 반응적인 행동 편집을 분리하는 강화 학습 프레임워크인 Real-Time EXPO-FT를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇은 오랫동안 생명체와 같은 유연함으로 움직이는 데 어려움을 겪어 왔습니다. 로봇은 공장에서 정해진 일련의 지시를 따르도록 프로그래밍될 수는 있지만, 현실 세계는 무질서하고 예측 불가능하며 빠르게 변화합니다. 이를 해결하기 위해 연구자들은 시각-언어-행동 모델(vision-language-action model)로 알려진 일종의 인공지능에 주목했습니다. 이들은 방대한 양의 데이터로 학습된 거대한 컴퓨터 프로그램으로, 카메라를 통해 보는 것을 이해하고, 텍텍스트 명령을 읽고, 로봇 팔을 어떻게 움직일지 결정할 수 있게 해줍니다. 이 모델들은 세상이 어떻게 돌아가는지에 대한 수많은 사례를 목격했기 때문에 강력하며, 마치 방대한 경험의 도서관처럼 작동합니다. 그러나 중요한 함정이 있습니다. 이 모델들은 매우 크고 복잡하기 때문에 생각하는 데 눈에 띄는 시간이 걸린다는 점입니다. 컴퓨터가 이미지를 처리하고 움직임을 결정하는 그 짧은 찰나의 순간에, 물리적 세계는 이미 변해 버립니다. 만약 로봇이 공을 잡거나 물체의 균형을 잡으려 한다면, 결정을 내리는 데 사용한 정보는 실제로 움직일 때쯤에는 이미 낡은 정보가 되어 있어 종종 동작의 실패를 초래합니다.
스탠퍼드 대학교의 연구팀은 이러한 거대 모델이 느리게 생각하더라도 실시간으로 행동할 수 있도록 가르치는 새로운 방법을 개발했습니다. 'Real-Time EXPO-FT'라고 불리는 이들의 접근 방식은 로봇의 의사결정을 두 개의 뚜렷한 부분으로 나눔으로써 지연 문제를 해결합니다. 거대한 모델이 모든 미세한 순간의 조정을 강제로 수행하게 하는 대신, 모델이 일반적인 경로를 계획하는 중대한 작업을 수행하도록 하고, 훨씬 작고 빠른 컴퓨터 프로그램이 즉각적인 수정을 담당하게 합니다. 오케스트라를 지휘하는 지휘자를 상상해 보십시오. 지휘자는 전체적인 템포와 멜로디를 설정하지만, 개별 연주자들은 박자를 맞추기 위해 즉각적으로 연주를 조정해야 합니다. 이 시스템에서 거대 모델은 지휘자 역할을 하여, 잠시 전 보았던 것을 바탕으로 움직임의 순서를 제안합니다. 그런 다음, 가벼운 보조 프로그램이 현재 세계의 상태를 관찰하며 제안된 움직임에 아주 빠르고 미세한 수정을 가하여, 로봇이 움직여야 하는 바로 그 순간에도 여전히 올바른 동작이 되도록 보장합니다. 이를 통해 로봇은 거대 모델의 느린 사고 속도에 발목 잡히지 않고도 그 깊은 지식을 활용할 수 있습니다.
연구진은 이 방법을 두 가지 매우 다른 환경, 즉 물리 법칙이 적용되는 시뮬레이션 세계와 실제 물리적 세계에서 테스트했습니다. 시뮬레이션에서 로봇은 접시 위의 공 균형 잡기, 수비수를 피하며 축구공 차기, 움직이는 물체 잡기 등 10가지의 역동적인 과제에 도전했습니다. 그들은 이 새로운 방식을 지연 문제를 처리하려고 시도했던 여러 기존 기술들과 비교했습니다. 결과는 명확했습니다. 새로운 접근 방식은 로봇이 거의 모든 시도에서 성공하게 하여, 지연 문제를 겪지 않는 기술들을 포함한 다른 모든 방식보다 뛰어난 성능을 보여주었습니다. 이는 시스템에 스스로의 느림을 고려하도록 명시적으로 가르침으로써, 이론적으로는 더 빠르지만 적응력이 떨어지는 시스템보다 로봇을 더 신뢰할 수 있게 만들 수 있다는 중요한 발견이었습니다.
이 방법이 실제 세계에서도 작동함을 증명하기 위해, 연구팀은 로봇을 실험실 환경으로 옮겨 지속적이고 빠른 반응이 필요한 네 가지 까다로운 과제를 부여했습니다. 이 과제에는 회전하는 접시 위에서 탁구공의 균형 잡기, 회전하는 표면에서 블록 집어 올리기, 다른 로봇 팔이 전달하는 물체 잡기, 그리고 수비수가 움직이는 동안 골대에 공을 차 넣기가 포함되었습니다. 연구진은 로봇이 환경과 상호작용하는 시간을 단 10분으로 제한하여, 끝없는 연습 없이도 시스템이 빠르게 학습할 수 있도록 했습니다. 이 새로운 실시간 학습 프레임워크를 적용하기 전, 이 과제들에 대한 로봇의 성공률은 평균 약 42%로 상당히 낮았습니다. 하지만 새로운 프레임워크를 사용한 후, 성공률은 97%로 급증했습니다. 로봇은 학습 과정 중 인간의 개입 없이도 물체의 혼란스러운 움직임과 과제의 시간적 제약에 적응하는 법을 배웠습니다.
연구는 또한 이 시스템이 서로 다른 조건 하에서 얼마나 잘 버티는지 탐구했습니다. 연구진이 로봇의 사고 과정에서 발생하는 지연 시간을 인위적으로 늘렸을 때, 새로운 방식은 높은 수준의 성능을 유지한 반면 다른 방식들은 실패했습니다. 마찬가지로, 움직이는 물체의 속도가 빨라졌을 때도 이 프레 framework를 사용하는 로봇은 계속해서 성공했지만, 다른 접근 방식들은 따라잡기에 어려움을 겪었습니다. 이는 이 시스템이 특정 속도나 지연에만 국한되지 않고, 역동적인 환경의 예측 불가능한 특성을 다룰 수 있을 만큼 견고하다는 것을 입증합니다. 연구진은 이 시스템이 매우 효과적이긴 하지만, 여전히 과제가 끝난 후 로봇을 재설정하기 위해 인간의 손길이 필요하며, 각 과제에 대해 성공을 정의하는 특정한 방식이 필요하다고 언급했습니다. 그러나 핵심적인 성과는 거대하고 강력한 AI 모델을 실시간으로 작동하게 만들어, 인공지능의 느리고 사려 깊은 계획과 물리적 세계의 빠르고 반응적인 요구 사이의 간극을 메울 수 있음을 보여준 데 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.