Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups
Prism-GRPO는 이진 성공 보상에 실행 품질 점수를 더하여 동일 결과 그룹을 분리함으로써 시각-언어-행동 정책 최적화를 가속화하며, 이를 통해 폐기된 롤아웃으로부터 학습 신호를 회복하고 목표 성공률에 도달하기 위한 롤아웃 수를 최대 56%까지 줄입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
보고, 언어를 이해하고, 목적을 가지고 움직일 수 있는 로봇은 더 이상 공상 과학 소설 속 이야기가 아닙니다. 이들은 시각-언어-행동(vision-language-action) 모델이라고 불리는 일종의 인공지능을 사용하여 구축되고 있습니다. 이 시스템은 로봇이 보는 것과 로봇에게 지시된 사항 사이의 가교 역할을 합니다. 로봇이 "빨간 컵을 집어 들어"라는 말을 듣고 테이블 위의 컵을 본다고 상상해 보십시오. 로 b은 컵을 잡기 위해 팔의 정밀한 움직임을 계산해야 합니다. 이러한 로봇을 더 잘하도록 가르치기 위해, 연구자들은 종종 강화 학습이라는 방법을 사용합니다. 이 과정에서 로봇은 과업을 시도하고, 성공하면 보상을 받습니다. 실패하면 아무것도 받지 못합니다. 수천 번의 시도를 거치며 로봇은 어떤 행동이 성공으로 이어지는지를 배웁니다. 하지만 이 학습 과정은 믿기 힘들 정도로 비용이 많이 듭니다. 로봇이 과업을 시도할 때마다 시간과 컴퓨팅 파워를 소비하기 때문입니다. 만약 로봇이 반복적으로 실패하거나, 성공하더라도 서투른 방식으로 성공한다면, 컴퓨터는 종-종 그 시도를 쓸모없는 데이터로 간주하여 버려버립니다. 이러한 낭비는 주요한 병목 현상이며, 현실 세계에서 안전하고 효율적으로 작동할 수 있는 로봇의 발전을 늦추는 요인이 됩니다.
한 연구팀은 한때 폐기되었던 데이터를 가치 있는 교훈으로 바꿈으로써, 이 낭비를 해결하는 새로운 접근 방식을 개발했습니다. Prism-GRPO라고 불리는 그들의 방법은 로봇이 자신의 시도를 평가하는 방식을 바꿉니다. 표준적인 방식에서는 로봇에게 단순한 합격 또는 불합격 점수가 주어집니다. 만약 일련의 시도가 모두 성공한다면, 그것들은 모두 동일한 만점을 받습니다. 만약 모두 실패한다면, 그것들은 모두 동일한 0점을 받습니다. 점수가 동일하기 때문에, 컴퓨터는 어떤 시도가 다른 시도보다 더 나았는지 구별할 수 없으며, 따라서 시간을 절약하기 위해 해당 그룹 전체를 버립니다. 연구자들은 로봇이 실패하거나 심지어 성공할 때조차도, 그 수행 방식에는 미묘한 차이가 존재한다는 사실을 깨달았습니다. 어떤 성공적인 시도는 부드럽고 완만했을 것이고, 다른 시도는 덜컥거리거나 주변의 물건을 넘어뜨렸을 수도 있습니다. 어떤 실패한 시도는 목표에 근접했을 수도 있고, 다른 시도는 목표에서 완전히 벗어났을 수도 있습니다. 이러한 미세한 차이를 무시함으로써, 기존 방식은 로봇을 더 정밀하게 가르치는 데 필요한 바로 그 정보를 버리고 있었던 것입니다.
새로운 방법은 두 번째 피드백 층을 추가함으로써 이 문제를 해결합니다. 단순히 "성공했는가?"라고 묻는 대신, 시스템은 또한 "얼마나 잘 수행했는가?"라고 묻습니다. 시스템은 사용된 힘의 정도, 움직임의 부드러움, 또는 로봇이 건드리지 말아야 할 것을 실수로 부딪혔는지 여부와 같은 물리적 실행 기반의 품질 점수를 부여합니다. 이 점수는 합격/불합격 결과와 결합됩니다. 이제, 설령 일련의 시도가 모두 성공하더라도, 시스템은 어떤 것이 더 깔끔했는지 식별하여 그에 따라 보상할 수 있습니다. 마찬가지로, 일련의 시도가 모두 실패하더라도, 시스템은 어떤 실패가 가장 덜 파괴적이었는지 식별하고 이를 학습 신호로 사용할 수 있습니다. 이 간단한 변화는 데이터의 낭비가 거의 없음을 의미합니다. 로봇은 단지 성공하거나 실패하는 드문 경우뿐만 아니라, 모든 시도로부터 배웁니다.
연구진은 이 아이디어를 두 팔로 냄비를 들어 올리는 것부터 캔을 움직여 냄비 옆에 놓는 것까지, 네 가지 서로 다른 로anic 과업에 대해 테스트했습니다. 그들은 이 새로운 방법이 표준 방식보다 최대 56% 적은 시도만으로도 로봇이 동일한 성공 수준에 도달할 수 있게 한다는 것을 발견했습니다. 이는 시간과 컴퓨팅 파워의 상당한 절감을 의미합니다. 더 중요한 것은, 이 새로운 방법으로 훈련된 로봇은 단순히 성공하는 법을 배우는 것이 아니라, 우아하게 성공하는 법을 배웠다는 점입니다. 그들은 "지름길"이나 편법을 개발할 가능성이 낮았습니다. 예를 들어, 캔을 들어 올려 냄비 옆에 놓아야 하는 한 과업에서, 기존 방식은 때때로 로봇이 캔을 들어 올리는 대신 냄비를 캔 쪽으로 밀어버리도록 가르쳤습니다. 이는 컴퓨터의 성공 체크를 만족시키기는 했지만, 인간이 요청한 동작은 아니었습니다. 새로운 방법은 거친 밀기 동작에 벌점을 부여함으로써, 로봇이 올바르고 부드러운 '들어 올려 놓기' 동작을 수행하도록 가르쳤습니다.
연구진이 시뮬레이션에서 가장 성능이 좋았던 로봇들을 실제 물리적 로봇에 적용했을 때, 결과는 유효했습니다. 새로운 방법으로 훈련된 로봇들은 더 신뢰할 수 있었으며, 시뮬레이션에서는 통했지만 실제 세계에서는 실패했던 서투른 편법을 수행할 가능성이 낮았습니다. 이 연구는 행동의 최종 결과뿐만 아니라 행동의 질에 주목함으로써, 로봇을 훨씬 더 빠르게 훈련하고 더 안전하게 만들 수 있음을 보여줍니다. 연구진은 이 접근 방식이 주요 과업을 배우는 로봇의 능력을 결코 해치지 않는다는 것을 수학적으로 증명했으며, 실험을 통해 이것이 일관되게 속도와 행동 모두를 개선한다는 것을 확인했습니다. 이 작업은 로봇이 단순히 어떤 일을 할 수 있는 능력을 갖추는 것을 넘어, 인간과 함께 일하는 데 필요한 주의력과 정밀함을 갖추도록 만드는 명확한 경로를 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.