WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation
이 논문은 시간 왜곡된 성공적인 시연으로부터 조밀한 상대적 진전 신호를 생성하여, 혼합된 품질의 데이터로부터 액션 청크를 필터링하고 재가중함으로써 긴 호라이즌 작업에서 로봇 성능을 크게 향상시키는 행동 복제 방법인 WARP-BC를 가능하게 하는 완전 자기 지도 학습 보상 모델인 WARP-RM을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇은 인간을 관찰하며 배우는 데 오랫동안 어려움을 겪어 왔습니다. 사람은 과업을 한 번 쓱 보고도 움직임의 흐름을 이해할 수 있지만, 비디오 데이터로 학습하는 로봇은 종종 성공과 함께 실수까지 함께 배워버립니다. 만약 인간 작업자가 생각하느라 잠시 멈추거나, 물건을 더듬거리거나, 성공하기 전에 서투른 움켜쥐기를 시도한다면, 로봇은 이러한 망설임을 올바른 경로의 일부로 인식합니다. 이는 빨래를 접거나 물체를 조립하는 것과 같이 길고 복잡한 과업에서 특히 문제가 되는데, 단 한 번의 혼란스러운 순간이 전체 과정을 망칠 수 있기 때문입니다. 수년 동안 연구자들은 로봇에게 이러한 나쁜 순간들을 무시하도록 가르치려 노력해 왔지만, 대부분의 방법은 정확히 어디서 실수가 발생했는지 표시하기 위해 값비싼 인간의 라벨링을 필요로 하거나, 오류가 포함된 비디오 클립 전체를 버림으로써 불완전한 시연 속에 숨겨진 가치 있는 회복 동작들까지 버리게 만들었습니다.
캘리포니아 대학교 버클리 캠퍼스와 스탠퍼드 대학교의 연구진은 인간의 라벨 없이도 로봇이 생산적인 움직임과 낭비되는 시간을 구분하도록 가르치는 새로운 방법을 개발했습니다. 그들은 WARP(Warp-Augmented Relative Progress, 왜곡 증강 상대적 진전)라고 불리는 시스템을 만들었습니다. 연구진은 인간이 몇 시간 동안 비디오를 보며 좋고 나쁜 순간에 상자를 그리도록 요구하는 대신, 비디오를 다양한 속도로 재생하거나 심지어 역재생함으로써 컴퓨터가 속도와 방향에 따른 진전을 이해하도록 가르쳤습니다. 로봇에게 '전방' 진행이 '후방' 또는 정체된 움직임과 비교했을 때 어떤 모습인지를 인식하도록 훈련시킴으로써, 이 시스템은 비디오의 모든 프레임에 점수를 부여하는 법을 배웠습니다. 이 점수는 로봇에게 과업이 얼마나 빠르게 앞으로 나아가고 있는지, 멈춰 있는지, 아니면 실제로 뒤로 가고 있는지를 알려줍니다.
연구진은 이 아이디어를 두 팔을 가진 물리적 로봇에 테스트했는데, 뭉쳐져 있는 티셔츠를 빈 통에서 꺼내 접는 과업을 맡겼습니다. 그들은 다양한 품질의 훈련 데이터셋을 만들었습니다. 가장 좋은 데이터셋에서는 인간의 시연이 빠르고 효율적이었습니다. 가장 나쁜 데이터셋에서는 인간의 시연이 멈춤, 재시도, 그리고 긴 더듬거림으로 가득했습니다. 이 지저지고 낮은 품질의 비디오로 표준 로봇 학습 시스템을 훈련시켰을 때, 로봇은 거의 완전히 실패했습니다. 로봇은 아주 작은, 쓸모없는 조정의 루프에 빠져 과업을 완수하지 못했습니다. 그러나 새로운 WARP 시스템을 사용하여 데이터를 필터링했을 때 결과는 극적으로 변했습니다. 시스템은 비디오의 느리고 망설이는 부분을 자동으로 식별하여 그 중요도를 낮추는 한편, 빠르고 결단력 있는 순간들은 유지했습니다. 표준 로봇이 20번 중 20번 모두 실패했던 지저진 데이터셋에서, WARP로 훈련된 로봇은 20번 중 19번 성공했습니다. 또한 동일한 저품질 데이터를 주었을 때, WARP 훈련 로봇은 표준 로봇보다 티셔츠를 거의 18배 더 빠르게 접었습니다.
연구진은 여기서 멈추지 않았습니다. 그들은 또한 로봇이 플라스틱 병을 빈 통에 넣어야 하는 과업에 이 방법을 테스트했습니다. 실제 환경에서 새로운 시스템은 80개의 병 중 74개를 배치한 반면, 표준 시스템은 59개만을 해냈습니다. 새로운 로봇은 병을 더 빠르고 일관되게 배치했습니다. 이러한 결과가 특정 로봇 하드웨어의 우연한 결과가 아님을 확신하기 위해, 연구진은 512개의 서로 다른 시나리오를 포함한 대규모 시뮬레이션을 실행했습니다. 이 가상 테스트에서 새로운 시스템은 시간당 290개의 병을 배치하여, 237개를 배치한 표준 시스템을 크게 앞질렀습니다. 데이터를 정제하려고 시도하는 다른 고급 방법들과 비교했을 때도, 이 접근 방식은 지속적으로 가장 빠르고 신뢰할 수 있는 결과를 만들어냈습니다.
이 방식이 작동하는 핵심 이유는 시스템이 진전을 인식하는 방식에 있습니다. 연구진은 컴퓨터에게 '접힌 셔츠'가 어떻게 생겼는지 말해주지 않았습니다. 대신, 그들은 셔츠를 접는 인간의 성공적인 비디오를 가져와서 무작위 속도로 재생했는데, 때로는 아주 느리게 재생하기도 하고 때로는 빠르게 재생하기도 했습니다. 또한 일부 비디오는 역재생하기도 했습니다. 그러고 나서 컴퓨터에게 클립의 시작부터 현재 시점 사이에 얼마나 많은 시간이 흘렀는지 추측하도록 했습니다. 이 왜곡되고 뒤섞인 버전의 비디오를 통해 경과된 시간을 예측하는 법을 배움으로써, 컴퓨터는 과업의 자연스러운 리듬을 이해하게 되었습니다. 컴퓨터는 빠르고 매끄러운 움직임은 보통 과업이 앞으로 나아가고 있음을 의미하며, 느리고 끊기는 움직임이나 뒤로 가는 움직임은 과업이 정체되었거나 실패하고 있음을 의미한다는 것을 배웠습니다. 이를 통해 시스템은 비디오의 모든 프레임에 대해 연속적인 점수를 생성하여, 로봇에게 어떤 부분의 시연에 주의를 기울이고 어떤 부분을 무시해야 하는지 정확히 알려줄 수 있었습니다.
연구진은 단순히 나쁜 비디오를 버리는 것만으로는 충분하지 않다는 것을 발견했습니다. 가장 효과적인 전략은 지저진 비디오를 유지하되 로봇이 그것으로부터 배우는 방식을 바꾸는 것이었습니다. 시스템은 비디오에서 한 덩어리의 동작을 가져와 그 덩어리의 끝부분에서의 진전 점수를 확인합니다. 만약 점수가 높다면, 즉 과업이 빠르게 앞으로 나아가고 있다면, 로봇은 그 덩어리로부터 온전한 강도로 학습합니다. 만약 점수가 낮거나 음수라면, 즉 로봇이 망설이거나 뒤로 움직이고 있다면, 시스템은 그 덩어리를 통째로 무시하거나 매우 가볍게 학습합니다. 이 접근 방식은 로봇이 셔츠를 떨어뜨렸다가 다시 집어 드는 과정에서의 '회복 동작'은 배우되, 그 낙하를 유발했던 '당황함과 망설임'은 배우지 않도록 해주었습니다.
이 연구는 로봇이 복잡한 기술을 배우기 위해 완벽한 인간의 시연을 필요로 하지 않는다는 것을 시사합니다. 로봇은 데이터 내의 시간의 흐름과 진전을 이해할 수 있는 방법이 있다면, 지저지고 현실적인 데이터로부터도 배울 수 있습니다. 연구진은 이 방법이 비디오를 역재생하는 특정 유형의 데이터 증강에 의존하며, 이는 실제 로봇이 수행하기에는 물리적으로 불가능한 일이라고 언급했습니다. 그러나 시스템은 이러한 인위적인 훈련으로부터 유용한 패턴을 여전히 학습했습니다. 이 방법이 모든 가능한 과업에 작동하는 마법 같은 해결책은 아닐지라도, 인간의 오류라는 노이즈를 무시하고 성공적인 행동이라는 신호에 집중하도록 가르치는 강력한 도구를 제공합니다. 연구진은 다른 연구자들이 자신의 로봇과 과업에 이 아이디어를 테스트할 수 있도록 코드와 데이터를 공개했으며, 이는 불완전한 일상의 세계로부터 빠르게 배울 수 있는 차세대 로봇으로 이어질 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.