Residual Reward Models: Leveraging Prior Knowledge for Efficient Preference-based Reinforcement Learning in Robotics
이 논문은 보상 함수를 사전 지식 구성 요소와 학습 가능한 잔차 오프셋으로 분해함으로써 로봇 공학 분야에서 선호도 기반 강화 학습의 샘플 효율성과 실세계 적용 가능성을 크게 향상시키는 방법인 잔차 보상 모델(Residual Reward Models, RRM)을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 버튼을 누르거나 섬세한 물체를 집는 것과 같은 복잡한 물리적 과업을 가르치는 것은 엔지니어들에게 매우 어려운 난제입니다. 로봇 공학의 세계에서 기계는 자신이 무엇을 잘하고 있고 무엇을 잘못하고 있는지를 알려주는 일련의 지침 세트가 필요합니다. 이 지침 세트를 '보상 함수(reward function)'라고 부릅니다. 만약 지침이 모호하거나 틀리면, 로봇은 실제로 과업을 완수하지 않고도 높은 점수를 얻을 수 있는 방법을 찾아내어 시스템을 우회하는 법을 배우거나, 무엇이 기대되는지 파악하지 못해 단순히 포기해 버릴 수도 있습니다. 전통적으로 인간은 어떤 움직임이 성공으로 이어질지 추측하며 이러한 지침을 직접 손으로 작성해야 했습니다. 이 과정은 느리고 비용이 많이 들며, 로봇이 인간이 예상하지 못한 상황에 직면했을 때 종종 실패하곤 합니다.
'선호 기반 학습(preference-based learning)'이라고 알려진 더 새로운 접근 방식은, 복잡한 규칙을 쓰는 대신 인간이 단순히 두 가지 로봇의 움직임 중 어느 것이 더 나아 보이는지를 말하게 함으로써 이 문제를 해결하려고 시도합니다. 이것이 더 간단해 보일 수는 있지만, 새로운 문제를 야기합니다. 즉, 로봇이 유용한 것을 배우기 위해서는 수천 번의 이러한 비교를 거쳐야 한다는 점입니다. 실제 환경에서 인간에게 로봇을 관찰하고 판단하도록 그토록 여러 번 요청하는 것은 비현실적이고 비용이 많이 드는 일입니다. 로봇은 너무 느리게 학습하며, 인간의 주의력이 병목 현상이 되어 이러한 기계들이 통제된 실험실 밖에서 유용하게 쓰이는 것을 가로막습니다.
토론토 대학교와 칭화 대학교의 연구진은 이 과정을 크게 가속화할 수 있는 방법을 개발했습니다. 그들은 이 접근 방식을 '잔차 보상 모델(Residual Reward Model)'이라고 부릅. 이 방법은 처음부터 시작하여 인간이 로봇에게 모든 것을 가르치도록 요구하는 대신, 로봇이 과업을 어떻게 수행해야 하는지에 대한 '최선의 추측'을 가지고 시작할 수 있게 해줍니다. 이 추측은 엔지니어가 작성한 간단한 규칙, 대규모 언어 모델(LLM)이 생성한 설명, 또는 인간이 과업을 한 번 수행하는 것을 관찰하여 학습된 보상 함수로부터 올 수 있습니다. 로봇은 이 초기 추측을 토대로 삼습니다. 인간이 "이 움직임이 저것보다 더 나았다"라고 선호도를 제공하면, 로봇은 전체 규칙 체계를 다시 쓰려고 하지 않습니다. 대신, 초기 추측을 수정하는 데 필요한 아주 작은 차이, 즉 '잔차(residual)'만을 학습합니다.
이것을 스포츠의 기본 규칙은 이미 알고 있지만 코치로부터 기술의 구체적인 뉘앙스를 지적받아야 하는 학생에 비유해 보십시오. 학생은 달리기나 던지기를 다시 배울 필요가 없으며, 단지 코치의 피드백에 맞춰 자세를 약간 조정하기만 하면 됩니다. 이와 마찬가지로, 로봇은 인간의 피드백을 사용하여 기존의 이해를 바탕으로 작고 정밀한 조정을 수행합니다. 이러한 구조는 학습 과정을 안정적으로 유지합니다. 초기 추측이 불완전하더라도, 로봇은 전체 개념을 무에서부터 발견하는 것이 아니라 오류를 수정하기만 하면 되기 때문에 여전히 학습할 수 있습니다.
연구진은 로봇 팔이 버튼을 누르거나, 물체를 쓰레기통으로 쓸어 담거나, 문을 여는 등의 과업이 포함된 다양한 시뮬레이션 환경에서 이 아이디어를 테스트했습니다. 또한 실험실 환경에서 실제 물리적 로봇인 프랑카 판다(Franka Panda) 암을 대상으로도 테스트했습니다. 모든 경우에서, '최선의 추측'과 작은 수정 사항을 결합하여 사용하는 이 방법이 인간의 선호도만으로 모든 것을 배우려고 시도하는 방법보다 훨씬 빠르게 학습되었습니다. 시뮬레이션에서 이 새로운 방법을 사용한 로봇은 훨씬 적은 인간의 판단을 요구하면서도 많은 과업에서 완벽한 성공률에 도달했습니다. 예를 들어, 로봇이 버튼을 눌러야 하는 과업에서, 처음부터 배우려고 시도하는 표준 방식은 성공률 20%에서 정체되었지만, 새로운 방법은 100%에 도달했습니다.
또한 이 연구는 이 접근 방식이 실수에 대해 얼마나 견고한지(robust)를 보여주었습니다. 만약 초기 '최선의 추측'이 약간 틀렸거나, 인간의 피드백이 가끔 노이즈가 섞이거나 일관되지 않더라도, 로봇은 여전히 올바른 행동을 학습할 수 있었습니다. 초기 추측은 안전망 역할을 하여 로봇이 쓸모없는 행동으로 빠지는 것을 방지했고, 수정 사항들은 로봇이 결국 올바른 경로를 찾도록 보장했습니다. 이는 연구진이 매우 제한된 인간의 피드백을 가지고 시스템을 테스트했을 때 특히 중요했습니다. 인간이 아주 적은 수의 판단만을 제공하도록 요청했을 때도, 잔차 방식을 사용하는 로봇은 계속해서 개선된 반면, 표준 방식은 유용한 학습을 수행하는 데 실패했습니다.
가장 중요한 점은, 연구진이 이 학습이 추가적인 튜닝 없이 컴퓨터 시뮬레이션에서 실제 물리적 로봇으로 직접 전이될 수 있음을 입증했다는 것입니다. 그들은 가상 환경에서 로봇을 훈련시킨 후, 학습된 정책을 실제 프랑카 판다 암에 적용하여 물체에 손을 뻗거나, 블록을 밀거나, 물체를 집어서 옮기는 등의 과업을 수행하게 했습니다. 잔차 방식으로 훈련된 로봇은 베이스라인 방식보다 훨씬 빠르게 실제 세계의 과업들을 수행해 냈습니다. 물체를 미는 것과 관련된 한 어려운 과업에서, 표준 방식은 광범위한 훈련 후에도 절반 정도의 성공률만을 보였으나, 새로운 방식은 동일한 훈련 시간 내에 95%의 성공률을 달 Achieved 했습니다.
이러한 결과는 사전 지식과 인간의 피드백을 결합함으로써, 로봇이 이전에 생각했던 것보다 훨씬 적은 인간의 감독만으로도 복잡한 물리적 기술을 배울 수 있음을 시사합니다. 이것은 로봇이 사전에 모든 것을 알고 있다는 뜻이 아니라, 로봇이 자신이 이미 알고 있는 것을 출발점으로 삼아 받은 모든 인간의 피드백을 최대한 활용한다는 의미입니다. 이러한 효율성은 로봇의 시간과 인간의 주의력이 제한된 자원인 실제 직업 현장에서 로봇 보조자를 실용적으로 만드는 데 핵심적인 단계가 될 수 있습니다. 이 연구는 로봇에게 (비록 거칠더라도) 출발점을 제공하는 것이, 백지 상태에서 시작하는 것보다 인간의 선호를 더 빠르고 신뢰할 수 있는 방식으로 학습하게 해준다는 것을 확인시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.