← 최신 논문
💻 computer science

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

이 논문은 반복적 정교화 과정을 학습 과정에 내재화하고 온라인 강화 학습을 지원함으로써, 기존의 다단계 확산 모델 및 단일 단계 베이스라인을 능가하는 고주파수, 저지연 성능을 달성하여 로봇 제어를 위한 네이티브 1단계 생성 정책을 가능하게 하는 2단계 프레임워크인 Drift-Based Policy Optimization (DBPO)를 소개한다.

원저자: Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

게시일 2026-09-01
📖 5 분 읽기🧠 심층 분석

원저자: Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇 팔은 전자 제품을 조립하거나 물체를 분류하는 것과 같은 섬세한 작업을 수행하며 공장과 실험실에서 점점 더 흔해지고 있습니다. 이러한 기계가 잘 작동하려면 카메라가 보는 것에 따라 관절을 정확히 어떻게 움직일지 결정할 수 있는 '두뇌'가 필요합니다. 이 의사 결정 과정은 변화하는 세상에 반응하며 순식간에, 그리고 반복적으로 일어납니다. 문제는 현실 세계가 무질서하고 예측 불가능하다는 점입니다. 탁자 위의 블록을 한 번 보는 것만으로는 로봇의 이전 움직임이나 미세한 조명 변화에 따라 여러 가지 유효한 잡기 방법이 존재할 수 있습니다. 이러한 불확실성을 처리하기 위해, 연구자들은 단 하나의 정답만을 고르는 것이 아니라 가능한 여러 가지 좋은 행동의 범위를 학습하는 시스템을 개발했습니다. 현재까지 가장 성공적인 시스템들은 마치 느리고 신중한 조각가처럼 작동하는 방법을 사용합니다. 즉, 무작위한 추측에서 시작하여 단계별로 조금씩 다듬어 나가며 동작이 완벽해 보일 때까지 정교화하는 방식입니다. 이 접근법은 고품질의 움직임을 만들어내지만, 속도가 느립니다. 로봇은 단 하나의 움직임을 만들기 위해 컴퓨터 두뇌를 여러 번 실행해야 하며, 이는 실시간 작업이나 시행착오를 통한 새로운 기술 습득을 하기에는 너무 느린 지연 시간을 발생시킵니다.

연구팀은 이제 이러한 스마트한 로봇 두뇌를 동일하게 유능하면서도 훨씬 더 빠르게 만드는 방법을 찾아냈습니다. 그들은 수십 단계의 정교화 과정을 거치는 대신, 단 한 순간에 동일한 수준의 고품질 다중 옵션 행동 계획을 생성하는 새로운 시스템을 개발했습니다. 연구진은 로봇이 훈련 중에 학습하는 방식을 바꿈으로써, 느린 정교화 과정을 통째로 건너뛰도록 가르칠 수 있음을 보여주었습니다. 실수를 저지른 후에 이를 수정하는 법을 배우는 대신, 로봇은 처음부터 정답을 맞히는 법을 배웁니다. 기존의 방식이 한 번의 움직임을 결정하기 위해 컴퓨터를 100번 실행해야 했다면, 이 새로운 시스템은 단 한 번의 실행으로 동일한 작업을 수행했습니다. 그 결과, 이 시스템은 12개의 서로 다른 로봇 작업에서 기존의 더 느린 시스템보다 더 높은 평균 성공률을 달s성했습니다. 이 속도 향상은 단순히 이론적인 개선이 아닙니다. 실제 실험실의 물리적인 듀얼 암 로봇에 적용했을 때, 이 새로운 시스템은 이전 최고의 1단계(one-step) 방식이 59%의 성공률을 보인 것에 비해 82%의 과업 완료율을 기록했으며, 실시간 제어가 가능할 만큼 빠르게 반응했습니다.

이 돌파구의 핵심은 로봇이 사례로부터 학습하는 방식에 있습니다. 고품질의 행동을 생성하는 전통적인 방법들은 종종 '반복적 디노이징(iterative denoising)'이라 불리는 과정에 의존합니다. 로봇이 컵을 집는 최선의 방법을 찾는다고 상상해 보십시오. 기존 시스템은 완전히 무작위적인 손 위치에서 시작하여 컵에 더 가깝게 조금씩 밀어 넣고, 자신의 작업을 확인하고, 다시 밀어 넣는 과정을 완벽한 위치에 도가 될 때까지 여러 번 반복합니다. 이는 로봇이 좋은 해결책을 찾도록 보장하지만 시간이 오래 걸립니다. 새로운 접근 방식인 '드리프트 기반 정책(drift-based policy)'은 이 논리를 뒤집습니다. 행동이 일어나는 실제 순간에 답을 정교화하는 대신, 로봇은 훈련되는 동안 전체 수정 과정을 내재화하도록 학습합니다. 훈련 과정에서 시스템은 성공적인 움직임의 많은 사례를 보여받으며, 무작위 추측이 어떻게 올바른 방향으로 흘러가는지(drift) 예측하도록 교육받습니다. 로봇은 이러한 수정 과정을 자신의 내부 설정으로 흡수하는 법을 배웁니다. 따라서 실제로 배치되었을 때는 느린 단계적 과정을 거칠 필요 없이, 즉시 최종적으로 수정된 행동을 출력할 수 있게 됩니다.

이 아이디어가 작동함을 증명하기 위해 연구진은 다양한 도전 과제들을 통해 시스템을 테스트했습니다. 먼저 블록 밀기, 물체 들어 올리기, 도구 조작 등을 포함한 12개의 표준 시뮬레이션 작업을 수행했습니다. 기존의 다단계 시스템은 단 하나의 움직임을 결정하기 위해 네트워크를 100번 실행해야 했습니다. 새로운 시스템은 단 한 번의 실행으로 동일한 작업을 해냈습니다. 결과적으로 이 시스템은 100배 더 빨라졌을 뿐만 아니라, 느린 방식들의 79%보다 높은 83%의 평균 성공률을 달성하며 전반적으로 더 우수함을 입증했습니다. 이는 속도가 품질의 희생을 의미하지 않음을 보여주었습니다. 로봇은 과업을 수행하는 데 있어 똑같이 뛰어났지만, 훨씬 더 효율적이었습니다.

연구진은 로봇이 평면 이미지가 아닌 점 구름(point cloud) 형태로 세상을 보는 더 복잡한 3차원 환경에서도 이 시스템이 작동할 수 있는지 확인하기 위해 테스트를 확장했습니다. 단순한 물체 조작부터 망치 사용이나 문손잡이 돌리기와 같은 어려운 숙련된 작업에 이르기까지 37가지의 서로 다른 작업을 테스트했습니다. 이 테스트에서 새로운 시스템은 속도에 특화된 기존의 선도적인 1단계 방식들을 다시 한번 능가했습니다. 이 시스템은 88.4%의 평균 성공률을 기록하며, 차세대 1단계 시스템을 상당한 격차로 앞질렀습니다. 이는 이 방법이 매우 어려운 작업에 필수적이라고 여겨졌던 느린 다단계 정교화 과정 없이도, 실제 세계의 복잡한 3D 시각을 처리할 수 있을 만큼 견고하다는 것을 보여주었습니다.

그러나 인간의 시연을 잘 모방하는 로봇이 항상 새로운 문제를 해결하거나 실수로부터 회복하는 데 능숙한 것은 아닙니다. 이를 해결하기 위해 연구진은 '온라인 강화 학습(online reinforcement learning)'을 통해 로봇이 학습할 수 있도록 하는 두 번째 단계의 프레임워크를 추가했습니다. 이는 로봇이 단순히 과거의 영상을 복사하는 것이 아니라, 환경과 상호작용하고 성공 여부에 대한 피드백을 받음으로써 성능을 개선하는 과정입니다. 여기서의 과제는 표준 학습 알고리즘이 보통 가능한 모든 행동의 확률을 계산해야 한다는 점인데, 이는 이처럼 빠른 1단계 생성기들에게는 어려운 일이었습니다. 연구팀은 로봇이 자신의 빠른 1단계 특성을 유지하면서도 경험으로부터 학습할 수 있도록 특별한 인터페이스를 만들어 이 문제를 해결했습니다. 연구진은 이 접근 방식이 로봇이 초기에는 인간의 시연 데이터로만 훈련되었던 과업들에서 성능을 효과적으로 미세 조정할 수 있게 해준다는 것을 발견했습니다.

최종 테스트는 컴퓨터 시뮬레이션을 벗어나 실제 실험실의 물리적 로봇에 시스템을 적용했습니다. 연구진은 인간과 유사한 두 팔을 가진 듀얼 암 로봇에 이 시스템을 장착하고, 블록 들어 올리기, 캔 운반하기, 두 팔 사이로 물체 옮기기 등의 과업을 수행하게 했습니다. 로봇은 카메라로부터 오는 시각 정보에 실시간으로 반응해야 했습니다. 시스템은 시각 정보를 인지한 순간부터 팔이 움직이기까지 평균 9.5밀리초의 지연 시간만 발생시켰으며, 이는 고주파 제어가 가능한 속도였습니다. 일련의 실험에서 로봇은 150번의 시도 중 123번을 성공하여 82%의 성공률을 기록했습니다. 이에 비해 이전 최고의 1단계 시스템은 150번 중 89번, 즉 59%의 성공률을 보였습니다. 발생한 실패들은 대부분 의사 결정 시스템의 결함이라기보다는 물체가 미끄러지거나 두 팔이 충돌하는 것과 같은 물리적인 문제 때문이었습니다.

이 연구는 로봇 제어에 있어 속도와 지능 사이의 트레이드오프(trade-off)가 생각만큼 고정된 것이 아님을 시사합니다. 정교화의 부담을 행동의 순간에서 학습의 시점으로 옮김으로써, 매우 유능하면서도 믿을 수 없을 정도로 빠른 로봇 컨트롤러를 만들 수 있습니다. 연구진은 로봇이 좋은 결정을 내리기 위해 단계별로 옵션을 고민하며 시간을 보낼 필요 없이, 즉각적으로 올anche한 결정을 내리도록 학습할 수 있다는 것을 보여주었습니다. 이는 로봇이 인간의 반사 신경 속도로 작동하며, 우리 세상의 복잡하고 예측 불가능한 환경에 실시간으로 학습하고 적응할 수 있는 길을 열어줍니다. 이 새로운 시스템의 코드는 다른 연구자들이 이 기초 위에서 발전시킬 수 있도록 공개되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →