← 최신 논문
💻 computer science

SmoothRL: Online Reinforcement Learning During Asynchronous Execution

SmoothRL은 실행 타임라인을 명시적으로 모델링하고 새로 실행된 액션 영역을 통해서만 그래디언트를 전파함으로써 실시간 신뢰성과 매끄러운 제어를 보장하며, 비동기 추론 루프 내에서 사전 학습된 로봇 정책의 샘플 효율적인 미세 조정을 가능하게 하는 온라인 강화 학습 프레임워크이다.

원저자: Guang Gao, Yuxuan Nong, Baifu Huang, Jianan Wang

게시일 2026-09-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Guang Gao, Yuxuan Nong, Baifu Huang, Jianan Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇은 오랫동안 생명체와 같은 유연한 우아함으로 움직이는 데 어려움을 겪어왔다. 인공지능이 기계에게 언어를 이해하고 사물을 놀라운 정확도로 인식하는 법을 가르쳐주었지만, 그 이해를 물리적 움직임으로 변환하는 것은 여전히 난해한 과제로 남아 있다. 문제는 로봇이 단순히 똑똑해야 할 뿐만 아니라, 빠르고 부드러워야 한다는 점이다. 현실 세계에서 로봇 팔은 모든 미세한 움직임 사이마다 생각을 멈추고 기다릴 수 없다. 만약 다음 단계를 계산하기 위해 멈춘다면, 동작은 끊기게 되고 작업은 실패하게 된다. 부드럽게 움직이기 위해서 로로봇은 일련의 미래 움직임을 예측하고, 다음 세트의 계산을 수행하는 동시에 이를 실행해야 한다. 이는 복잡한 타이밍 문제를 야기한다. 즉, 로봇은 방금 전 생성된 명령에 따라 움직이고 있는 동안, 컴퓨터는 이미 그다음 순간을 위한 명령을 이미 작업 중인 상태가 된다. 만약 로봇이 이러한 조건 하에서 자신의 실수를 통해 배우려고 시도한다면, 로봇이 실제로 끝내지 못한 동작이나 도중에 포기해야 했던 동작에 대해 평가를 받게 되므로 학습 과정이 종종 무너지게 된다.

Astribot의 연구진은 이 특정한 타이밍 문제를 해결하기 위해 'SmoothRL'이라 불리는 새로운 방법을 개발했다. 이들의 연구는 로봇이 생각과 움직임이 동시에 일어나는 복잡하고 중첩된 일정 속에서도 실시간으로 경험으로부터 학습할 수 있게 해준다. 연구진은 로봇이 훈련되는 방식과 실제 사용되는 방식 사이의 근본적인 불일치에 주목했다. 과거에 과학자들은 기계가 멈춰서 생각한 뒤 완벽하게 동기화된 리듬으로 움직일 것이라고 가정하며 로봇을 훈련시켰다. 하지만 현실 세계에서 움직임을 부드럽게 유지하기 위해 로봇은 미래의 움직임을 하나의 '덩어리(chunk)'로 생성하여 모터로 첫 부분을 보내고, 첫 번째 덩어리가 실행되는 동안 즉시 다음 덩어리를 계산하는 시스템을 사용한다. 이는 로봇이 더 새롭고 신선한 계획이 도착함에 따라 자신의 계획 일부를 끊임없이 폐기하는 상황을 만든다. 연구진은 로봇이 이 환경에서 효과적으로 학습하기 위해서는 버려진 계획의 부분들에 집착하는 대신, 실제로 수행한 부분에만 집중해야 한다는 점을 깨달았다.

그들 솔루션의 핵심은 로봇이 생성했지만 사용하지 않은 '유령(ghost)' 동작들을 무시하도록 가르치는 방법이다. 로봇이 향후 몇 초간의 계획을 세울 때, 그 계획을 세 가지 뚜렷한 구역으로 나눈다. 첫 번째 구역은 이전 계산 주기에 의해 이미 결정된 동작들을 포함하며, 로봇은 이제 이를 변경할 수 없다. 두 번째 구역은 다음 계산이 진행되는 동안 로봇이 실제로 수행하는 새로운 동작들을 포함한다. 세 번째 구역은 다음 계산에 의해 교체될 가능성이 높은, 아직 도달하지 못한 나머지 미래의 동작들을 포함한다. 연구진은 로봇이 실제로 실행한 두 번째 구역의 동작만을 살펴보는 훈련 시스템을 구축했다. 그들은 로봇이 실제로 만든 움직임의 결과에만 기반하여 행동을 조정하도록 가르쳤으며, 이를 통해 폐기된 계획의 부분들로부터 오는 학습 신호를 효과적으로 차단했다. 이는 로봇이 결코 일어나지 않은 가상의 미래가 아닌, 현실로부터 배우도록 보장한다.

이를 테스트하기 위해 연구진은 두 팔이 달린 이동형 로봇을 사용하여 세 가지 도전적인 물리적 과제를 설정했다. 첫 번째 과제는 물체를 바구니에 던지는 것으로, 이는 끊김 없는 연속적인 스윙을 필요로 한다. 만약 로봇이 계산 주기 사이를 전환할 때 주춤하거나 움찔한다면 던지기는 실패한다. 두 번째 과제는 매우 정밀하게 펜 캡을 씌우는 것으로, 단 몇 밀리미터의 오차 범위 내에서 두 작은 물체를 정렬해야 한다. 세 번째 과제는 아주 작은 이음새를 따라 칼날을 유도하여 판지 상자를 절개하는 것으로, 상자 자체를 자르지 않기 위해 밀리미터 단위의 정확성을 요구하는 작업이다. 세 가지 경우 모두 로봇은 우수하지만 완벽하지는 않은 사전 훈련된 뇌를 가지고 시작했다. 연구진이 이 새로운 비동기 학습 방법을 사용하여 로봇을 연습하게 했을 때, 결과는 극적이었다. 물체를 던지는 성공률은 39%에서 94%로 급증했다. 펜 캡을 씌우는 기술은 단 8%에서 83%로 상승했으며, 상자를 여는 성공률은 30%에서 90%로 개선되었다.

개선은 단순히 작업을 더 자주 완수하는 것에 그치지 않고, 로봇이 어떻게 움직이는지에 관한 것이었다. 연구진은 로봇의 움직임의 부드러움을 측정하였고, 새로운 방법이 갑작스러운 충격과 끊기는 가속도를 거의 절반 가까이 줄였다는 것을 발견했다. 이러한 부드러움은 역동적인 투척 과제에서 매우 중요했는데, 움직임에 멈춤이 발생하면 물체가 목표에 못 미치게 되기 때문이다. 또한 이 시스템은 인간의 도움을 처리할 수 있을 만큼 충분히 유연하다는 것이 증명되었다. 만약 인간 운영자가 실수를 바로잡기 위해 개입해야 한다면, 로봇은 별도의 코드로 번역할 필요 없이 그 인간의 행동을 학습 과정에 직접 흡수할 수 있다. 인간의 수정 사항은 올바른 움직임에 대한 또 다른 예시가 되어, 로봇이 자신의 시행착오와 인간의 지도로부터 동시에 배울 수 있게 한다.

연구진은 로봇의 학습이 항상 직선적이지는 않다는 것을 발견했다. 상자 열기 과제에서 로봇의 성능은 개선되기 전에 실제로 잠시 하락했는데, 이는 시스템이 올바른 경로를 찾기 전에는 처음에 더 나빠 보이는 새로운 움직임 방식을 탐색하고 있음을 시사한다. 이는 로봇이 단순히 고정된 움직임 세트를 암기하는 것이 아니라 진정으로 적응하는 법을 배우고 있음을 나타낸다. 그러나 연구진은 또한 자신들의 접근 방식에 한계가 있다는 점도 언급했다. 로봇의 학습 능력는 여전히 초기 사전 훈련된 뇌의 품질에 달려 있다. 만약 기본 로봇이 과제에 대해 근본적으로 혼란스러워한다면, 이 학습 시스템이 만드는 작은 조정만으로는 문제를 해결하기에 부족할 수 있다. 더욱이, 이 시스템은 로봇의 계산이 엄격한 시간 제한 내에 완료된다는 점에 의존한다. 만약 컴퓨터가 너무 느려지면 움직임의 타이밍이 어긋나 전체 프로세스가 불안정해질 수 있다.

궁극적으로, 이 연구는 로봇이 현실 세계에서 진정으로 유용해지기 위해서는 그들의 학습 알고리즘이 그들이 움직이는 방식인 복잡하고 중첩된 현실과 일치해야 함을 보여준다. 로봇에게 실제로 완료한 동작에만 집중하고 폐기된 동작은 무시하도록 가르침으로써, 연구진은 기계가 수행에 필요한 부드러움을 희생하지 않으면서도 복잡하고 빠른 과업을 학습할 수 있는 경로를 만들어냈다. 그 결과, 로봇은 이전에는 도달할 수 없었던 신뢰성과 유동성을 가지고 던지고, 캡을 씌우고, 자를 수 있게 되었으며, 이는 더 나은 로봇 학습의 핵심이 계획이 현실이 되는 바로 그 순간을 이해하는 데 있음을 입증한다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →