← 최신 논문
🤖 machine learning

COOPO: Cyclic Offline-Online Policy Optimization Algorithm

COOPO는 분포 변화와 파국적 망각을 완화하기 위해 KL 정규화 오프라인 학습과 온라인 미세 조정을 교차하여 수행하는 일반화된 하이브리드 강화 학습 프레임워크로, 이를 통해 최첨단 방법론에 비해 D4RL 벤치마크에서 더 뛰어난 샘플 효율성과 성능을 달성합니다.

원저자: Qisai Liu, Zhanhong Jiang, Joshua Russell Waite, Aditya Balu, Cody Fleming, Soumik Sarkar

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Qisai Liu, Zhanhong Jiang, Joshua Russell Waite, Aditya Balu, Cody Fleming, Soumik Sarkar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 완벽하게 걷는 법을 가르치려 한다고 상상해 보세요. 이를 위한 두 가지 주요 방법이 있지만, 둘 다 큰 단점이 있습니다.

두 가지 문제적인 접근법

  1. 순수 온라인 방식 (시행착오): 로봇이 실제 세상에서 돌아다니며 넘어지고, 일어나고, 다시 시도하는 방식으로 학습하게 합니다.
    • 문제점: 이는 영원히 걸립니다. 로봇이 올바른 방법을 배우기 위해 수백만 번 넘어져야 할지도 모릅니다. 마치 자전거 타는 법을 배우기 위해 pavement(아스팔트) 에 몸을 던져서 해결책을 찾을 때까지 기다리는 것과 같습니다. 위험하고 매우 느립니다.
  2. 순수 오프라인 방식 (교과서 공부): 로봇에게 전문가들의 걷기 동영상이 담긴 거대한 비디오 라이브러리를 제공하고, 오직 그 비디오들만으로 학습하도록 합니다. 로봇은 실제 세상을 한 번도 경험하지 않습니다.
    • 문제점: 로봇은 이론의 전문가가 되지만, 실전에서는 실패합니다. 드디어 실제 세상에서 걷기를 시도할 때, 실제 세상이 비디오와 약간 다르기 때문에 혼란을 겪습니다. 배운 것을 잊어버리거나, 비디오에서는 잘 보이지만 실제로는 바로 넘어지게 만드는 행동을 시도합니다.

과거의 하이브리드 시도

과학자들은 이를 결합해 보았습니다. "먼저 비디오를 공부한 다음, 나가서 실습하자."

  • 단점: 로봇이 실제 세상에서 실습을 시작하자마자 흥분하여 새로운 것을 시도하고, 실수로 비디오에서 공부했던 모든 것을 '잊어버리게' 됩니다. 이를 **파괴적 망각 (catastrophic forgetting)**이라고 합니다. 수학 시험을 준비하다가 파티에 갔다가, 시험을 볼 때쯤에는 더하는 법을 잊어버린 것과 같습니다.

새로운 해결책: COOPO

이 논문의 저자들은 COOPO(Cyclic Offline-Online Policy Optimization, 순환형 오프라인 - 온라인 정책 최적화)를 소개합니다. 이를 직선이 아닌 루프로 생각하세요.

간단한 비유를 들어 COOPO 가 어떻게 작동하는지 살펴보겠습니다.

마라톤 훈련을 한다고 상상해 보세요.

  • 오프라인 단계 (도서관): 지도를 공부하고 엘리트 러너들의 동영상을 보는 시간을 보냅니다. 경로를 완벽하게 외우고 올바른 자세를 익힙니다.
  • 온라인 단계 (트랙): 나가서 몇 바퀴 달립니다. 바람, 지형, 그리고 자신의 근육을 느껴봅니다.
  • 순환의 마법: 기존 방법에서는 한 번 공부하고 한 달 동안 달린 뒤, 지도를 잊어버렸다는 사실을 깨닫게 됩니다.
    • COOPO 는 말합니다: "멈춰! 도서관으로 돌아가라."
    • 조금 달린 뒤, 기억을 다시 고정하기 위해 비디오로 돌아갑니다. 확인합니다. "전문가 자세에서 너무 멀어졌나?" 만약 그렇다면, 비디오가 안전하고 검증된 경로로 부드럽게 다시 끌어당깁니다.
    • 그다음 다시 트랙으로 돌아가 조금 더 달립니다.

왜 이것이 특별한가요?

  1. 이탈을 방지합니다: 로봇 (또는 러너) 이 실제 세상에서 이상하거나 위험한 방향으로 가기 시작할 때마다, 시스템이 안전하고 전문가적인 데이터에 대한 '현실 점검'을 강제로 수행합니다. 마치 "안전한 경로에서 벗어났습니다. 메인 도로로 되돌아가세요"라고 끊임없이 상기시키는 GPS 와 같습니다.
  2. 시간을 절약합니다: 로봇이 '교과서'(오프라인 데이터) 를 계속 다시 읽기 때문에, 배우기 위해 수백만 번 넘어질 필요가 없습니다. 기존 데이터를 반복적으로 재사용하여 학습 과정을 훨씬 빠르게 만듭니다.
  3. 안전합니다: 실제 세상 (자율주행차나 공장 로봇 등) 에서는 로봇이 무작위로 '실험'하다가 추락하는 것을 감당할 수 없습니다. COOPO 는 로봇이 개선하는 법을 배우면서도 안전하고 검증된 행동에 가깝게 머무르도록 보장합니다.

결과

이 논문은 로봇 (치타, 호퍼, 워커 등) 의 컴퓨터 시뮬레이션에서 이를 테스트했습니다.

  • 성능: COOPO 는 다른 방법들보다 더 잘, 더 빠르게 걷는 법을 배웠습니다.
  • 효율성: 표준 방법들에 비해 높은 수준의 기술을 달성하는 데 필요한 '실제 세상' 시도 (상호작용) 횟수가 훨씬 적었습니다.
  • 안정성: 배운 것을 잊지 않았습니다. 달리고 공부하는 많은 사이클을 거친 후에도 원래 전문가 데이터에서 얻은 핵심 지식을 유지했습니다.

한 줄 요약

COOPO 는 "전문가에게 배우고, 시도해 보고, 다시 돌아와 전문가에게 재학습하고, 다시 시도해 보라"고 말하는 훈련 루프입니다. 이 지속적인 순환은 학습자가 기본을 잊거나 제멋대로 되는 것을 방지하여, 기계에게 실제 세상에서 행동하는 법을 가르치는 훨씬 더 안전하고 빠른 방법이 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →