← 최신 논문
🤖 machine learning

Calibrated Partial Resets: Preventing Policy Collapse in Continual Reinforcement Learning

이 논문은 낮은 효용을 가진 뉴런들을 주기적이고 선택적으로 초기화 상태로 되돌림으로써, 정점의 성능을 희생하지 않으면서도 가소성을 유지하여 지속적 강화 학습에서의 정책 붕괴를 방지하는 옵티마이저인 Calibrated Partial Resets(CPR)를 소개한다.

원저자: Luc McCutcheon, Evangelos Chatzaroulas, Saber Fallah

게시일 2026-07-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Luc McCutcheon, Evangelos Chatzaroulas, Saber Fallah

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 걷기, 달리기, 또는 비디오 게임을 하는 법을 가르치고 있다고 상상해 보십시오. 당신은 단 한 번 가르치고 그것이 영원히 기억하기를 바라는 것이 아니라, 끊임없이 변화하는 세상 속에 로봇을 던져 넣습니다. 아마도 바닥이 미끄러워지거나, 게임의 규칙이 바뀌거나, 혹은 로봇이 이전 기술을 마스터한 후에 완전히 새로운 기술을 배워야 할 수도 있습니다. 이것이 바로 "연속 학습(continual learning)"의 세계입니다. 문제는 이러한 디지털 두뇌(신경망)가 더 많이, 더 오래 학습함에 따라 "정체"되는 경향이 있다는 점입니다. 어떤 부분은 전혀 작동하지 않게 되어 결코 활성화되지 않는 휴면 뉴런처럼 변하고, 다른 부분은 너무 경직되어 새로운 상황에 적응하지 못하게 됩니다. 이는 마치 교과서를 너무 잘 외운 나머지 숫자가 하나만 바뀌어도 문제를 전혀 풀지 못하는 학생과 같습니다. 만약 로봇이 이 적응 능력을 상실한다면, 갑자기 걷는 법을 잊어버리거나, 더 나아가 잘못된 결정의 혼돈스러운 루프 속에서 충돌하고 무너질 수도 있습니다. 과학자들은 로봇의 두와를 가끔 "리셋"함으로써 이 문제를 해결하려 노력해 왔지만, 기존의 방식은 로봇이 새로운 것을 배우려는 바로 그 순간에 현재의 기술마저 망가뜨려 버리는, 너무 가혹한 리셋 버튼을 누르는 것과 같았습니다.

이 논문은 이 문제를 해결하기 위해 **교정된 부분 리셋(Calibrated Partial Resets, CPR)**이라는 영리한 새로운 기술을 소개합니다. 신경망을 거대한 노동자 팀이라고 생각해보십시오. 여기서 각 노동자(뉴런)는 로봇의 의사결정 중 아주 작은 부분을 담당합니다. 시간이 흐름에 따라 일부 노동자들은 유용한 일을 하지 않게 됩니다. 그들은 "휴면 상태"가 되거나 "잠들게" 됩니다. 이들을 고치는 기존의 방법은 그 잠든 노동자들을 해고하고 처음부터 완전히 새로운 인력을 채용하는 것이었습니다. 하지만 그들을 한꺼번에 해고하는 것은 마치 바쁜 저녁 식사 시간 중에 주방 인력의 절반을 교체하는 것과 같아서, 혼란을 야기하고 음식(로봇의 성능)을 망쳐버립니다.

이 논문의 저자들은 더 부드럽고 똑똑한 접근 방식을 제안합니다. 잠든 노동자들을 완전히 해고하는 대신, CPR은 그들을 원래의 신선한 상태로 돌아가도록 부드러운 "넛지(가벼운 자극)"를 줍니다. 하지만 여기서 마법 같은 점은, 그 넛지의 크기가 해당 노동자가 얼마나 쓸모없느냐에 따라 달라진다는 것입니다. 만약 어떤 노동자가 거의 아무것도 하지 않고 있다면, 그들은 깨어나기 위해 큰 밀침을 받습니다. 반면 여전히 훌륭한 일을 하고 있는 노동자라면, 아주 작고 눈에 띄지 않는 가벼운 톡 치는 정도의 자극만을 받습니다. 이런 방식을 통해 로봇은 최고의 기술을 온전히 유지하면서도, 정체된 부분들을 천천히 새롭게 갱신할 수 있습니다.

연구진은 매우 까다로운 환경에서 이 아이디어를 테스트했습니다. 그들은 로봇이 건조한 상태에서 매우 미끄러운 상태로 계속 변하는 지형 위를 달리도록 훈련시켰는데, 이 작업은 무려 4억 단계(steps) 동안 지속되었습니다. 이 테스트에서 기존의 방식(모든 노동자를 완전히 해고하는 표준 "이진 리셋" 등)은 종종 로봇을 무너뜨리고 움직이는 법 자체를 잊게 만들었습니다. 그러나 CPR 방식은 그 과정 내내 로봇이 매끄럽게 계속 달릴 수 있도록 유지했습니다. CPR은 15가지의 서로 다른 모든 테스트 실행 전반에 걸쳐 단 한 번의 "정책 붕괴(policy collapse, 완전한 실패)"도 겪지 않은 유일한 방법이었습니다.

또한 이 논문은 이 방법이 다른 도전적인 비디오 게임 같은 환경에서도 잘 작동하며, 로봇이 이전의 것을 잊지 않고 새로운 과업을 배울 수 있도록 돕는다는 것을 보여줍니다. 저자들은 "잠든" 노동자들을 얼마나 강하게 밀어낼지 결정하는 설정값(ρ\rho)을 조절함으로써, 로봇의 안정성을 유지하는 것과 학습을 빠르게 돕는 것 사이의 균형을 맞출 수 있음을 발견했습니다. 그들은 적절한 수준의 밀침이 가장 효과적이며, 이것이 로봇이 무너지는 것을 방지하면서도 적응할 수 있게 해준다는 것을 발견했습니다.

요약하자면, 이 논문은 "전부 아니면 전무(all-or-nothing)" 식의 리셋 버튼 대신, 우리 AI의 두뇌를 위한 "디머 스위치(밝기 조절 스위치)"를 사용해야 한다고 제안합니다. 각 네트워크 부분이 얼마나 유용한지에 따라 그 부분을 얼마나 새로 고칠지 세심하게 교정함으로써, 우리는 AI 에이전트가 충돌하거나 무너지지 않고 평생 동안 계속 학습할 수 있도록 유지할 수 있습니다. 수억 단계에 걸쳐 측정된 결과는, 이 접근 방식이 진정으로 평생 동안 배우고 적응할 수 있는 로봇과 AI를 구축하는 데 있어 유망한 길임을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →