← 최신 논문
💻 computer science

SingularClip: Preventing Spectral Collapse to Maintain Plasticity in Continual and Reinforcement Learning

이 논문은 비정상적(nonstationary) 태스크를 수행하는 신경망에서 스펙트럼 붕괴(spectral collapse)를 방지하고 가소성(plasticity)을 유지하기 위해 가중치 행렬의 특이값(singular values)을 주기적으로 클리핑하는 방법인 SingularClip을 소개하며, 이를 통해 지속적 지도 학습(continual supervised learning)과 심층 강화 학습(deep reinforcement learning) 모두에서 우수한 성능을 입증한다.

원저자: Tyler Kastner, Nimrod De La Vega, Amir-massoud Farahmand

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tyler Kastner, Nimrod De La Vega, Amir-massoud Farahmand

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

딥러닝은 기계에게 얼굴을 인식하고, 언어를 번역하며, 복잡한 게임을 수행하는 능력을 부여했지만, 이 시스템들은 주변 세계가 변할 때 어려움을 겪습니다. 정적인 교실에서 학생은 교과서를 암기하여 영원히 유용하게 남을 수 있습니다. 하지만 현실 세계에서는 규칙이 끊임없이 변합니다. 자율주행 자동차는 새로운 교통 패턴에 적응해야 하며, 로봇은 걷는 법을 잊지 않으면서 새로운 과업을 배워야 합니다. 이러한 시스템의 수학적 두뇌인 신경망이 오래된 지식 위에 새로운 것을 배우려고 할 때, 그들은 종종 경직됩니다. 그들은 새로운 정보에 맞춰 구부러지고 적응하는 능력을 상실하는데, 과학자들은 이를 '가소성 상실(loss of plasticity)'이라고 부릅니다. 이러한 유연성이 없으면 기계는 얼어붙어 변화하는 환경에 대한 이해를 업데이트할 수 없게 됩니다.

연구자들은 네트워크가 학습함에 따라 내부 계산 과정에서 무언가 잘못된다는 사실을 오래전부터 알고 있었습니다. 그들은 정보가 흐르는 방식을 결정하는 숫자들인 네트워크의 가중치(weights)가 좋지 않은 형태에 갇히고 있다고 의심해 왔습니다. 토론토 대학교와 폴리테크니크 몬트리올의 과학자 팀은 이제 그 나쁜 형태가 정확히 무엇인지, 그리고 어떻게 해결할 수 있는지를 밝혀냈습니다. 그들은 네트워크가 학습함에 따라 내부 구조가 점점 더 불균형해지며, 어떤 방향으로는 길게 늘어나고 다른 방향으로는 붕괴한다는 사실을 발견했습니다. 이러한 왜곡은 네트워크가 새로운 과업을 배우는 것을 매우 어렵게 만듭니다. 이를 해결하기 위해, 그들은 이러한 내부 구조를 재형성하여 기계가 유연성을 유지하고 계속 학습할 수 있게 해주는 간단하고 주기적인 절차를 도입했습니다.

문제의 핵심은 네트워크가 지식을 조직하는 방식에 있습니다. 네트워크를 언덕과 계곡이 가득한 광활한 풍경이라고 상상해 보십시오. 학습이 진행됨에 따라 이 풍경은 변화합니다. 연구자들은 시간이 흐름에 따라 이 풍경이 길고 가는 능선(ridge) 형태로 늘어나는 경향이 있다는 것을 발견했습니다. 대부분의 학습은 이 단일한 능선을 따라 일어나며, 나머지 풍경은 깊고 좁은 협곡으로 평평해집니다. 기술적인 용어로, 연구자들은 이를 '성장하는 이방성(growing anisotropy)'이라고 부릅니다. 이는 네트워크가 특정 방향의 변화에는 매우 민데 민감하지만, 다른 방향의 변화에는 완전히 귀머거리처럼 반응하게 된다는 것을 의미합니다. 새로운 과업이 다른 방향에서의 학습을 요구할 때, 네트워크의 내부 구조가 단일한 지배적 능선으로 붕괴되었기 때문에 네트워크는 반응할 수 없습니다. 새로운 과업을 배우는 데 필요한 신호가 그 평평한 협곡 속에서 길을 잃는 것입니다.

이것이 경직성의 원인임을 증명하기 위해, 연구자들은 인위적으로 이러한 늘어진 형태를 가진 네트워크를 만들어 실험을 진행했습니다. 그들은 이러한 왜곡된 네트워크가 균형 잡힌 네트워크에 비해 학습하는 데 훨씬 더 오랜 시간이 걸리거나 아예 학습에 실패한다는 것을 발견했습니다. 또한 이미지의 무작위 패턴을 인식하는 것부터 가상 로봇을 제어하는 법을 배우는 것에 이르기까지, 실제 과업을 수행하도록 훈련된 네트워크에서도 동일한 늘어남 현상이 자연스럽게 발생하는 것을 관찰했습니다. 늘어남은 단순한 부수 효과가 아니라, 속도 저하의 직접적인 원인이었습니다. 네트워크가 더 많이 늘어날수록, 새로운 정보가 그 안을 통과하기가 더 어려워졌습니다.

연구팀은 '싱귤러클립(SingularClip)'이라 부르는 해결책을 개발했습니다. 이 이름은 문제를 해결하기 위해 사용하는 수학적 연산에서 유래되었습니다. 네트워크가 통제 불능 상태로 늘어나도록 두는 대신, 그들은 주기적으로 훈련 과정을 멈추고 네트워크의 내부 구조의 형태를 점검합니다. 만약 구조가 너무 늘어났다면, 그들은 극단적인 값들을 클리핑(clip, 잘라내기)하여 형태가 더 균형 잡히고 둥근 형태로 돌아오도록 강제합니다. 이것은 기계가 지금까지 배운 모든 것을 지워버리는 완전한 리셋이 아닙니다. 대신, 이는 네트워크가 수집한 정보를 보존하면서도 너무 경직되지 않도록 하는 부드러운 교정입니다. 이는 마치 식물이 너무 높고 가늘게 자랄 때, 식물이 다시 새로운 방향으로 가지를 뻗을 수 있도록 과도한 성장을 잘라내는 정원사의 전정 작업과 같습니다.

이 접근 방식의 결과는 놀라웠습니다. 기계가 일련의 서로 다른 과업을 학습해야 하는 테스트에서, 이 클리핑 기법을 적용한 네트워크는 다른 일반적인 기술들을 사용했을 때보다 훨씬 더 빠르고 정확하게 학습했습니다. 이전의 일부 방법들은 한 방향으로 네트워크가 얼마나 커질 수 있는지만 제한함으로써 문제를 해결하려 했으나, 연구자들은 네트워크가 다른 방향으로 붕괴할 수 있기 때문에 이것이 불충분하다는 것을 보여주었습니다. 다른 방법들은 네트워크를 완전히 리셋하는 방식을 포함했는데, 이는 새로운 것을 배우는 데는 효과적이었지만 기계가 이전에 배웠던 모든 것을 잊게 만들었습니다. 새로운 방법은 그 중간 지점에 위치했습니다. 즉, 기계가 과거의 지식을 지우지 않으면서도 새로운 과업을 배울 수 있을 만큼 충분히 유연하게 유지했습니다.

시행착오를 통해 학습하는 에이전트들이 존재하는 강화 학습의 세계에서, 그 차이는 더욱 극적이었습니다. 주기적인 리셋이 있는 어려운 환경에서, 표준 에이전트는 가혹한 리셋으로부터 회복하지 못해 아무것도 배우지 못했습니다. 그러나 새로운 클리핑 기법을 사용한 에이전트는 이전 지식을 충분히 보유하고 있었기에 결국 성공했으며, 리셋을 전혀 하지 않은 표준 에이전트보다도 뛰어난 성능을 보였습니다. 이는 평생 학습(lifelong learning)의 핵심이 단순히 새로운 것을 배우는 것뿐만 아니라, 그것들을 배울 수 있도록 적절한 내부 형태를 유지하는 데 있음을 시사합니다. 네트워크의 내부 기하학적 구조를 균형 있게 유지함으로써, 기계는 미래를 향해 열려 있으며, 다음에 올 어떤 변화에도 적응할 준비를 갖추게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →