SPARCL: Spectral Partitioned Analytic Continual Learning
SPARCL은 자기상관 연산자를 고정된 고에너지 코어와 업데이트 가능한 잔차 블록으로 분할함으로써 분석적 지속 학습에서 망각을 유발하는 스펙트럼 간섭 문제를 해결하며, 이를 통해 기존 클래스 로짓에 대한 증명 가능한 불변성을 갖는 폐쇄형 해를 제공하는 동시에 여러 벤치마크에서 최첨단 성능을 달성합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
고대사부터 현대 물리학에 이르기까지 방대한 지식의 도서관을 마스터하는 데 수년을 보낸 한 학생을 상상해 보십시오. 이제 그 학생에게 이전의 교과서를 펼치거나 예전 노트를 복습하는 것이 절대 허용되지 않은 채, 매일 새로운 주제를 배우라고 요청한다고 상상해 보십시오. 인공지로의 세계에서 이것은 '지속 학습(continual learning)'이라는 과제입니다. 기계는 특정 작업 하나를 배우는 데는 매우 뛰어날 수 있지만, 새로운 작업을 배우라는 요청을 받으면 빈번하게 '파괴적 망각(catastrophic forgetting)'을 겪습니다. 그들은 새로운 것을 위한 공간을 만들기 위해 이전의 지식을 덮어써 버리며, 이로 인해 한때 알고 있었던 것을 더 이상 인식하지 못하게 됩니다. 수십 년 동안 연구자들은 나중에 복습하기 위해 오래된 사례들을 저장하거나, 기계가 너무 빨리 생각을 바꾸지 못하도록 복잡한 규칙을 추가하는 방식으로 이를 해결하려 노력해 왔습니다. 그러나 최근에는 오래된 사례를 전혀 저장하지 않고도 해결할 수 있는 더 단순하고 새로운 접근 방식이 등장했습니다. 이 방법은 뇌를 업데이트하기 위해 느린 시행착오 과정을 거치는 대신, 직접적인 수학적 공식을 사용하여 지식을 즉각적으로 업데이트합니다. 이는 빠르고, 프라이버시를 보호하며, 효율적이지만, 지금까지는 숨겨진 결함이 있었습니다. 즉, 지저도한 시행착오 과정 없이도 기계는 여전히 이전의 교훈을 서서히 잊어버린다는 점이었습니다.
셰필드 대학교의 연구팀은 왜 이런 현상이 발생하는지 정확히 파악하고, 이를 저지할 수 있는 해결책을 구축했습니다. 그들은 문제가 기계가 자신의 기억을 공격적으로 다시 쓰는 것에 의해 발생하는 것이 아니라, 이전에 가정되었던 것과는 다르다는 것을 발견했습니다. 대신, 문제는 새로운 데이터에 의해 서로 다른 정보들이 어떻게 연관되어 있는지에 대한 기계의 내부 지도가 미묘하게 왜곡되는 데서 발생했습니다. 새로운 작업이 도착했을 때, 그 정보는 기계가 이미 기존 작업들을 위해 구축해 놓은 가장 중요하고 지배적인 경로들과 중첩되었습니다. 이 중첩은 기존의 경로를 직접적으로 지우는 것이 아니라, 오히려 그 강도를 희석시켜 기계가 기존 정답에 대해 갖는 확신을 시간이 흐름에 따라 표류하게 만들었습니다. 이는 마치 새로운 사람들의 무리가 조용한 방에 들어왔을 때, 기존의 대화를 소리지르는 방식으로 압도하는 것이 아니라, 음향 구조를 변화시켜 기존의 목소리가 더 작고 불분명하게 들리도록 만드는 것과 같았습니다.
이를 해결하기 위해 연구진은 SPARCL이라 불리는 새로운 시스템을 개발했습니다. 그들의 통찰은 기계의 내부 지도를 단일하고 균일한 블록이 아니라 두 개의 뚜렷한 부분으로 취급하는 것이었습니다. 그들은 오래된 작업들에 대한 가장 중요한 정보를 전달하는 가장 강력하고 에너지 넘치는 경로들로 구성된 '핵심(core)' 섹션을 식별했습니다. 그런 다음 이 핵심 부분을 완전히 동결하여, 어떤 새로운 정보도 그 형태나 강도를 변경할 수 없도록 고정했습니다. 그리고 그들은 '잔차(residual)' 섹션이라고 부르는 나머지 지도 부분은 변화할 수 있도록 열어두었습니다. 이 잔차 부분은 더 새롭고 덜 지배적인 방향의 정보를 포착합니다. 새로운 작업이 도착하면, 시스템은 오직 이 유연한 잔차 섹션만을 업데이트하며, 얼어붙은 핵심 부분은 건드리지 않습니다. 이렇게 함으로써 기계는 이미 알고 있는 지식의 안정적인 토대를 전혀 방해하지 않고도 새로운 것을 배울 수 있습니다.
연구진은 수백 가지의 서로 다른 사물 및 동물 범주를 포함하는 데이터셋을 포함하여 몇 가지 까다로운 이미지 인식 과제에 이 접근 방식을 테스트했습니다. 그들은 이미 세상을 보는 법을 배운 강력한 사전 학습된 컴퓨터 비전 모델을 사용했으며, 해당 모델에게 이전의 것들을 다시는 보지 않고도 새로운 범주들을 하나씩 배우도록 요청했습니다. 결과는 놀라웠습니다. 이 새로운 방법은 이러한 단순하고 빠른 학습 시스템과, 이전에 최고라고 간주되었던 훨씬 더 복잡하고 느린 시스템 사이의 간극을 거의 모두 메웠습니다. 어떤 경우에는 기존의 가장 강력한 방법들보다 더 뛰어난 성능을 보이기도 했습니다. 결정적으로, 이 시스템은 매우 빠르고 효율적이었으며, 다른 고급 기술들이 필요로 하는 시간과 컴퓨팅 파워의 극히 일부만을 요구했습니다. 이는 정보가 기계를 통해 흐르는 기하학적 구조를 이해함으로써, 오래된 사례를 저장하거나 복잡한 시뮬레이션을 실행하지 않고도 오래된 지식을 보호할 수 있음을 입증했습니다.
이 연구는 단순한 학습 알고리즘의 한계에 대한 우리의 생각을 바꿉니다. 오랫동안, 시행착오라는 번거로운 반복 과정을 제거하면 망각 문제를 해결할 수 있을 것이라는 믿음이 있었습니다. 연구진은 시행착오라는 깔끔하지 않은 반복적 과정을 제거하더라도, 새로운 정보가 전체 시스템의 균형을 변화시키기 때문에 망각이 발생할 수 있다는 것을 보여주었습니다. 그들의 해결책은 힘으로 이 균형에 맞서 싸우는 것이 아니라, 가장 중요한 지식을 위한 보호 구역을 만드는 것입니다. 안정적인 것과 유연한 것을 분리함으로써, 그들은 기계가 길을 잃지 않고 평생 학습할 수 있도록 했습니다. 이 접근 방식은 스마트폰이나 로봇처럼 오래된 데이터를 저장하는 것이 불가능하고 속도가 필수적인 기기에서, 새로운 상황에 적응할 수 있는 지능형 시스템을 구축하는 유망한 경로를 제시합니다. 기계는 배우고, 적응하며, 무엇보다도, 기억합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.