이 논문은 트랜스포머의 피드포워드 네트워크(FFN)를 유사도 기반 라우팅과 저차원 잔차 업데이트를 사용하는 '어트랙터 패치 네트워크(APN)'로 대체함으로써, 연산 효율성을 높이고 지속적 학습(continual learning) 시 발생하는 치명적 망각 문제를 효과적으로 완화하는 구조를 제안합니다.
현재 트랜스포머(Transformer) 모델의 핵심 구성 요소인 **위치별 피드포워드 네트워크(FFN)**는 두 가지 주요 한계를 가집니다.
계산 및 용량의 비효율성: FFN은 모든 토큰에 대해 동일한 밀집(dense) 가중치를 공유합니다. 이는 언어의 문맥적 구조(특정 도메인이나 구문 패턴)가 클러스터링되어 있음에도 불구하고, 모든 문맥에 동일한 계산 자원을 할당하게 만들어 전문화(specialization)를 방해합니다.
치명적 망각 (Catastrophic Forgetting): 스트리밍 데이터 환경에서 모델을 지속적으로 학습(Continual Learning)시킬 때, 새로운 데이터를 학습하기 위한 가중치 업데이트가 기존에 학습된 지식을 담고 있는 공유 가중치를 덮어쓰면서 발생하는 '간섭(Interference)' 문제가 심각합니다.
2. 제안 방법론 (Methodology: Attractor Patch Networks)
본 논문은 기존 FFN을 대체할 수 있는 APN(Attractor Patch Networks) 구조를 제안합니다. APN은 "패치 전문가(Patch Experts)"들의 뱅크로 구성되며, 다음과 같은 메커니즘으로 작동합니다.
핵심 메커니즘
유사도 기반 라우팅 (Similarity Routing): 학습된 프로토타입(Prototypes) 세트를 사용하여, 입력 토큰의 표현(representation)과 가장 유사한 상위 k개의 프로토타입을 선택합니다. 이를 통해 토큰을 특정 '패치(Patch)' 영역으로 할당합니다.
저차원 패치 전문가 (Low-Rank Patch Experts): 선택된 각 패치는 압축된 코드(Compact code)를 조건으로 하여 **저차원 잔차 업데이트(Low-rank residual update)**를 생성합니다. 이는 전체 파라미터를 건드리지 않고도 국소적인 변환을 가능하게 합니다.
조건부 비선형 변환: 각 패치는 고유한 게이팅(Gating) 메커니즘을 가져, 동일한 코드라도 패치에 따라 서로 다른 비선형 활성화 패턴을 가질 수 있습니다.
수학적 구조
라우팅: 토큰 h에 대해 프로토타입 pi와의 유사도를 계산하여 상위 k개를 추출.
코드 생성:u(h)=V⊤LN(h) (차원 축소된 압축 코드).
패치 출력:Δi(h)=Uiϕi(h) (저차원 행렬 Ui를 이용한 잔차 업데이트).
최종 출력:y=h+γ∑i∈K(h)wi(h)Δi(h) (잔차 연결 구조).
3. 주요 기여 (Key Contributions)
새로운 아키텍처 설계: 기존 트랜스포머 블록에 즉시 교체 가능한(Plug-compatible) FFN 대체 모델인 APN을 제안했습니다.
함수 클래스 분석: APN을 '구간별 저차원 잔차 함수(Piecewise low-rank residual function class)'로 정형화하여, 모델의 표현력과 전문화 능력을 이론적으로 규명했습니다.
지속 학습 이론 정립: 패치 간의 **중첩도(Overlap)**를 간섭의 척도로 정의하여, 왜 APN이 기존 모델보다 간섭을 줄이고 안정적인 학습이 가능한지 논리적으로 설명했습니다.
4. 실험 결과 (Experimental Results)
문자 단위(Character-level) 셰익스피어 언어 모델링 실험을 통해 검증되었습니다.
A. 언어 모델링 성능 (Accuracy)
Perplexity (PPL): 밀집 FFN(4.32)과 비교했을 때 APN(4.57)은 약간 높은 수치를 보였으나, 파라미터 수가 약 2.2배 더 많음에도 불구하고 매우 경쟁력 있는 성능을 유지했습니다.
B. 지속 학습 성능 (Continual Learning) - 핵심 결과
도메인 A(기존)에서 학습 후 도메인 B(새로운 이름 패턴)로 적응(Adaptation)시키는 실험 결과:
보존력 (Retention - 도메인 A 유지 능력): APN은 기존 도메인 PPL을 11.12로 유지하여, 밀집 FFN(29.44)보다 2.6배 더 나은 성능을 보였습니다. (치명적 망각 대폭 감소)
적응력 (Adaptation - 도메인 B 학습 능력): APN은 새로운 도메인에서 6.38 PPL을 달성하여, 밀집 FFN(17.78)보다 2.8배 더 빠른 적응을 보여주었습니다.
5. 의의 및 결론 (Significance & Conclusion)
본 논문의 가장 큰 의의는 **"파라미터 업데이트의 국소화(Localization)"**를 통해 모델의 유연성과 안정성을 동시에 확보했다는 점입니다.
구조적 이점: 밀집 FFN은 모든 업데이트가 전체 가중치에 영향을 미치는 반면, APN은 라우팅을 통해 활성화된 특정 패치만 업데이트합니다. 이는 새로운 지식이 기존 지식의 영역을 침범하지 않고 별도의 '패치 서브스페이스'에 저장될 수 있게 합니다.
결론: APN은 단순히 파라미터 용량을 늘리는 것이 아니라, 지식의 저장 방식을 구조적으로 분리함으로써 지속 학습 환경에서 발생하는 치명적 망각 문제를 해결할 수 있는 강력한 아키텍처적 대안을 제시합니다.