기존의 AI 모델 (Transformer) 은 마치 단단한 콘크리트 벽으로 지어진 건물과 같습니다.
문제: 건물의 크기를 키우려면 (모델을 확장하려면), 벽을 부수고 처음부터 다시 짓는 것이 일반적입니다. 이미 배운 지식 (벽돌에 그려진 그림) 이 사라지기 때문입니다.
원인: 기존 모델의 핵심 부품인 '주의 (Attention)' 메커니즘이 **선형 (Linear)**이라는 딱딱한 규칙에 갇혀 있어서, 새로운 정보를 추가하면 기존 지식이 망가집니다. 마치 좁은 통로에 차를 더 넣으려다 기존 차들이 밀려나는 것과 같습니다.
✨ 2. 해결책: "Nexusformer - 유연한 접이식 구조"
저자들은 이 문제를 해결하기 위해 Nexusformer를 만들었습니다. 이 모델은 Nexus-Rank라는 새로운 장치를 도입했습니다.
🌉 비유: "고급 다리와 확장 가능한 터널"
기존 모델이 직선으로만 연결된 좁은 다리라면, Nexusformer 는 3 단계로 이어지는 고급 터널입니다.
입구 (D): 정보를 받습니다.
확장실 (M): 정보를 잠시 넓고 복잡한 공간으로 옮겨 비틀고 (Non-linear) 섞습니다. (여기서 정보가 더 풍부해집니다.)
최대 공간 (A): 정보를 아주 넓은 공간으로 확장하여 고급 패턴을 찾아냅니다.
출구 (D): 다시 원래 크기로 정리해서 내보냅니다.
핵심: 이 과정에서 정보를 단순히 직선으로 넘기는 게 아니라, **비선형 (Non-linear)**적으로 변형시켜서 훨씬 더 복잡한 의미 (예: 유머, 논리, 감정) 를 이해할 수 있게 됩니다.
🧩 3. 확장 방법: "빈 방을 추가하는 마법"
Nexusformer 의 가장 큰 장점은 기존 지식을 잃지 않고 모델을 키울 수 있다는 점입니다.
비유: "빈 책장 추가하기"
기존 모델은 책장을 늘리면 기존 책들이 떨어집니다.
Nexusformer 는 **아직 아무것도 없는 빈 책장 (Zero-initialized blocks)**을 기존 책장 옆에 붙입니다.
처음엔 빈 책장이지만, 학습을 계속하면 그 빈 책장에 새로운 책 (새로운 지식) 을 채워 넣습니다.
결과: 기존 책들은 그대로 안전하고, 새로운 책장만 새로운 일을 합니다. 그래서 재학습 비용이 40% 이상 절약됩니다.
📈 4. 성과: "더 작고, 더 똑똑하고, 더 안정적"
실험 결과, Nexusformer 는 다음과 같은 놀라운 성과를 보였습니다.
효율성: 같은 성능을 내는 데 필요한 학습 비용 (컴퓨팅 파워) 이 기존 모델보다 41.5% 적게 들었습니다.
성능: 추론 능력 (논리 문제 풀기 등) 에서 기존 모델들을 압도했습니다. 특히 모델이 커질수록 그 차이가 더 벌어졌습니다.
안정성: 모델을 키울 때 성능이 뚝 떨어지는 일이 없었습니다. 마치 중심 (Zero) 을 잡고 회전하는 원심력처럼, 학습이 안정적으로 수렴하는 경로를 찾았습니다.
🎯 5. 요약: 왜 이것이 중요한가요?
기존 방식: 모델을 키우려면 "다 부수고 다시 짓기" (비싸고 느림).
Nexusformer 방식: "기존 집은 그대로 두고, 빈 방을 추가해서 확장하기" (싸고 빠르고 지능적).
이 기술은 앞으로 AI 가 더 커지고 똑똑해져도, 막대한 비용과 시간을 들이지 않고도 지속적으로 진화할 수 있는 길을 열어줍니다. 마치 레고 블록을 쌓듯이, 기존 구조를 해치지 않으면서 더 복잡한 모양을 만들어낼 수 있게 된 것입니다.
1. 문제 제기 (Problem Statement)
기존의 대규모 언어 모델 (LLM) 확장 방식은 주로 더 큰 모델을 처음부터 (from scratch) 학습시키는 방식에 의존합니다. 이는 계산 자원의 낭비와 이전 모델에서 학습된 표현 (representations) 의 손실을 초래합니다.
진행형 확장 (Progressive Scaling) 의 한계: 기존 Transformer 아키텍처는 점진적인 확장을 지원하지 않습니다. 표준 Multi-Head Attention 의 선형 투영 (Linear Projections, Q/K/V) 은 고정된 차원의 부분 공간 (subspace) 으로 특징 추출을 제한합니다.
선형성 병목 현상: 선형 매핑은 복잡한 의미적 분해 (semantic disentanglement) 를 저차원 선형 혼합에 국한시켜 표현력 (expressivity) 을 제한합니다.
확장의 경직성: 고정된 투영 행렬의 차원을 늘리면 분포 변화 (distribution shift) 가 발생하여 성능이 급격히 저하되고, 이를 복구하기 위해 대량의 재학습이 필요합니다. 기존 LoRA 나 Net2Net 같은 방법들은 선형 제약에서 완전히 벗어나지 못하거나, 표현력을 동시에 향상시키지 못합니다.
2. 제안 방법: Nexusformer (Methodology)
저자들은 선형 병목 현상을 해결하고 손실 없는 구조적 확장을 가능하게 하기 위해 Nexusformer를 제안합니다. 핵심은 Attention 메커니즘의 선형 Q/K/V 투영을 Nexus-Rank 레이어로 대체하는 것입니다.
2.1. Nexus-Rank 레이어 (3 단계 비선형 매핑)
표준 선형 투영 (D→D) 을 대신하여, 고차원 비선형 매니폴드上进行하는 3 단계 매핑을 도입합니다. 차원 관계는 D<M<A를 따릅니다.
Stage 1 (Uplift): 입력 차원 D를 중간 용량 공간 M으로 매핑한 후 비선형 활성화 (GeLU) 를 적용합니다. (ZM=σ(XWM))
목적: 선형 병목에서 벗어나 초기 특징 상호작용을 포착하고, 복잡한 특징을 분해 (decoupling) 합니다.
Stage 2 (Expansion): 중간 공간 M을 과용량 (over-capacity) 공간 A로 확장합니다. (ZA=σ(ZMWA))
목적: 1 단계에서 분해된 특징에 대해 2 차 이상의 복잡한 상호작용을 모델링합니다. A는 모델이 인코딩할 수 있는 고차원 특징의 부피를 결정합니다.
Stage 3 (Projection): 깊은 특징을 원래 차원 D로 다시 투영합니다. (Q~=ZAWD)
목적: 기존 Transformer 프레임워크와의 호환성을 유지하면서, 내부적으로는 비선형 변환을 거친 풍부한 특징을 출력합니다.
2.2. 이중 축 성장 메커니즘 (Dual-Axis Growth) 및 제로 초기화
Nexusformer 는 모델 확장 시 **두 가지 축 (M과 A)**을 동시에 확장하며, 제로 초기화 (Zero Initialization) 전략을 사용합니다.
구조: 확장 시 기존 파라미터 블록 (Wold) 은 유지하고, 새로운 블록 (Wnew) 을 0 으로 초기화하여 추가합니다.
효과:
손실 없는 확장: 확장 순간, 0 으로 초기화된 새로운 블록은 모델 출력에 영향을 주지 않으므로, 사전 학습된 지식이 파괴되지 않습니다.
안정적인 수렴: 추가 학습 과정에서 새로운 블록이 기존 지식과 자연스럽게 정렬되며, 모델은 안정적인 수렴 궤적을 따릅니다.
이중 자유도:M과 A를 독립적으로 조절하여 비선형 모델링 용량과 합성 능력을 동시에 최적화할 수 있습니다.
3. 주요 기여 (Key Contributions)
Nexusformer 아키텍처 제안: 선형 어텐션 투영을 심층 비선형 Nexus-Rank 레이어로 구조적으로 대체하여 표현 용량을 획기적으로 향상시켰습니다.
손실 없는 파라미터 확장 메커니즘: 제로 초기화를 기반으로 한 이중 축 (M,A) 성장 메커니즘을 도입하여, 재학습 없이도 효율적으로 모델을 확장하고 지식을 계승할 수 있게 했습니다.
성장 역학에 대한 통계적 분석: 성장 동역학에 대한 비모수적 분석을 통해 최적의 확장 시점을 결정하는 경험적 기준을 제시하고, 분포 변화 (distribution shift) 를 정량화했습니다.
기하학적 확장 법칙 (Scaling Law) 유도: 제로 초기화가 유도하는 '발산 - 수렴 (diverge-then-converge)' 궤적을 분석하여, 확장 규모에 따른 성능을 정확히 예측하는 기하학적 확장 법칙을 도출했습니다.
4. 실험 결과 (Experimental Results)
성능 비교: 170M 에서 640M 까지의 다양한 규모에서 Nexusformer 는 Tokenformer, Qwen3, Transformer++ 등 기존 모델들을 능가하거나 경쟁력 있는 성능을 보였습니다. 특히 640M 규모에서는 ARC-Challenge(복잡한 논리 추론) 에서 Tokenformer 보다 15.8% 높은 점수를 기록했습니다.
계산 효율성: 점진적 확장 (240M → 440M) 실험에서 Nexusformer 는 Tokenformer 와 동일한 퍼플렉시티 (Perplexity) 를 달성하는 데 **41.5% 적은 학습 계산량 (Compute)**을 사용했습니다.
최적 성장 지점: 실험 결과, 380M 규모가 최적의 성장 지점 (Optimal Growth Point) 으로 나타났으며, 이 시점에서 성능 향상이 정점에 도달했습니다.
FLOPs 분석: 3 단계 매핑을 사용함에도 불구하고, 숨겨진 차원 (D) 을 줄이고 어텐션의 2 차 복잡도 항을 최적화하여, 표준 단일 단계 매핑 아키텍처보다 오히려 토큰당 FLOPs 가 낮거나 동등한 수준을 유지했습니다.
5. 의의 및 결론 (Significance & Conclusion)
선형 병목의 극복: Transformer 의 핵심 병목인 선형 투영을 비선형 매니폴드로 전환함으로써, 고정된 차원 내에서 더 높은 표현력을 확보했습니다.
지속 가능한 모델 진화: "처음부터 학습"하는 비효율적인 패러다임을 넘어, 사전 학습된 지식을 계승하며 점진적으로 성장하는 계승 가능한 점진적 확장 (Inheritable Incremental Capacity Expansion) 패러다임을 정립했습니다.
안정적인 확장 전략: 제로 초기화가 단순한 공학적 트릭이 아니라, 모델이 기하학적 수렴 궤적을 따르도록 하는 통계적 필수 조건임을 증명했습니다. 이를 통해 모델 확장의 불확실성을 줄이고 예측 가능한 성능 향상을 가능하게 합니다.
이 연구는 대규모 언어 모델의 확장 비용을 획기적으로 줄이면서도 성능을 극대화할 수 있는 새로운 아키텍처 설계 원칙을 제시한다는 점에서 중요한 의의를 가집니다.