← 최신 논문
🤖 machine learning

Gate-Zero Growth: A Geometric Framework for Function-Preserving Continual Learning

이 논문은 제로 초기화된 게이트를 활용하여 기능적 자코비안(functional Jacobian)의 랭크 분리(rank separation)를 유도함으로써, 망각을 거의 없이 안전한 용량 확장과 제어된 기능적 드리프트(functional drift)를 가능하게 하는 함수 보존형 지속 학습 프레임워크인 "gate-zero growth"를 소개한다.

원저자: Dante Lok

게시일 2026-07-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Dante Lok

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 단 하나의 맛있는 레시피를 완성하기 위해 수년간 공을 들인 숙련된 셰프라고 상상해 보세요. 당신은 그것을 어떻게 만들어야 딱 맞는 맛이 나는지 정확히 알고 있습니다. 이제 누군가 당신에게 천 명을 위한 거대한 연회를 차려달라고 요청했지만, 당신에게는 오직 소규모 저녁 식사를 위한 재료만 있다고 상상해 보세요. 당연한 해결책은 더 큰 주방을 사고 더 많은 요리사를 고용하는 것이지만, 여기에는 함정이 있습니다. 만약 당신이 그저 새로운 사람들을 주방에 집어넣고 요리를 시작한다면, 원래의 레시피가 망가질 수도 있다는 점입니다. 새로운 요리사들이 실수로 기존 요리의 향신료를 바꾸거나, 새로운 냄비들이 기존의 것들과 충돌하여, 갑자기 당신의 그 유명한 요리가 진흙 맛처럼 변해버릴 수도 있습니다. 이것이 인공지능에서의 "지속적 학습(Continual Learning)"이 겪는 일상적인 투쟁입니다. AI 모델은 마치 그 숙련된 셰프와 같습니다. 그들은 데이터를 통해 학습하지만, 우리가 그들에게 새로운 것을 가르치거나 모델의 규모를 키우려고 할 때, 이전에 알고 있던 모든 것을 잊어버리는 "파괴적 망각(catastrophic forgetting)" 현상을 겪곤 합니다. 과학자들은 기존의 것을 버리고 처음부터 다시 시작하는 대신, 기존의 작동하는 부분을 망가뜨리지 않고 AI의 두뇌를 성장시키는 방법을 찾기 위해 노력해 왔습니다.

이 논문은 그 주방의 재앙을 해결하기 위해 "게이트 제로 성장(Gate-Zero Growth)"이라는 영리하고 새로운 기술을 소개합니다. AI 모델을 다층 케이크라고 생각해 보세요. 보통 케이크를 더 높게 만들고 싶다면, 단순히 그 위에 층을 더 쌓으면 됩니다. 하지만 단순히 새 층을 얹기만 한다면, 그것이 아래에 있는 케이크를 짓누르거나 전체적인 맛을 변화시킬 수 있습니다. 저자들은 다른 방식을 제안합니다. 새 층을 추가하되, "제로(zero)"로 설정되어 완전히 닫혀 있는 특수한 "게이트(gate)"를 부착하는 것입니다. 게이트가 닫혀 있기 때문에, 새로운 층은 케이크에 보이지 않습니다. 즉, 기존의 맛이나 질감에 전혀 영향을 주지 않습니다. 케이크는 이전과 똑같은 맛을 유지하면서도 훨씬 더 커지게 됩니다. 이것을 "함수 보존형(function-preserving)" 성장이라고 부르는데, 이는 원래의 함수(맛)가 완벽하게 보존되기 때문입니다.

연구진들은 이 아이디어를 테스트하기 위해 중간 크기의 AI 모델(약 3억 개의 파라미터)을 거대 모델(약 8억 5,700만 개의 파라미터)로 성장시켰습니다. 그들은 이 "제로 게이트"를 사용하여 새로운 층을 추가했고, 그 후 이 거대 모델에게 새로운 언어 과제를 가르쳤습니다. 결과는 인상적이었습니다. "게이트 제로" 방식을 사용했을 때, 모델은 이전 지식을 거의 완벽하게 기억해 냈으며, 망각이 거의 발생하지 않았습니다. 사실, 기존 지식이 너무나 온전하게 유지되어 기존 과제에 대한 모델의 성능이 거의 변하지 않을 정도였습니다.

하지만 이 논문은 만약 이 기술을 사용하지 않는다면 어떤 일이 벌어지는지에 대해서도 경고합니다. 그들은 제로 게이트 없이 단순히 층을 쌓아 올린 "나이브(naive)"한 방식(그들은 이를 "Gstack"이라 부릅니다)을 테스트했습니다. 이것은 마치 기존의 케이크를 즉시 짓누르기 시작하는 새로운 층을 추가하는 것과 같았습니다. 결과는 재앙이었습니다. 모델은 기존 지식을 거의 완전히 잊어버렸고, 새로운 케이크의 맛은 엉망이 되었습니다. 이는 단순히 더 많은 부분을 추가하는 것만으로는 충분하지 않으며, 기존 부분을 안전하게 지키기 위한 적절한 "게이트" 메커니즘이 필요하다는 것을 증명합니다.

또한, 이 논문은 이러한 거대 AI 모델을 훈련하는 방법에 대해 흥eli로운 발견을 했습니다. 연구진은 두 가지 주요 훈련 방식을 찾아냈습니다. 첫 번째는 "격리(Isolation)"로, 모델의 기존 부분들을 완전히 고정(freeze)하고 오직 새로운 부분들만 학습하게 하는 방식입니다. 이것은 기존 레시피가 정확히 동일하게 유지되도록 보장하는 가장 안전한 방법입니다. 두 번째는 "전부 해제(Freeze-Nothing)"로, 모델 전체가 함께 학습하도록 하는 방식입니다. 놀랍게도, 이 두 번째 방식은 모델이 새로운 과제를 수행하는 능력을 실제로 더 향상시켰으며, 기존 과제를 망치지도 않았습니다. 단지 맛을 약간 변화시켰을 뿐인데, 그 변화는 실수가 아니라 오히려 개선된 방향이었습니다.

저자들은 이것이 AI 이면에 숨겨진 수학적 기하 구조 덕분에 가능하다고 설명합니다. 게이트가 제로일 때, 모델의 새로운 부분들은 수학적으로 "평평(flat)"하며 기존 부분과 간섭하지 않습니다. 이것은 마치 현재 봉쇄되어 있는 집에 새 방을 추가하는 것과 같습니다. 당신은 새 방을 어떻게 짓든 상관없으며, 당신이 문을 열기로 결정하기 전까지는 기존 방의 구조를 바꾸지 않을 것입니다. 논문은 이 "게이트 제로" 아이디어가 단순한 일회성 기술이 아니라, 여러 인기 있는 AI 기법들의 근저에 깔린 동일한 원리임을 보여주며, 이는 AI의 두뇌를 안전하게 성장시키기 위한 근본적인 규칙임을 밝히고 있습니다.

요약하자면, 이 논문은 우리가 이미 가진 지식을 잃지 않으면서 더 크고 똑똑한 AI 모델을 구축하고 싶다면, 단순히 새로운 부품을 기존 것에 던져 넣어서는 안 된다는 것을 보여줍니다. 대신, 준비될 때까지 방해하지 않도록 "제로 게이트"와 함께 추가해야 합니다. 이를 통해 AI는 뿌리를 흔들지 않고 새로운 가지를 뻗어 나가는 나무처럼 성장할 수 있으며, 미래가 구축되는 동안 과거의 지혜가 온전히 유지되도록 보장할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →