← 최신 논문
💻 computer science

Closed-Form Residual-Space Rotation for Offline Transformer Width Growth

이 논문은 훈련 손실을 크게 개선하고 모델 성장 과정에서 학습된 행동을 보존하기 위해, 폐쇄형 소형 잔차 통합 연산자(Small Residual Integration Operator, SRIO)를 블록별 확장 정책 및 스칼라 웜업 게이트와 결합하여 트랜스포머 너비를 점진적으로 확장하는 오프라인 레시피를 제안한다.

원저자: Ramasubramanian B

게시일 2026-08-05
📖 5 분 읽기🧠 심층 분석

원저자: Ramasubramanian B

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 이야기를 쓰는 법을 가르치려 한다고 상상해 보세요. 당신은 아주 작은 뇌를 가진 아주 작은 로봇에서 시작합니다. 이 로봇은 기초를 빠르게 배우지만, 걸작을 쓰기에는 너무 단순합니다. 이 로봇을 더 좋게 만들기 위해, 단순히 작은 로봇을 버리고 처음부터 거대한 로봇을 만들 수도 있지만, 그러려면 시간이 너무 오래 걸리고 엄청난 양의 전기가 듭니다. 대신에, 작은 로봇의 뇌를 "키울" 수도 있습니다. 즉, 새로운 뉴런을 추가하여 더 넓고 똑똑하게 만드는 것입니다. 이것을 **모델 확장(model expansion)**이라고 부릅니다.

뇌를 키우는 데 있어 까다로운 점은, 새로운 부분이 기존의 부분들과 어떻게 대화해야 할지 모른다는 것입니다. 만약 당신이 그냥 새로운 구역을 덧붙이기만 한다면, 기존의 뇌가 그것을 무시하거나, 혹은 새로운 뇌가 기존의 뇌가 공들여 쌓아온 기억들을 실수로 뒤섞어버릴 수도 있습니다. 이는 마치 복도를 연결하지 않고 집에 새로운 날개를 붙이는 것과 같습니다. 새 방은 존재하지만 아무도 들어갈 수 없거나, 심지어 집 전체가 흔들리기 시작할 수도 있습니다. 과학자들은 로봇이 기존의 기술을 유지하면서 새로운 것을 배울 수 있도록, 이 오래된 뇌 부분과 새로운 뇌 부분을 연결하는 완벽한 "풀"을 찾아내기 위해 노력해 왔습니다. 이 논문은 바로 그 완벽한 풀을 찾는 것에 관한 것입니다.


뇌를 강화하는 레시피: AI를 키우는 새로운 방법

Tech-Aarvam의 Ramasubramanian B라는 이 논문의 저자는 AI 모델(로봇의 뇌)을 오프라인에서 키우는 영리한 "레시피"를 고안해 냈습니다. AI가 실행되는 동안 스스로 성장하는 법을 배우게 하는 대신, 그들은 손님이 도착하기 전에 재료를 준비하는 요리사처럼 무거운 작업들을 미리 해둡니다. 그들의 목표는 더 작은 모델을 가져와서, 이미 이룬 진전을 잃지 않으면서 더 넓게 확장하는 것입니다.

AI 모델을 물 양동이를 전달하며 줄을 서 있는 일꾼 팀이라고 생각해 보세요. 모델의 "너비(width)"는 그 줄에 몇 명의 사람이 있는지를 나타냅니다. 줄에 더 많은 사람을 추가할 때, 당신은 그 새로운 사람들이 물을 한 방울도 흘리지 않고 정확히 어떻게 잡고 전달해야 하는지 알게 해야 합니다. 이 논문은 이 과정이 세 가지 특정 재료를 통해 이루어질 때 가장 좋다고 제안합니다: 특별한 회전 기술, 작업마다 다른 성장 규칙, 그리고 새로운 일꾼들을 위한 부드러운 "웜업(warm-up)".

1. 마법의 회전: SRIO

이 쇼의 주인공은 SRIO(Small Residual Integration Operator)라고 불리는 것입니다. 기존의 뇌 부분과 새로운 뇌 부분이 서로 다른 언어를 사용하는 것이라고 상상해 보세요. 새로운 뉴런을 추가할 때, 그들은 약간 다른 방언을 사용합니다. 만약 당신이 그냥 그것들을 꽂아 넣는다면, 기존의 뉴런들이 새로운 뉴런들을 이해하지 못하거나, 새로운 뉴런들이 기존의 것들 때문에 혼란에 빠질 수 있습니다.

SRIO는 데이터에 정밀한 "회전(spin)" 또는 회전을 수행하는 번역가 역할을 합니다. 이것은 정보 자체를 바꾸지는 않지만, 새로운 데이터의 방향을 회전시켜 기존의 데이터와 완벽하게 일치하도록 만듭니다. 구체적으로, 그것은 새로운 뉴런들의 "평균" 방향을 기존의 뉴런들을 향하도록 회전시킵니다. 이를 통해 기존의 가중치(뇌의 기억)가 새로운 입력을 훨씬 더 강력하게 읽을 수 있게 합니다. 저자는 이 회전이 '폐쇄형 수학 솔루션(closed-form math solution)', 즉 AI가 천천히 배워야 하는 것이 아니라 즉시 계산할 수 있는 고정된 공식이라는 것을 발견했습니다. 이것은 마치 새로운 방을 기존의 복도와 연결하기 위해 어떻게 돌려야 하는지 알려주는 미리 만들어진 지도와 같습니다.

2. 직업마다 다른 규칙

이 논문은 모든 뇌의 부분을 똑같이 취급해서는 안 된다는 것을 발견했습니다. AI에는 두 가지 주요 유형의 일꾼이 있습니다: 어텐션(Attention) 일꾼(무엇에 집중할지 결정하는 이들)과 FFN 일꾼(정보를 처리하는 이들)입니다.

  • 어텐션 일꾼을 위해: 저자는 "볼록 확장(convex expansion)"을 사용했습니다. 기존의 일꾼들을 가져와서, 마치 두 가지 색의 페인트를 섞어 새로운 색조를 만드는 것처럼 그들의 기술을 결합하여 새로운 일꾼을 만드는 것을 상상해 보세요. 이는 기존의 것들을 부드럽게 혼합한 새로운 일꾼들을 만들어냅니다.
  • FFN 일꾼을 위해: 그들은 "타일드 카피(tiled copy)"를 사용했습니다. 이것은 단일한 일꾼을 가져와서 새로운 공간을 채우기 위해 복사하는 것과 같습니다. 이 일꾼들은 특정 특징들을 다루기 때문에, 혼합하는 것보다 직접 복사하는 것이 더 효과적입니다.

이 논문은 어텐션에는 혼합을, 프로세싱에는 복사를 사용하는 이 두 가지 전략을 섞는 것이 모든 것에 하나의 방법만을 사용하는 것보다 훨씬 더 효과적이라는 것을 보여줍니다.

3. 부드러운 웜업 (Gentle Warm-Up)

완벽한 회전과 적절한 확장이 있더라도, 새로운 일꾼들이 너무 의욕이 앞서서 즉시 기존의 일꾼들보다 더 크게 소리를 지를 수도 있습니다. 이를 해결하기 위해 저자는 **스칼라 웜업 게이트(scalar warmup gate)**를 추가했습니다. 이것을 볼륨 조절기라고 생각하세요. 새로운 일꾼들이 처음 합류할 때, 그들의 볼륨은 0으로 완전히 낮춰져 있습니다. 짧은 기간(약 4,000만 단어의 학습 기간) 동안 볼륨은 서서히 높여집니다. 이를 통해 기존의 뇌가 자신의 일을 계속 수행하는 동안, 새로운 뇌가 혼란을 일으키지 않고 어떻게 기여할지를 천천히 배울 수 있게 합니다.

그들이 발견한 것

저자들은 이 레시피를 테스트하기 위해 모델의 너비를 256에서 384로 키웠습니다. 그들은 이 방법을 아무것도 특별히 하지 않는 방식(그냥 무작위로 새로운 부분을 추가하는 것) 및 LiGO라고 불리는 다른 방식(실행 중에 성장 규칙을 배우려고 시도하는 방식)과 비교했습니다.

결과는 명확했습니다:

  • "아무것도 하지 않는" 방식4.2527의 훈련 손실(training loss)을 기록했습니다.
  • LiGO 방식(그들의 코드에 재구현됨)은 4.2606의 손실을 기록했습니다.
  • 그들의 전체 레시피(SRIO + 특정 확장 + 웜업)는 4.2111의 손실을 달성했습니다.

AI 훈련의 세계에서, 낮은 "손실" 숫자는 모델이 실수를 덜 한다는 것을 의미합니다. 따라서 그들의 방법이 확실한 승자였으며, 다른 방법들을 눈에 띄는 차이로 앞질렀습니다. 그들은 또한 이 방식이 모델을 여러 번 성장시킬 때도 작동한다는 것을 보여주었으며, 2,400만 파라미터에서 1억 2,000만 파라미터까지 키워냄으로써 이 레시피가 반복해서 사용할 수 있는 것임을 증명했습니다.

그들이 제외한 것

이 논문은 다른 아이디어들이 작동하는지 확인하기 위해 여러 가지를 테스트했습니다. 그들은 회전 연산자의 다양한 크기(Medium 및 Large 버전)를 테스트했고, "Small" 버전(SRIO)이 동일하게 좋거나 오히려 더 나으며 훨씬 더 단순하다는 것을 발견했습니다. 또한 AI가 훈련 중에 회전 규칙을 배워야 하는지("학습" 모드) 아니면 고정된 수학 공식( "정적" 모드)을 사용하는지를 테스트했습니다. 그들은 정적인, 미리 계산된 공식이 AI가 배우려고 시도하는 방식만큼이나 잘 작동한다는 것을 발견했습니다. 즉, AI에게 성장하는 법을 가르치기 위해 시간을 낭비할 필요 없이, 그냥 지침을 제공하면 된다는 것입니다.

이것이 중요한 이유

이 방법의 아름다움은 오프라인이라는 점입니다. 복잡한 수학과 회전은 모델이 다시 훈련을 시작하기 에 일어납니다. 일단 모델이 성장하면, 특별한 회전 기술들은 모델의 가중치 속으로 "접혀" 들어가며 사라집니다. 이는 AI가 실행될 때 추가적인 컴퓨팅 파워를 필요로 하지 않음을 의미합니다. 그것은 단지 원래의 모델보다 약간 더 크고 똑똑한 버전일 뿐이며, 더 빠르고 저렴하게 학습되었습니다.

요약하자면, 저자는 벽을 허물거나 거주자들을 혼란스럽게 하지 않고 집에 새로운 방을 추가하는 방법을 찾아냈습니다. 정밀한 수학적 회전, 올바른 확장 전략의 혼합, 그리고 볼륨을 천천히 높이는 법을 사용함으로써, 그들은 AI 모델을 효율적으로 키울 수 있으며, 모델의 지능을 온전히 유지하면서 시간과 에너지를 절약할 수 있음을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →