← 최신 논문
💬 NLP

Growing Transformers: Modular Composition and Layer-wise Expansion on a Frozen Substrate

본 논문은 제한된 활성 파라미터 예산 하에 동결된 기저에 새로운 블록을 적층함으로써 디코더 전용 트랜스포머가 효과적으로 계속 학습할 수 있음을 입증하여, 낮은 랭크의 이진 토큰 인터페이스와 같은 극단적인 제약 조건 하에서도 모듈식 계층별 확장의 실현 가능성을 입증하되, 완전하게 학습 가능한 모놀리식 모델에 비해 최종 퍼플렉시티에서 일부 트레이드오프가 있음을 보여줍니다.

원저자: A. Bochkov

게시일 2026-05-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: A. Bochkov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

고층 빌딩을 짓고 있다고 상상해 보세요. 하지만 매우 엄격한 규칙이 하나 있습니다: 어떤 때든 최상층에서만 작업할 수 있습니다. 한 층이 완성되면 콘크리트로 밀봉하고 문을 잠근 뒤, 수정이나 변경을 위해 다시 들어가는 것은 절대 허용되지 않습니다. 또한 건설 인력에 대한 예산이 제한되어 있어, 층을 추가할 때마다 새로운 인력을 고용할 수 없습니다. 대신 작은 팀을 새로운 층으로 이동시킬 뿐입니다.

이 논문은 다음과 같은 간단한 질문을 던집니다: 이러한 극단적인 규칙 하에서도 여전히 유용하고 높은 고층 빌딩을 지을 수 있을까요?

일상적인 비유를 사용하여 이 연구의 내용을 다음과 같이 정리해 보겠습니다:

1. "동결된 기초" 문제

일반적으로 거대한 AI(대형 언어 모델 등) 를 훈련할 때, 컴퓨터는 학습 과정에서 건물의 모든 단일 부분을 어떻게 조정할지 기억해야 합니다. 이는 모든 벽돌에 대한 설계도를 저장할 거대한 창고가 필요할 정도로 막대한 양의 메모리를 요구합니다.

연구자들은 "활성" 부분 (변경 가능한 부분) 을 작고 일정하게 유지하면서 모델을 훈련시킬 수 있는지 확인하고자 했습니다.

  • 전략: 작은 건물로 시작합니다. 이를 훈련시킨 후 동결 (잠금) 합니다. 그다음, 최상층에 새로운 층을 추가하고 오직 그 새로운 층만 훈련시킵니다.
  • 단점: 그들은 이전 층으로 돌아가 수정을 가하지 않습니다. 또한 건물이 얼마나 높아지든 "작업자" (학습 가능한 매개변수) 의 수를 대략 일정하게 유지합니다.

2. "고장 난 엘리베이터" 테스트

이 아이디어를 극한으로 시험해 보기 위해 연구자들은 극단적인 시나리오를 만들었습니다. 건물이 거리와 연결되는 1 층 (지하층) 이 고장 났다고 상상해 보세요.

  • 설정: 풍부하고 상세한 입구 대신, 건물이 어느 방에 있는지 식별하기 위해 16 비트 이진 코드 (단순한 "켜기/끄기" 스위치 같은 것) 만을 갖습니다. 이는 매우 열악하고 저품질의 인터페이스입니다.
  • 질문: 입구가 너무 열악하고 하부 층이 완전히 동결되어 있다면, 상부 층은 여전히 복잡한 작업을 학습할 수 있을까요?
  • 결과: 놀랍게도 그렇습니다. 이 끔찍하고 동결된 입구에도 불구하고 AI 는 더 높이 성장하고 유용한 것을 학습할 수 있었습니다. 이는 전체 건물이 작동하려면 완벽하고 유연한 입구가 반드시 필요하지 않음을 증명했습니다. 상부 층은 받은 제한된 정보를 어떻게 해석할지 스스로 찾아낼 수 있습니다.

3. "리노베이션" 타협 (LoRA)

더 긴 실험에서 연구자들은 하부 층이 너무 동결되면 건물이 다소 경직된다는 것을 깨달았습니다. "작은 예산" 규칙을 깨지 않고 이를 해결하기 위해 LoRA라는 기법을 사용했습니다.

  • 비유: LoRA 는 모든 층의 벽에 얇고 유연한 발판이나 포스트잇을 추가하는 것과 같습니다. 벽 자체를 재건축하는 것은 아닙니다 (주 구조는 여전히 동결되어 있음) 하지만, 방들이 어떻게 연결되는지에 대한 작은 임시 조정을 가할 수 있습니다.
  • 이익: 이를 통해 모델은 거대한 건물 전체를 잠금 해제하고 재훈련할 필요 없이 전역적으로 "재조정"할 수 있게 되었습니다.

4. 트레이드오프: 품질 대 효율성

이 논문은 결과에 대해 매우 솔직합니다. 이 방법이 모든 층을 한 번에 조정할 수 있는 표준적인 건축 방식보다 낫다고 주장하지는 않습니다.

  • 표준 방식: 메모리와 자금이 충분하다면, 전체를 한 번에 건축하는 방식 (모놀리식 훈련) 이 약간 더 "똑똑한" 건물 (더 낮은 퍼플렉시티, 더 좋은 점수) 을 만들어냅니다.
  • 새로운 방식: "단계별 성장" 방식은 약간 덜 완벽하지만 훨씬 효율적인 건물을 만들어냅니다. 이는 훨씬 적은 수의 "활성 작업자" (실험에서 2 억 4,700 만 개 대비 약 1 억 500 만 개) 를 사용하며 더 적은 메모리를 요구합니다.

결론

이 논문은 매우 엄격한 제약 하에서도 유용한 학습이 발생할 수 있음을 결론짓습니다.

  • 모델의 하부를 동결 상태로 유지할 수 있습니다.
  • 학습 가능한 부분의 수를 작게 유지할 수 있습니다.
  • 매우 열악하고 고정된 입력 인터페이스로 시작할 수도 있습니다.

이것이 가장 똑똑한 AI 를 만드는 "최고"의 방법은 아니지만, 건물의 전체를 잠금 해제하지 않고도 유용한 높이를 계속 추가할 수 있음을 증명합니다. 메모리가 부족하거나 막대한 계산 비용 없이 모델을 단계별로 성장시키고자 하는 상황에 실행 가능한 전략입니다.

이 논문이 말하지 않는 것:

  • 이것이 범용 AI 를 구축하는 최선의 방법이라고 주장하지 않습니다.
  • 이 방법이 가능한 최고 수준의 지능을 산출한다고 주장하지 않습니다.
  • 추가 테스트 없이 임상 또는 상업적 배포에 바로 준비되었다고 제안하지 않습니다.

이 논문은 단순히 엄격한 메모리 및 훈련 규칙에 의해 수갑을 찬 상태에서도 성장이 가능함을 증명할 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →