← 최신 논문
💬 NLP

Efficient Pre-Training with Token Superposition

본 논문은 모델 아키텍처나 병렬 처리 방식을 변경하지 않고, 효율적인 멀티-핫 교차 엔트로피 훈련을 위해 초기에 토큰을 묶음으로 결합한 후 표준 훈련으로 복귀하는 방식으로 사전 훈련 데이터 처리량을 크게 향상시키고 전체 훈련 시간을 최대 2.5 배까지 단축시키는 플러그인 방식인 토큰-중첩 훈련 (TST) 을 소개합니다.

원저자: Bowen Peng, Théo Gigant, Jeffrey Quesnelle

게시일 2026-05-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bowen Peng, Théo Gigant, Jeffrey Quesnelle

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Efficient Pre-Training with Token Superposition"이라는 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 정리해 드립니다.

큰 문제: AI 학습은 모래밭에서 마라톤을 뛰는 것과 같습니다

한 학생 (대형 언어 모델) 이 읽고 쓰는 법을 가르치려 한다고 상상해 보세요. 이를 위해 수백만 권의 책을 보여줘야 합니다. 하지만 현재의 학습 방식은 놀라울 정도로 느리고 비용이 많이 듭니다. 마치 학생에게 무거운 배낭을 지우고 책의 모든 단어를 하나씩 읽게 하는 것과 같습니다. 그들은 지쳐버립니다 (계산 비용이 많이 듭니다) 그리고 도서관을 끝내는 데는 영원히 걸립니다.

연구자들은 학생의 뇌 (모델 아키텍처) 나 그들이 읽는 책 (데이터) 을 바꾸지 않고 이 과정을 더 빠르게 만들고자 합니다.

해결책: "토큰 중첩 학습 (Token Superposition Training, TST)"

저자들은 토큰 중첩 학습 (TST) 이라는 교묘한 2 단계 학습 방법을 제안합니다. 이를 "속독" 단계와 이어지는 "미세 조정" 단계로 생각할 수 있습니다.

1 단계: "스무디" 단계 (중첩)

기존 학습에서 AI 는 한 번에 한 단어씩 (예: "The", 그다음 "cat", 그다음 "sat") 을 보며 학습합니다.

중첩 단계에서는 AI 가 단어 한 개가 아닌 단어 한 "가방" 전체를 한 번에 보도록 가르칩니다.

  • 비유: "The cat sat on the mat"이라는 문장을 읽는 대신, 교사가 학생에게 그 단어들이 섞인 블렌더를 건네는 상황을 상상해 보세요. 학생은 개별 단어를 보지 않고 "The + cat + sat"으로 만든 "스무디"를 봅니다.
  • 작동 원리: 컴퓨터는 8 개의 단어 (한 "가방") 를 가져와 그 의미를 하나의 "슈퍼 단어"로 섞어 합친 뒤, AI 에게 다음 8 단어 "가방"이 무엇일지 예측하게 합니다.
  • 이점: AI 가 8 개의 단어를 1 개처럼 처리하기 때문에, 추가적인 컴퓨터 전력을 사용하지 않고도 데이터를 8 배 빠르게 "읽을" 수 있습니다. 마치 학생이 예전에 1 페이지를 읽는 시간에 이제 8 페이지를 읽는 것과 같습니다.

2 단계: "미세 이빨 빗" 단계 (회복)

만약 AI 를 "스무디"만으로만 학습시켰다면, 정상적인 문장을 작성하는 데는 매우 형편없었을 것입니다. 단어 순서를 모르게 되고, 출력물은 말도 안 되는 소리가 될 것입니다.

그래서 일정 시간 (보통 전체 학습 시간의 약 30%) 이 지난 후, 연구자들은 "스무디" 단계를 중단합니다.

  • 비유: 그들은 표준 방식으로 전환합니다. 이제 언어의 일반적인 구조를 매우 빠르게 학습한 AI 의 뇌를 일반 교실로 되돌려 놓습니다. 블렌더 사용을 멈추고 다시 개별 단어를 보여주기 시작합니다.
  • 결과: AI 가 1 단계에서 이미 "큰 그림"을 매우 효율적으로 학습했기 때문에, 매우 빠르게 회복합니다. 이는 처음부터 "느린 방식"으로 학습한 모델들의 성능을 따라잡고 종종 능가합니다.

이것이 중요한 이유

이 논문은 이 방법이 "즉시 적용 가능한 (drop-in)" 해결책이라고 주장합니다. AI 의 뇌, 컴퓨터 칩, 또는 책을 바꿀 필요가 없습니다. 학습 초기 부분에서 데이터를 어떻게 공급하는지 방식만 바꾸면 됩니다.

  • 속도 향상: 100 억 개 파라미터를 가진 대형 모델로 테스트한 결과, 이 방법은 표준 학습에 비해 절반의 시간 (2.5 배 속도 향상) 에 동일한 수준의 지능을 달성할 수 있게 했습니다.
  • 절충점: 그들은 "데이터 소비"를 "속도"와 교환합니다. AI 는 같은 시간 동안 더 많은 데이터를 읽지만, 이를 "가방" 단위로 읽기 때문에 패턴을 더 빠르게 학습합니다.

이 논문이 주장하지 않는 것

저자들이 실제로 말한 내용에 충실하는 것이 중요합니다:

  • 최종 제품을 바꾸지 않습니다: 학습이 완료되면 AI 는 일반 AI 와 정확히 동일합니다. 여전히 일관된 문장, 코드, 이야기를 작성할 수 있습니다. "스무디" 트릭은 학습 과정 중에만 사용됩니다.
  • "더 빠르게 생각"하는 것이 아닙니다: 이는 학습 에 AI 의 추론 능력이나 복잡한 수학 문제 해결 능력을 더 똑똑하게 만드는 것이 아닙니다. 단지 학습 과정 자체를 더 효율적으로 만들 뿐입니다.
  • 모든 것에 대한 만능 해결책은 아닙니다: 저자들은 2 억 7 천만 개 파라미터 (소형) 에서 100 억 개 파라미터 (대형) 에 이르는 모델들에서 이를 테스트했습니다. 전반적으로 잘 작동했지만, 무한한 데이터와 시간이 있다면 그 이점이 다르게 보일 수 있다고 지적합니다.

요약

TST 를 AI 를 위한 속독 과정으로 생각하세요.

  1. 먼저, 스킴하는 법을 가르칩니다: 텍스트 덩어리들을 섞어서 보여줌으로써 언어의 일반적인 분위기를 매우 빠르게 흡수하게 합니다.
  2. 그런 다음, 정상적으로 읽는 법을 가르칩니다: 기술을 다듬기 위해 다시 단어별 읽기로 전환합니다.

결과는 무엇일까요? AI 는 같은 양의 에너지를 사용하면서 기록적인 시간 안에 "교육"을 마치고, 느리고 전통적인 경로를 택한 이들만큼 똑똑해지거나 (혹은 더 똑똑해집니다).

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →