ZAYA1-8B Technical Report
본 논문은 AMD 인프라에서 전적으로 훈련된 8B 파라미터 MoE 추론 모델인 ZAYA1-8B 를 소개하며, 이는 전문화된 4 단계 RL 캐스케이드와 새로운 마르코프 RSA 테스트 시간 계산 방법을 통해 수학 및 코딩 벤치마크에서 최첨단 성능을 달성함으로써 훨씬 더 큰 모델과의 격차를 효과적으로 축소합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
다음은 ZAYA1-8B 기술 보고서를 간단한 언어와 창의적인 비유로 번역한 설명입니다.
큰 그림: 초능력을 가진 작은 뇌
ZAYA1-8B라는 이름의 작지만 지극히 똑똑한 학생을 상상해 보세요. 이 학생의 뇌에는 7 억 개의 활성 뉴런만 있습니다 (인공지능 기준 매우 작은 크기). 하지만 이 학생은 총 80 억 개의 뉴런을 가진 더 큰 '학교'의 일원입니다.
보통 어려운 수학 문제를 풀거나 복잡한 코드를 작성하려면 거대한 뇌 (수십억 개의 매개변수를 가진 대규모 AI) 가 필요합니다. ZAYA1-8B 는 작음에도 불구하고 훨씬 더 큰 '천재' 학생들만큼, 혹은 그보다 더 잘 이러한 어려운 문제들을 해결할 수 있다는 점에서 특별합니다.
어떻게 가능할까요? 세 가지 비밀 병기를 사용하기 때문입니다: 새로운 사고 방식, 특별한 훈련 캠프, 그리고 자신의 작업을 검증하는 독특한 방법입니다.
1. 아키텍처: 전문화된 팀
대부분의 AI 모델은 혼자 모든 일을 하려는 한 사람과 같습니다. 반면 ZAYA1-8B 는 '전문가 혼합 (Mixture of Experts, MoE)'을 사용하여 전문화된 팀처럼 구축되었습니다.
- 팀: 16 명의 다른 선생님 (전문가) 이 있는 교실을 상상해 보세요. 질문이 들어오면 '라우터 (반장)'가 어떤 선생님이 그 질문에 답하는 데 가장 적합한지 결정합니다.
- 새로운 반장 (ZAYA1 라우터): 이전 모델에서 반장은 단순한 규칙 따르기 역할이었습니다. ZAYA1-8B 는 누가 가르쳐야 할지 더 나은 결정을 내리는 더 똑똑하고 다층적인 반장을 사용합니다. 이는 항상 올바른 전문가가 업무를 처리하도록 보장합니다.
- 압축된 도서관 (CCA): 긴 책을 읽거나 긴 이야기를 기억하기 위해 모델은 '압축된 도서관' 시스템을 사용합니다. 모든 책 페이지를 머릿속에 담는 대신, 공간과 에너지를 절약하면서도 모든 중요한 세부 사항을 유지하는 요약된 압축 버전을 저장합니다. 이를 통해 모델은 지치지 않고 매우 긴 대화를 처리할 수 있습니다.
2. 훈련: 말하기 전에 생각하는 법 배우기
이 논문은 이 학생을 추론 기계로 만들기 위해 설계된 독특한 훈련 과정을 설명합니다.
- '답변 보존' 가지치기: 선생님들은 종종 교과서 한 페이지에 담기에는 너무 긴 상세한 설명 (추론 흔적) 을 가지고 있습니다. 이야기의 중간을 잘라내면 (논리를 망가뜨리게 됨) ZAYA1-8B 는 특별한 트릭을 사용합니다: 설명의 끝을 잘라내지만 최종 답변은 유지합니다. 이는 전체 사고 과정이 한 번에 들어맞지 않더라도 모델이 계획하고 생각하는 방법을 가르쳐 줍니다.
- 4 단계 boot 캠프: 기초를 배운 후, 모델은 엄격한 '강화 학습 (RL)' boot 캠프를 거쳤습니다:
- 워밍업: 열심히 생각하는 데 익숙해지기 위해 쉬운 퍼즐과 수학 문제를 풉니다.
- 체육관: 모델이 나아질수록 더 어려워지는 400 개의 다양한 퍼즐 생성기가 있는 맞춤형 환경입니다.
- 메인 이벤트: 실제 수학 및 코딩 도전을 해결합니다. 여기에는 여러 가능한 답변을 생성하고 가장 좋은 것을 선택하는 특별한 '테스트 시간 계산 (TTC)' 단계가 포함됩니다.
- 연마: 좋은 조수처럼 정중하게 대화하고 지시를 따르는 법을 배우는 최종 단계입니다.
3. 비밀 소스: '마르코프ian RSA'(그룹 사고)
이것이 이 논문에서 가장 혁신적인 부분입니다. 보통 AI 가 어려운 문제를 풀 때, 하나의 긴 연속된 흐름으로 답을 생각하려 합니다. 흐름이 너무 길어지면 AI 는 혼란에 빠집니다.
ZAYA1-8B 는 마르코프ian RSA라는 방법을 사용합니다. 이를 비틀린 릴레이 경기로 생각해 보세요:
- 경기: 한 선수가 마라톤 전체를 달리는 대신, 모델은 동시에 16 명의 선수 (후보) 를 보냅니다.
- 계주: 각 선수는 짧고 안전한 거리 (4,000 단어의 '꼬리') 만 달립니다. 그들은 경기의 전체 역사를 운반하지 않고, 다음 라운드로 마지막 몇 걸음 (꼬리) 만 전달합니다.
- 집계: '코치'가 16 명의 선수 모두의 마지막 몇 걸음을 살펴보고, 가장 좋은 아이디어들을 결합하여 다음 라운드로 보냅니다.
- 결과: 사고 과정을 작고 관리 가능한 조각으로 나누고 팀이 가장 좋은 경로를 투표로 결정함으로써, ZAYA1-8B 는 보통 훨씬 더 큰 뇌가 필요했던 AIME 및 HMMT 대회와 같은 매우 어려운 수학 문제를 해결할 수 있습니다.
비유: 거대한 퍼즐을 맞추려 한다고 상상해 보세요.
- 옛 방식: 한 사람이 퍼즐 전체를 한 번에 머릿속에 담으려 합니다. 압도당하게 됩니다.
- ZAYA1-8B 방식: 16 명의 사람을 보내 작은 섹션에서 일하게 합니다. 그들은 자신의 섹션에서 몇 조각만 다음 그룹에 전달합니다. 그룹은 이러한 작은 조각들을 결합하여 전체 그림을 만듭니다. 이는 더 빠르고, 메모리를 덜 사용하며, 더 좋은 결과를 얻습니다.
4. 하드웨어: AMD 기반 구축
전체 모델은 AMD 컴퓨터 칩(특히 MI300X GPU)을 사용하여 훈련되었습니다. 이는 큰 일입니다. 최상위 추론 모델을 훈련시키기 위해 가장 비싸고 독점적인 칩이 필요하지 않다는 것을 입증했기 때문입니다. 팀은 올바른 소프트웨어와 하드웨어 설정을 통해 AMD 칩이 복잡한 AI 훈련의 중량을 견딜 수 있음을 보여주었습니다.
5. 결과: 작지만 강력함
이 논문은 다음과 같은 설정으로 다음과 같은 결과를 주장합니다:
- ZAYA1-8B(07 억 개의 활성 매개변수만 보유) 는 수학 및 코딩 테스트에서 DeepSeek-R1(370 억 개의 활성 매개변수 보유) 을 이기거나 맞먹습니다.
- '마르코프ian RSA' 그룹 사고 방법을 사용할 때, Gemini-2.5 Pro 및 GPT-5-High와 같은 거대하고 비싼 모델과 매우 근접한 점수를 어려운 수학 대회에서 얻습니다.
요약
ZAYA1-8B는 거대한 뇌가 천재가 되기에 필수적이지 않음을 입증하는 작고 효율적인 AI 입니다. 스마트한 팀 구조, 답변을 안전하게 유지하는 특수 훈련 방법, 그리고 사고를 위한 '그룹 릴레이' 전략을 사용하여 더 큰 경쟁자들의 컴퓨팅 파워의 일부만으로도 가장 어려운 수학 및 코딩 문제를 해결할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.