← 최신 논문
💬 NLP

ZAYA1-8B Technical Report

본 논문은 AMD 인프라에서 전적으로 훈련된 8B 파라미터 MoE 추론 모델인 ZAYA1-8B 를 소개하며, 이는 전문화된 4 단계 RL 캐스케이드와 새로운 마르코프 RSA 테스트 시간 계산 방법을 통해 수학 및 코딩 벤치마크에서 최첨단 성능을 달성함으로써 훨씬 더 큰 모델과의 격차를 효과적으로 축소합니다.

원저자: Robert Washbourne, Rishi Iyer, Tomas Figliolia, Henry Zheng, Ryan Lorig-Roach, Sungyeon Yang, Pritish Yuvraj, Quentin Anthony, Yury Tokpanov, Xiao Yang, Ganesh Nanduru, Stephen Ebert, Praneeth Medepal
게시일 2026-05-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Robert Washbourne, Rishi Iyer, Tomas Figliolia, Henry Zheng, Ryan Lorig-Roach, Sungyeon Yang, Pritish Yuvraj, Quentin Anthony, Yury Tokpanov, Xiao Yang, Ganesh Nanduru, Stephen Ebert, Praneeth Medepalli, Skyler Szot, Srivatsan Rajagopal, Alex Ong, Bhavana Mehta, Beren Millidge

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 ZAYA1-8B 기술 보고서를 간단한 언어와 창의적인 비유로 번역한 설명입니다.

큰 그림: 초능력을 가진 작은 뇌

ZAYA1-8B라는 이름의 작지만 지극히 똑똑한 학생을 상상해 보세요. 이 학생의 뇌에는 7 억 개의 활성 뉴런만 있습니다 (인공지능 기준 매우 작은 크기). 하지만 이 학생은 총 80 억 개의 뉴런을 가진 더 큰 '학교'의 일원입니다.

보통 어려운 수학 문제를 풀거나 복잡한 코드를 작성하려면 거대한 뇌 (수십억 개의 매개변수를 가진 대규모 AI) 가 필요합니다. ZAYA1-8B 는 작음에도 불구하고 훨씬 더 큰 '천재' 학생들만큼, 혹은 그보다 더 잘 이러한 어려운 문제들을 해결할 수 있다는 점에서 특별합니다.

어떻게 가능할까요? 세 가지 비밀 병기를 사용하기 때문입니다: 새로운 사고 방식, 특별한 훈련 캠프, 그리고 자신의 작업을 검증하는 독특한 방법입니다.


1. 아키텍처: 전문화된 팀

대부분의 AI 모델은 혼자 모든 일을 하려는 한 사람과 같습니다. 반면 ZAYA1-8B 는 '전문가 혼합 (Mixture of Experts, MoE)'을 사용하여 전문화된 팀처럼 구축되었습니다.

  • 팀: 16 명의 다른 선생님 (전문가) 이 있는 교실을 상상해 보세요. 질문이 들어오면 '라우터 (반장)'가 어떤 선생님이 그 질문에 답하는 데 가장 적합한지 결정합니다.
  • 새로운 반장 (ZAYA1 라우터): 이전 모델에서 반장은 단순한 규칙 따르기 역할이었습니다. ZAYA1-8B 는 누가 가르쳐야 할지 더 나은 결정을 내리는 더 똑똑하고 다층적인 반장을 사용합니다. 이는 항상 올바른 전문가가 업무를 처리하도록 보장합니다.
  • 압축된 도서관 (CCA): 긴 책을 읽거나 긴 이야기를 기억하기 위해 모델은 '압축된 도서관' 시스템을 사용합니다. 모든 책 페이지를 머릿속에 담는 대신, 공간과 에너지를 절약하면서도 모든 중요한 세부 사항을 유지하는 요약된 압축 버전을 저장합니다. 이를 통해 모델은 지치지 않고 매우 긴 대화를 처리할 수 있습니다.

2. 훈련: 말하기 전에 생각하는 법 배우기

이 논문은 이 학생을 추론 기계로 만들기 위해 설계된 독특한 훈련 과정을 설명합니다.

  • '답변 보존' 가지치기: 선생님들은 종종 교과서 한 페이지에 담기에는 너무 긴 상세한 설명 (추론 흔적) 을 가지고 있습니다. 이야기의 중간을 잘라내면 (논리를 망가뜨리게 됨) ZAYA1-8B 는 특별한 트릭을 사용합니다: 설명의 을 잘라내지만 최종 답변은 유지합니다. 이는 전체 사고 과정이 한 번에 들어맞지 않더라도 모델이 계획하고 생각하는 방법을 가르쳐 줍니다.
  • 4 단계 boot 캠프: 기초를 배운 후, 모델은 엄격한 '강화 학습 (RL)' boot 캠프를 거쳤습니다:
    1. 워밍업: 열심히 생각하는 데 익숙해지기 위해 쉬운 퍼즐과 수학 문제를 풉니다.
    2. 체육관: 모델이 나아질수록 더 어려워지는 400 개의 다양한 퍼즐 생성기가 있는 맞춤형 환경입니다.
    3. 메인 이벤트: 실제 수학 및 코딩 도전을 해결합니다. 여기에는 여러 가능한 답변을 생성하고 가장 좋은 것을 선택하는 특별한 '테스트 시간 계산 (TTC)' 단계가 포함됩니다.
    4. 연마: 좋은 조수처럼 정중하게 대화하고 지시를 따르는 법을 배우는 최종 단계입니다.

3. 비밀 소스: '마르코프ian RSA'(그룹 사고)

이것이 이 논문에서 가장 혁신적인 부분입니다. 보통 AI 가 어려운 문제를 풀 때, 하나의 긴 연속된 흐름으로 답을 생각하려 합니다. 흐름이 너무 길어지면 AI 는 혼란에 빠집니다.

ZAYA1-8B 는 마르코프ian RSA라는 방법을 사용합니다. 이를 비틀린 릴레이 경기로 생각해 보세요:

  • 경기: 한 선수가 마라톤 전체를 달리는 대신, 모델은 동시에 16 명의 선수 (후보) 를 보냅니다.
  • 계주: 각 선수는 짧고 안전한 거리 (4,000 단어의 '꼬리') 만 달립니다. 그들은 경기의 전체 역사를 운반하지 않고, 다음 라운드로 마지막 몇 걸음 (꼬리) 만 전달합니다.
  • 집계: '코치'가 16 명의 선수 모두의 마지막 몇 걸음을 살펴보고, 가장 좋은 아이디어들을 결합하여 다음 라운드로 보냅니다.
  • 결과: 사고 과정을 작고 관리 가능한 조각으로 나누고 팀이 가장 좋은 경로를 투표로 결정함으로써, ZAYA1-8B 는 보통 훨씬 더 큰 뇌가 필요했던 AIME 및 HMMT 대회와 같은 매우 어려운 수학 문제를 해결할 수 있습니다.

비유: 거대한 퍼즐을 맞추려 한다고 상상해 보세요.

  • 옛 방식: 한 사람이 퍼즐 전체를 한 번에 머릿속에 담으려 합니다. 압도당하게 됩니다.
  • ZAYA1-8B 방식: 16 명의 사람을 보내 작은 섹션에서 일하게 합니다. 그들은 자신의 섹션에서 몇 조각만 다음 그룹에 전달합니다. 그룹은 이러한 작은 조각들을 결합하여 전체 그림을 만듭니다. 이는 더 빠르고, 메모리를 덜 사용하며, 더 좋은 결과를 얻습니다.

4. 하드웨어: AMD 기반 구축

전체 모델은 AMD 컴퓨터 칩(특히 MI300X GPU)을 사용하여 훈련되었습니다. 이는 큰 일입니다. 최상위 추론 모델을 훈련시키기 위해 가장 비싸고 독점적인 칩이 필요하지 않다는 것을 입증했기 때문입니다. 팀은 올바른 소프트웨어와 하드웨어 설정을 통해 AMD 칩이 복잡한 AI 훈련의 중량을 견딜 수 있음을 보여주었습니다.

5. 결과: 작지만 강력함

이 논문은 다음과 같은 설정으로 다음과 같은 결과를 주장합니다:

  • ZAYA1-8B(07 억 개의 활성 매개변수만 보유) 는 수학 및 코딩 테스트에서 DeepSeek-R1(370 억 개의 활성 매개변수 보유) 을 이기거나 맞먹습니다.
  • '마르코프ian RSA' 그룹 사고 방법을 사용할 때, Gemini-2.5 ProGPT-5-High와 같은 거대하고 비싼 모델과 매우 근접한 점수를 어려운 수학 대회에서 얻습니다.

요약

ZAYA1-8B는 거대한 뇌가 천재가 되기에 필수적이지 않음을 입증하는 작고 효율적인 AI 입니다. 스마트한 팀 구조, 답변을 안전하게 유지하는 특수 훈련 방법, 그리고 사고를 위한 '그룹 릴레이' 전략을 사용하여 더 큰 경쟁자들의 컴퓨팅 파워의 일부만으로도 가장 어려운 수학 및 코딩 문제를 해결할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →