Gemma 4 Technical Report
Gemma 4 기술 보고서는 다양한 아키텍처, 원시 오디오 및 이미지 처리를 위한 인코더 프리(encoder-free) 설계, 그리고 사고 모드(thinking mode)를 특징으로 하는 새로운 세대의 오픈 웨이트 네이티브 멀티모달 모델을 소개하며, 이 모든 요소는 STEM 및 롱 컨텍스트 벤치마크 전반에서 효율성, 추론 및 성능의 상당한 발전을 집단적으로 전달합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
Google DeepMind가 누구나 사용하고, 수정하고, 구축할 수 있는 오픈형 "스마트 어시스턴트"인 Gemma 4 제품군을 막 공개했다고 상상해 보세요. 이것들을 하나의 거대한 로봇이 아니라, 아주 작은 주머니 속의 조력자부터 거대한 슈퍼컴퓨터 수준의 사고가까지 다양한 크기의 뇌들이 담긴 하나의 도구 상자로 생각하면 됩니다.
다음은 Gemma 4를 쉬운 비유를 사용하여 설명한 내용입니다.
1. 다양한 크기의 도구 상자
이전에는 하나의 큰 뇌나 하나의 작은 뇌만을 가질 수 있었습니다. Gemma 4는 다음과 같은 전체 세트를 제공합니다:
- 주머니 속의 조력자 (2.3B 및 4.5B): 이들은 스마트 워치와 같습니다. 거대한 서버 농장이 필요 없이 여러분의 스마트폰이나 노트북에서 실행될 수 있을 만큼 작습니다.
- 워크호스 (1, 12B 및 31B): 이들은 강력한 데스크톱 컴퓨터와 같으며, 복잡한 작업을 처리할 수 있습니다.
- 전문가 (26B-A4B): 이것은 "전문가 혼합(Mixture of Experts)" 모델입니다. 어떤 질문이 주어지든, 가장 관련성이 높은 4명의 전문가가 나와서 대답하는 팀을 상상해 보세요. 이를 통해 매우 똑똑하면서도 놀라운 속도와 효율성을 보여줍니다.
2. "생각하는 모자" (추론 모드)
가장 큰 업그레이드 중 하나는 새로운 **"생각 모드(Thinking Mode)"**입니다.
- 이전: 모델에게 어려운 수학 문제를 물어보면, 즉시 답을 추측했습니다.
- 현재: 모델은 "생각하는 모자"를 씁니다. 최종 답을 적기 전에 (마치 학생이 연습장에 풀이 과정을 적는 것처럼) 스스로에게 먼저 생각을 속삭입니다. 이를 통해 인간이 시간을 들여 생각하는 것과 같이, 까다로운 수학 및 코딩 문제를 훨씬 더 잘 해결할 수 있습니다 있습니다.
3. 안경이나 귀 없이 보고 듣기
이전의 모델들은 사진과 소리를 이해하기 위해 특수한 "안경(비전 인코더)"과 "귀(오디오 인코더)"가 필요했습니다. 이것들은 뇌에 부착된 무겁고 별개인 장치였습니다.
- 새로운 접근 방식: 12B 모델은 인코더가 없는(encoder-free) 방식입니다. 이는 뇌 자체가 직접 보고 듣는 법을 배웠다는 것과 같습니다. 무거운 안경을 쓰는 대신, 이미지의 가공되지 않은 픽셀이나 목소리의 가공되지 않은 파동을 직접 보고 즉각적으로 이해합니다. 이 덕분에 전체 시스템이 더 가볍고, 빠르고, 군더더기가 없어졌습니다.
4. 무한한 도서관 (긴 컨텍스트)
1,000페이지짜리 책을 읽으면서 모든 세부 사항을 기억하려고 노력한다고 상상해 보세요. 이전의 모델들은 "기억의 안개" 현상을 겪으며 책의 끝에 도달할 때쯤이면 앞부분을 잊어버리곤 했습니다.
- 해결책: Gemma 4는 영리한 기억 트릭을 사용합니다. 책을 슬라이딩 윈도우 방식으로 처리합니다: 마지막 몇 페이지는 고해상도로 기억하고(로컬 어텐션), 전체 책에 대해서는 요약된 효율적인 인덱스를 유지합니다(글로벌 어텐션).
- 결과: 이 방식 덕분에 메모리 부족 없이 방대한 양의 텍스트(최대 128k 또는 256k 토큰)를 읽고 기억할 수 있으며, 이전보다 메모리를 37.5% 적게 사용합니다.
5. 경주 속도 높이기 (효율성)
- 미래 예측: 모델은 "드래프터(drafter)" 헤드를 사용합니다. 레이싱 카 드라이버가 운전을 할 뿐만 아니라, 다음 세 번의 커브가 어디서 나타날지 미리 예측하는 것을 상상해 보세요. 이를 통해 모델은 문장의 다음 단어들을 즉각적으로 예측하여 훨씬 빠르게 말할 수 있습니다.
- 두뇌 압축: 팀은 모델을 "양자화(quantized)"하도록 훈련했습니다. 이것은 마치 여행 가방을 싸는 것과 같습니다. 무겁고 부피가 큰 옷(풀 정밀도)을 넣는 대신, 모든 것을 단단히 접어서(압축된 가중치) 작은 가방에 쏙 들어가게 만드는 것입니다. 덕 여러분은 품질 저하 거의 없이 모바일 기기에서 이 모델들을 실행할 수 있습니다.
6. 얼마나 똑똑한가요?
논문에서는 "아레나(Arena)"라고 불리는 블라인드 테스트를 통해 Gemma 4를 다른 최상위 모델들(Claude 또는 DeepSeek 등)과 비교했습니다.
- 결과: 31B 모델은 해당 크기 카테고리에서 최고 순위의 오픈 모델(누구나 다운로드 가능)입니다. 이 모델은 자신보다 10배나 더 큰 모델들과 대등한 성능을 보여줍니다.
- 작은 거인: 아주 작은 2.3B 모델은 이전 세대의 27B 모델만큼 뛰어난 성능을 보여주며, 이는 이전보다 10배 더 효율적임을 의미합니다.
7. 안전과 책임
아이에게 교육 없이 자동차 운전을 맡기지 않듯이, 팀은 Gemma 4의 기초 단계부터 안전성을 구축했습니다.
- 훈련 전 위험하거나 해로운 데이터를 걸러냈습니다.
- 혐오 표현, 위험한 지침 또는 해로운 콘텐츠를 생성하지 않도록 엄격하게 테스트했습니다.
- 이 도구들이 강력하다는 점을 인정하며, 개발자들이 안전을 유지할 수 있도록 가이드라인을 제공하여 책임감 있게 사용하도록 돕습니다.
요약하자면: Gemma 4는 더 빠르고, 추론 능력이 뛰어나며, 직접 보고 들을 수 있고, 방대한 양의 정보를 기억할 수 있는 새로운 세대의 오픈 AI입니다. 그러면서도 여러분의 개인 기기에서 실행될 수 있을 만큼 작습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.