← 최신 논문
💬 NLP

DiffusionGemma Technical Report

DiffusionGemma는 Gemma 4 아키텍처를 연산 효율적인 2단계 파이프라인으로 미세 조정하여 병렬 블록 단위 이산 확산(parallel block-wise discrete diffusion)을 가능하게 함으로써, 추론 속도와 모델 능력 사이의 트레이드오프에 대한 새로운 파레토 프런티어를 구축하고 초당 약 1,500 토큰이라는 독보적인 텍스트 생성 속도를 달성한 오픈 웨이트 언어 모델입니다.

원저자: DiffusionGemma Team, Adrien Ali Taïga, James Assiene, Daniele Calandriello, Rahma Chaabouni, João Gante, Tamara von Glehn, Nate Keating, Chris Knutsen, Martin Kukla, Tianlin Liu, Ivan Lobov, Ofir Naba
게시일 2026-08-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: DiffusionGemma Team, Adrien Ali Taïga, James Assiene, Daniele Calandriello, Rahma Chaabouni, João Gante, Tamara von Glehn, Nate Keating, Chris Knutsen, Martin Kukla, Tianlin Liu, Ivan Lobov, Ofir Nabati, João Gabriel Oliveira, Nicolas Perez-Nieves, Nastasia Prutianova, Bobak Shahriari, Jean Tarbouriech, Pavel Tyletski, Çağlar Ünlü, Cindy Wu, Glenn Cameron, Jerome Connor, Sertan Girgin, Maarten Grootendorst, Alon Levkovitch, Eliya Nachmani, Omar Sanseviero, Piotr Stanczyk, Quentin Berthet, Andrew Campbell, Clément Crepy, Valentin De Bortoli, Arnaud Doucet, Romuald Elie, Alexandre Galashov, Klaus Greff, Alexis Jacq, David Ruhe, Yu-Han Wu, Sebastian Flennerhag, Brendan O'Donoghue, George Scrivener, Shantanu Thakoor

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 이야기를 쓰려고 노력하고 있지만, 왼쪽에서 오른쪽으로 한 번에 한 글자씩만 써야 하며, 절대 뒤를 돌아보거나 생각을 바꿀 수 없는 상황을 상상해 보십시오. 만약 첫 문장에서 실수를 한다면, 당신은 그 오류를 나중에 더 많은 단어를 추가하여 해결하기를 바라며 나머지 책을 계속 써 내려가야 합니다. 이것이 현재 대부분의 현대적인 "스마트" 컴퓨터 프로그램, 즉 대규모 언어 모델(LLM)이 작동하는 방식입니다. 이들은 마치 백스페이스 키를 누를 수 없는 매우 빠른 타자수와 같습니다. 이들은 매우 뛰어나지만, 이 "일방향" 규칙은 그들의 뇌에 교통 체증을 일으킵니다. 다음 단어를 쓰고 싶을 때마다 그들은 멈춰서 방금 쓴 모든 것을 기억하고 다음 단계를 계산해야 합니다. 이 때문에 그들은 느려집니다. 특히 당신이 그들을 사용하는 유일한 사용자일 때, 컴퓨터는 미래를 생각하는 것보다 과거를 기억하는 데 더 많은 시간을 소비하기 때문입니다.

과학자들은 이 컴퓨터들이 글자를 대신하여 "블록" 단위로 글을 쓸 수 있도록 하는 방법을 찾아왔습니다. 이는 인간이 초안을 편집하는 것처럼 앞을 내다보고 실수를 바로잡을 수 있게 해줍니다. 이 아이디어를 "확산(diffusion)"이라고 부릅니다. 이것은 안개로 뒤덮인 돌덩어리에서 시작하는 조각가와 같습니다. 조각가는 한 번에 아주 작은 조각을 깎아내는 대신, 전체 블록을 보고 조각상이 어디에 있어야 할지 짐작한 뒤, 전체 형상에서 안개를 한꺼번에 걷어냅니다. 그들은 이 과정을 반복하며 점점 더 선명하게 만들어가고, 마침내 조각상이 완벽해질 때까지 진행합니다. 이 논문은 이 "안개 제거" 방식을 사용하여 매우 빠르게 텍스트를 생성하면서도, 어려운 수학 문제를 풀거나 코드를 작성할 수 있을 만큼 똑똑한 새로운 모델인 DiffusionGemma를 소개합니다.

새로운 "안개 제거" 작가

Google DeepMind의 연구진은 기존의 "한 번에 한 단어씩" 규칙을 깨뜨리는 실험적인 컴퓨터 모델인 DiffusionGable을 구축했습니다. DiffusionGemma는 문장을 한 글자씩 쓰는 대신, 256단어의 큰 덩어리로 한꺼번에 작성합니다. 노트의 한 페이지를 채우는 일을 상상해 보십시오. 기존의 방식은 펜에 잉크를 찍고, 한 단어를 쓰고, 펜을 들고, 생각하고, 다시 잉크를 찍고 다음 단어를 쓰는 것과 같습니다. DiffusionGemme는 한 단락을 즉시 찍어내는 도장을 가진 것과 같습니다. 만약 도장이 실수를 한다면, 단순히 계속 진행하는 것이 아니라, 단락 전체를 번지게 만든 뒤 무엇을 그려야 할지 더 명확한 그림을 가지고 다시 찍어냅니다. 이 모델은 단어들이 제자리에 딱 들어맞을 때까지 전체 텍스트 블록을 병렬적으로 반복해서 정제합니다.

연구팀은 이 모델을 처음부터 만들지 않았습니다. 그들은 매우 똑똑한 기존 모델인 Gemma 4(전체 파라미터 약 252억 개, 그중 한 번에 활성화되는 파라미터는 38억 개)에서 시작하여 새로운 기술을 가르쳤습니다. 그들은 두 단계의 훈련 과정을 사용했습니다. 첫째, 모델에게 텍스트를 "노이즈 제거(denoise)"하는 법을 보여주며, 엉망으로 뒤섞인 단어 덩어리를 보고 어떻게 깨끗한 문장이 되어야 하는지 파악하도록 가르쳤습니다. 둘 تعداد째, "강화 학습"과 "샘플러 증류(sampler distillation)"가 결려된 특수한 종류의 방법을 사용했습니다. 이것은 모델에게 단순히 "잘했어"라고 말하는 것이 아니라, 일을 어떻게 더 빨리 끝낼 수 있는지 가르치는 코치와 같습니다. 코치는 모델이 더 똑똑해지도록 밀어붙이는 동시에, 충분히 확신이 들면 텍스트 정제를 멈추도록 가르쳐 시간을 절약하게 합니다.

압도적인 속도

결과는 놀랍습니다. 하나의 강력한 컴퓨터 칩인 NVIDIA H100 GPU에서, DiffusionGemma는 초당 약 1,500단어를 생성할 수 있습니다. 이를 비교해 보자면, 가장 빠른 기술을 사용한 기존의 "올드 스쿨" 모델들도 보통 초당 약 300단어 정도를 처리합니다. DiffusionGemma는 표준 버전보다 약 5배 빠르며, 현재 비공개 유료 결제 뒤에 숨겨져 있는 다른 빠른 모델들보다 약 2.5배 빠릅니다.

이 논문은 이것이 단순히 모델을 멍청하게 만드는 속도 트릭이 아님을 보여줍니다. 비록 원래의 Gemma 4 모델과 비교했을 때 매우 어려운 추론 작업에서는 약간 덜 완벽할 수 있지만, 여전히 믿기 힘들 정도로 유능합니다. 이 모델은 복잡한 수학 문제를 풀고, 코드를 작성하며, 심지어 이미지를 이해할 수도 있습니다. 연구진은 256개의 단어 블록으로 작성함으로써, 모델이 한 번의 "사고 단계"마다 약 20단어를 생성할 수 있다는 것을 발견했습니다. 반면 기존 모델들은 보통 한 단계당 1단어만을 생성합니다. 이 엄청난 효율성 덕분에 컴퓨터를 느려지게 만드는 메모리 병목 현상을 우회할 수 있습니다.

이것이 중요한 이유 (그리고 아직 할 수 없는 것)

이 논문은 이 접근 방식이 우리가 AI를 사용하는 방식에 새로운 문을 열어준다고 제안합니다. 모델이 텍스트를 매우 빠르게 생성할 수 있기 때문에, 실시간 대화나 의사가 순식간에 보고서를 작성하는 것을 돕는 일처럼 즉각적인 답변이 필요한 분야에 사용될 수 있습니다. 연구진은 또한 이 모델이 유연하다는 것을 보여주었습니다. 필요하다면 기존의 "한 번에 한 단어씩" 스타일로 여전히 글을 쓸 수 있으며, "생각하는" 모드(답변을 계획하는 모드)와 "빠른" 모드 사이를 전환할 수도 있습니다.

하지만 저자들은 이것이 실험적인 출시라는 점을 주의 깊게 언급합니다. 아직 기존 모델을 완벽하게 대체할 수 있는 것은 아닙니다. 그들은 모델이 때때로 반복적인 루프(예를 들어 "the the the"를 계속 반복하는 것)에 빠지거나, 원래 모델보다 약간 짧고 간결한 답변을 내놓는다는 점을 인정합니다. 또한, 한 명의 사용자가 사용할 때는 매우 빠르지만, 수백 명의 사용자가 동시에 접속하려고 하면 기존의 "한 단어씩" 모델이 결국 속도 면에서 따라잡을 수도 있다고 언급했습니다. 하지만 현재로서 DiffusionGemma는 극도의 속도와 높은 지능 중 하나를 선택해야 한다는 오래된 규칙을 깨뜨리며, 두 가지를 모두 가질 수 있음을 입증하여 새로운 "경계"를 구축했습니다.

요약하자면, DiffusionGemma는 컴퓨터로 글을 쓰는 미래가 느리고 신중한 행진이 아니라, 전체 그림에서 안개를 한꺼번에 걷어내며 아이디어를 신속하고 동시에 정제하는 과정이 될 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →