DiffusionGemma Technical Report
DiffusionGemmaは、Gemma 4アーキテクチャを計算効率の高い2段階のパイプラインで微調整することで、並列的なブロック単位の離散拡散を可能にし、約1,500トークン/秒という極めて高いテキスト生成速度を実現したオープンウェイトの言語モデルであり、これにより推論速度とモデル能力のトレードオフにおける新たなパレート境界を確立しています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは物語を書こうとしていると想像してください。しかし、あなたは一文字ずつ、左から右へと、決して戻ったり考えを変えたりすることなく書かなければならないという制約があります。もし最初の文章で間違いを犯したら、その間違いを後の言葉で修正することを願いながら、その間違いを抱えたまま本を書き続けなければなりません。これが、現在のほとんどの「スマート」なコンピュータプログラム、すなわち大規模言語モデル(LLM)が実際に動いている仕組みです。彼らは、バックスペースキーを押すことができない、非常に速いタイピストのようなものです。彼らは極めて優秀ですが、この「一方通行」のルールが、彼らの脳内に交通渋滞を引き起こします。次の単語を書こうとするたびに、彼らは立ち止まり、これまでに書いたすべてを思い出し、次のステップを計算しなければなりません。このことが、特にあなた一人だけが使っている場合に、彼らを遅くさせます。なぜなら、コンピュータは未来について考えるよりも、過去を思い出すことに時間を費やしているからです。
科学者たちは、これらのコンピュータに文字単位ではなく「ブロック」単位で書かせ、人間が下書きを編集するように、先を見通して間違いを修正できるようにする方法を探してきました。このアイデアは「拡散(ディフュージョン)」と呼ばれています。これは、石の塊に霧がかかっている状態から彫刻家が始める様子を想像してみてください。一つひとつ小さな破片を削り取るのではなく、彫刻家は塊全体を見渡し、彫刻がどこにあるべきかを推測し、形全体から一気に霧を晴らしていきます。彼らはこれを繰り返し、形がどんどん鮮明になり、最終的に彫刻が完璧になるまで続けます。この論文では、この「霧を晴らす」手法を用いて、高度な数学の問題を解いたりコードを書いたりする知性を保ちつつ、驚異的な速さでテキストを生成しようとする新しいモデル、DiffusionGemmaを紹介しています。
新しい「霧を晴らす」書き手
Google DeepMindの研究者たちは、従来の「一単語ずつ」というルールを打ち破る実験的なコンピュータモデル、DiffusionGemmaを構築しました。DiffusionGemmaは、文章を一文字ずつ書く代わりに、256単語という大きな塊で一度に書き上げます。ノートにページを埋める様子を想像してみてください。従来の方法は、インクにペンを浸し、一つの単語を書き、ペンを上げ、考え、再びインクに浸して次の単語を書くようなものです。DiffusionGemmaは、パラグラフ全体を一瞬で印刷するスタンプを持っているようなものです。もしスタンプが間違いを犯しても、ただそのまま進むのではなく、パラグラフ全体を塗りつぶし、今度はそれがどうあるべきかというより鮮明なイメージを持って、再びスタンプを押します。これを何度も繰り返し、言葉がピタリと収まるまで、テキストのブロック全体を並列的に洗練させていくのです。
チームはこのモデルをゼロから作ったわけではありません。彼らは、非常にスマートな既存のモデルであるGemma 4(総パーツ数は約252億、同時にアクティブになるのは38億)をベースにし、そこに新しいテクニックを教え込みました。彼らは二段階のトレーニングプロセスを用いました。第一に、モデルにテキストの「デノイジング(ノイズ除去)」を教え、乱雑でバラバラになった言葉の塊を見て、それがどのようにクリーンな文章になるべきかを判断できるようにしました。第二に、「強化学習」と「サンプラー蒸留(sampler distillation)」を組み合わせた特殊な手法を用いました。これは、単にモデルに「よくできました」と言うだけでなく、仕事をどのように早く終わらせるかを教えるコーチのようなものです。コーチは、モデルがより賢くなるよう促すと同時に、自信を持てた瞬間にテキストの洗練を止める方法を教え、時間を節約させます。
圧倒的なスピード
結果は驚くべきものです。強力なコンピュータチップであるNVIDIA H100 GPU上で、DiffusionGemmaは約1,500単語/秒の速度で生成できます。比較のために言えば、最高速のテクニックを備えた従来の「旧式」モデルであっても、通常は300単語/秒程度しか出せません。DiffusionGemmaは標準的なバージョンよりも約5倍速く、現在プライベートなペイウォールの背後に隠されている他の高速モデルよりも約2.5倍速いのです。
この論文は、これが単にモデルを愚かにするだけのスピード向上テクニックではないことを示しています。元のGemma 4モデルと比較すると、非常に難しい推論タスクにおいてはわずかに精度が落ちることもありますが、それでも依然として驚くほど有能です。複雑な数学の問題を解き、コードを書き、画像さえも理解することができます。研究者たちは、256単語のブロックで書くことにより、従来のモデルが通常1ステップにつき1単語しか生成できないのに対し、DiffusionGemaは1つの「思考ステップ」につき約20単語を生成できることを見出しました。この圧倒的な効率性により、コンピュータを遅延させるメモリのボトルネックを回避することができます。
なぜこれが重要なのか(そして現時点での限界)
この論文は、このアプローチがAIの活用における新しい扉を開くことを示唆しています。モデルがテキストを極めて迅速に生成できるため、リアルタイムの会話や、医師がレポートを瞬時に作成するのを支援する場合など、即時性が求められる用途に使用できます。また、研究者たちはこのモデルが柔軟であることも示しました。必要に応じて従来の「一単語ずつ」のスタイルで書くこともできますし、「思考モード(答えを計画するモード)」と「高速モード」を切り替えることも可能です。
しかし、著者たちはこれがあくまで実験的なリリースであることを強調しています。これはまだ、従来のモデルに代わる完璧な存在ではありません。モデルが時として反復的なループ(「the the the」のように何度も繰り返す現象)に陥ったり、元のモデルよりも回答が少し短く簡潔になったりすることを認めています。また、一人のユーザーが使用する場合には非常に高速ですが、数百人が同時に利用しようとすれば、従来の「一単語ずつ」のモデルが最終的にスピードで追いつく可能性があることも指摘しています。しかし現時点では、DiffusionGemmaは「極限のスピードと高い知性のどちらかを選ばなければならない」という古いルールを打ち破り、両立が可能であることを証明することで、新たな「フロンティア」を確立しました。
要するに、DiffusionGemmaは、コンピュータによる執筆の未来が、ゆっくりとした慎重な歩みではなく、全体像から霧を晴らしていくような、アイデアの同時並行的な洗練へと向かっていることを示唆しているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。