← 最新の論文
💻 computer science

Sumi: Open Uniform Diffusion Language Model from Scratch

本論文は、1.5兆トークンを用いてゼロから事前学習された、初の完全オープンな7Bユニフォーム拡散言語モデルであるSumiを紹介するものであり、これはネイティブなユニフォーム拡散を研究するための最初の大規模な参照点として機能し、知識、推論、およびコーディングのベンチマークにおいて競争力のある性能を実証している。

原著者: Mengyu Ye, Keito Kudo, Wataru Ikeda, Ryosuke Matsuda, Keisuke Sakaguchi, Jun Suzuki

公開日 2026-06-19
📖 1 分で読めます☕ さくっと読める

原著者: Mengyu Ye, Keito Kudo, Wataru Ikeda, Ryosuke Matsuda, Keisuke Sakaguchi, Jun Suzuki

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大きなアイデア:AIによる新しい書き方

あなたが物語を書こうとしているところを想像してみてください。

  • 従来の方法(自己回帰モデル): これは、紙にペンで書くようなものです。一単語書き、次に次の単語、その次にまた次の単語と書いていきます。一度単語を書いたら、それは確定です。もし間違いを犯したら、線を引いて消すか、ページ全体を最初から書き直さなければなりません。最初の一単語を変えようと思ったら、その後に続くすべての文章を書き直す必要があります。
  • 新しい方法(Sumi / 一様拡散法): キャンバス全体が砂嵐(テレビの砂嵐のようなノイズ)で覆われているところを想像してください。そこに絵を描いていくイメージです。文章を一単語ずつ書く代わりに、キャンバス全体を一度に見渡します。文章の中の「どの単語でも」選んで、それを消去し、より良いものに置き換えることができます。これを何度も繰り返し、物語全体を同時に洗練させて、完璧なものへと仕上げていくのです。

この論文では、この「絵画」の手法を用いた70億パラメータのAIモデルであるSumi(日本語で「墨」を意味する)を紹介しています。これは、既存の「ペンで書く」モデルを少し改良したものではなく、この特定の手法を用いてゼロから構築された、初めてのこれほど大規模なモデルです。

どうやって作ったのか:「学校」の比喩

Sumiを訓練するために、研究者たちは単にインターネット上のテキストを投げ込んだわけではありません。非常に特定の「学校のカリキュラム」を用意しました。

  1. 教科書(事前学習): モデルに1.3兆語のデータを読み込ませました。しかし、何でもかんでも集めたわけではありません。高品質で教育的なコンテンツを優先するようにデータをフィルタリングしました。これは、AIに百科事典や教科書、コードのマニュアルが詰まった図書館を与え、カジュアルなネット上の雑談やミーム、質の低いブログなどを排除したようなものです。
  2. 専門訓練(中間学習): 一般的な教育課程の後、コーディング、数学、推論という3つの特定の科目に特化した「ブートキャンプ」を実施しました。食事の中に、さらに多くのコードや数学の問題を加えたのです。
  3. 結果: この「教育重視」の食事のおかげで、Sumiは知識、論理、コーディングにおいて非常に優れています。しかし、「日常会話」や「常識」に関する食事を十分に摂らなかったため、日常的な常識に関する質問(例:「なぜ人は雨が降っている時に傘をさすのか?」など)には少し苦戦します。

パフォーマンス:この「画家」はどれほど優秀か?

研究者たちは、伝統的な「ペンで書く」手法を用いる有名なAIモデル(LlamaやFalconなど)とSumiを比較テストしました。

  • 勝利した点: 一般知識、推論、コーディングに関するテストにおいて、Sumiは、より多くのデータで訓練された最高の「ペン書き」モデルと同等の性能を発揮しました。
  • 劣った点: 「常識」(社会的な状況の理解など)を必要とするテストでは、Sumiのスコアは低くなりました。著者らは、これはトレーニングデータが学校の科目に集中しすぎており、日常生活に関するものが不足していたためであると認めています。

「キャンバス」実験:スイートスポットの発見

この論文の中で最も興味深い部分の一つは、モデルの「柔軟性」をどのようにテストしたかという点です。

  • キャンバスのサイズ: このAIでは、生成を開始するに、文章の長さを決めておく必要があります。これは「キャンバスの長さ」と呼ばれます。
  • 発見: Sumiは、キャンバスがちょうど2048トークンの長さであるときに最もよく機能します。
    • キャンバスが短すぎると、モデルは混乱して支離滅裂な内容を書き始めます。
    • キャンバスが長すぎても、同様に混乱します。
    • これは、特定のサイズのステージであれば完璧に演奏できるミュージシャンのようなものです。ステージが小さすぎたり大きすぎたりすると、リズムを崩してしまいます。

「コミットメント」の謎:どのように決定しているのか?

Sumiはいつでもどの単語でも変更できるため、「ランダムに推測しているのか、それとも計画があるのか?」と疑問に思うかもしれません。

  • 発見: 研究者たちは、Sмが固定された順序(例えば「最初から始める」など)を持っていないことを発見しました。その代わりに、「確信度」システムを使用しています。
    • モデルは文章全体を見渡し、「この単語についてはかなり自信があるから、これで確定(ロックイン)しよう。あの単語についてはまだ自信がないから、もう少し検討しよう」と考えます。
    • これにより、簡単な部分を先に確定させ、難しい部分を後回しにするという自然な順序が生まれます。
  • 並列速度: 自信のある単語を先に確定させるため、コーディングなどのタスクにおいて、複数の単語を同時に書くこと(並列デコーディング)が可能であり、これは従来の「一単価ずつ」の方法よりも高速です。

「自己修正」の神話

この「絵画」手法の大きな約束は、AIが自分の間違いを簡単に修正できるはずだということです。研究者たちは、Sumiに回答を修正するための追加時間を与えることで、これをテストしました。

  • 結果: 驚いたことに、効果はありませんでした。 Sumiに回答を何度も書き直す許可を与えても、ほとんどの場合、単語を一つ変えた後に元の言葉に戻すだけでした。生成プロセス中にエラーを「学習」して修正することはできなかったのです。モデルはある限界点に達しており、一度確定(コミット)した回答をどう改善すべきかを知らないようです。

まとめ

Sumiは、従来の「書く」方法ではなく、「絵を描く」方法(一様拡散法)を用いて、強力なAIをゼロから構築できることを示す大胆な実験です。

  • 得意なこと: 数学、コーディング、事実(一生懸命勉強したため)。
  • まあまあなこと: 常識(「楽しい」要素を飛ばしたため)。
  • 不思議なところ: 考えを変えること(まだ自己修正がうまくできません)。

著者らは、他の科学者がこの「絵画」メソッドをさらに良くする方法を見つけられるよう、モデル、コード、そしてどのようなレシピで学習させたのかという詳細な情報を公開しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →