← 最新の論文
🤖 machine learning

Ideas in Inference-time Scaling can Benefit Generative Pre-training Algorithms

本論文は、自己回帰モデルと拡散モデルの間の伝統的な二分法は誤解を招くものであると論じ、代わりに、生成的な事前学習においては、根本的なアルゴリズム上の限界を克服するために学習目的を選択する前に、シーケンスの拡張と状態の洗練のための効率的な推論手順を設計することを優先すべきであると提案する。

原著者: Jiaming Song, Linqi Zhou

公開日 2026-06-02
📖 1 分で読めます☕ さくっと読める

原著者: Jiaming Song, Linqi Zhou

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

AIによる画像生成とテキスト生成の世界を、巨大な建設現場として想像してみてください。長年、業界はこの二種類の建設作業員が全く異なる種族であると考えて、議論に明け暮れてきました。

  1. 「レンガを一つずつ積む」作業員(自己回帰モデル / Autoregressive Models): 彼らはレンガを一つ、また一つと積み上げ、左から右へと壁を築いていきます。長い壁(長い物語の執筆など)を作るのには長けていますが、途中で間違いを見つけても、壁全体を取り壊さない限り修正することができません。
  2. 「彫刻家」作業員(拡散モデル / Diffusion Models): 彼らはノイズに満ちた巨大な大理石の塊からスタートし、形が現れるまで何度も削り、磨き上げていきます。高品質な形状を作るのには長けていますが、通常は新しい部分を付け足していくのではなく、彫像全体に対して一度に作業を行います。

この論文の核心的なアイデア:
著者たちはこう言います。「どちらの作業員が優れているかという争いはやめましょう。それは偽りの議論です。」

彼らの主張によれば、真の違いは「誰が作っているか(モデルのタイプ)」ではなく、「どのように作っているか(推論の手順)」にあります。彼らは、AIの効率を向上させるための2つの異なるアプローチを提案しています。

  • 軸1:シーケンス拡張(要素の追加): 壁をより長くしたり、物語をより大きくしたりすること。
  • 軸2:状態の洗練(既存のものの改善): 彫像を磨き上げたり、壁の中ほどにある間違いを修正したりすること。

この論文は、最高の未来のAIとは、単にどちらかの作業員を選ぶのではなく、作業員を雇う前に**「建設計画(推論)」**を設計すべきであると主張しています。もし計画に欠陥があれば、どれほどトレーニングを行っても解決しません。

以下に、日常的な比喩を用いて、この論文の3つの主要な教訓を説明します。

1. 「指示の欠落」問題(DDIMの修正)

シナリオ: あなたがカーナビアプリだと想像してください。あなたはカーナビに「地点Aから地点Bへ連れて行って」と伝えます。しかし、カーナビは「今どこにいるか(地点A)」と「現在の時刻」しか知りません。カーナビは「どこに辿り着きたいのか(地点B)」や「いつそこに到着したいのか」を知らないため、現在地に基づいて進むべき方向を推測するだけになってしまいます。

論文の主張:
現在のAIモデル(特に「DDIM」サンプラー)は、多くの場合、ノイズの乗った画像からクリアな画像へと、一度の大きなステップでジャンプしようとします。しかし、彼らが使う数学は、そのカーナビのようなものです。つまり、「目的地(目標時刻)」を知りません。どこに着地すべきかを知らないまま、ジャンプを推測しようとしているのです。

解決策: 論文はこう言います。「カーナビに目的地を教えなさい!」 単に「目標時刻(target time)」をAIの脳への入力として加えるだけで、AIは最終的な画像へと完璧に一歩でジャンプする能力を突如として手に入れます。これは、プロセス全体を機能させるための、極めて小さな指示の変更なのです。

2. 「ポーカーの手札」問題(マルチトークン予測)

シナリオ: あなたが文章の次の2つの単語を予想しようとしているとします。「ポーカーの手札は……」
もし、最初の単語と2番目の単語を完全に独立して予想してしまうと、「高い(High)」と「家(House)」を組み合わせて、「高い家(High House)」と予想してしまうかもしれません。個々の単語としては意味が通じますが、組み合わさると「高い家」はポーカーの手札としては成立しません。あなたは「高い」と「家」が結びついていることを理解する必要があります。

論文の主張:
多くの現代的なAIモデルは、スピードを上げるために複数の単語を一度に予想しようとします。しかし、それらはしばしば、まるで2つのサイコロを別々に振るかのように、単語同士を独立して予想してしまいます。これでは、言葉の間の繋がりが壊れてしまいます。

解決策: 論文は、もし一度に複数の単語を予想したいのであれば、AIはそれらの間の「関係性(結合分布)」を理解するように訓練される必要があると主張しています。もしこの関係性を予想のプロセスに組み込んでいなければ、AIは奇妙な組み合わせを作り続け、どれほど学習データを与えても、根本的な予測方法の欠陥を直すことはできません。

3. 「ロングジャンプ」対「赤ちゃんの一歩」 (フローマップ)

シナリオ: あなたが丘の下から頂上まで登らなければならないとします。

  • 従来の方法: 一歩進むごとにバランスを確認しながら、小さな、小さなステップを踏んでいきます。これは時間がかかり、多くのステップを必要とします。
  • 新しい方法: 頂上まで直接、力強く大きく跳躍する方法を学びます。

論文の主張:
現在のほとんどのAIモデルは、小さな「赤ちゃんの一歩(局所的な更新)」を踏むように訓練されています。少しずつ動き、また少しずつ動くという学習です。論文は、AIが高速化するためには、**「フローマップ(Flow Maps)」**を学ぶ必要があると主張しています。

フローマップとは、「テレポート・ガイド」のようなものだと考えてください。AIは、小さな一歩を踏み出す方法を学ぶのではなく、乱れた状態からクリアな状態へと、一、二回の大きな跳躍で直接到達するための「経路(マップ)」を学ぶのです。最近の手法はこのアプローチを取り始めており、小さなステップを踏むのをやめて、長距離のジャンプを開始することで、非常に高速になっています。

結論

この論文は、モデルが「自己回帰的」か「拡散的」かといったことに固執するのをやめるべきだと結論づけています。代わりに、私たちはこう問うべきです。

  1. その計画は、AIがコンテンツを効率的に追加することを可能にしているか?(シーケンス拡張)
  2. その計画は、AIが成果物を効率的に洗練させることを可能にしているか?(状態の洗練)

もしAIの「建設計画(推論)」に重要な変数(目的地となる時刻など)が欠けていたり、事実とは異なる前提(単語が独立しているなど)に基づいているのであれば、トレーニングが完璧に機能することはありません。「動き(Move)」を先に設計してから、プレイヤーを訓練せよ。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →