← 最新の論文
🤖 machine learning

From Interface to Inference: Eliciting Any-Order Inference from Any-Order Models

本論文は、挿入ベースおよび潜在空間ベースのアプローチを提案することで、マスク付き拡散モデルにおける任意の順序での学習インターフェースと推論能力の間のギャップに対処し、それによって位置の不確実性を解消し、コード生成や数学問題といった離散的な推論タスクにおける性能を向上させつつ、ネイティブな任意の順序での推論を可能にしている。

原著者: Seunggeun Kim, Jaeyeon Kim, Taekyun Lee, Yuyuan Chen, Yilun Du, Sham Kakade, Sitan Chen

公開日 2026-07-30
📖 1 分で読めます☕ さくっと読める

原著者: Seunggeun Kim, Jaeyeon Kim, Taekyun Lee, Yuyuan Chen, Yilun Du, Sham Kakade, Sitan Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットに物語を書かせたり、数学の問題を解かせたりする方法を教えようとしていると想像してください。長い間、最も優れた方法は、人間が本を読む時のように、左から右へと一単語ずつ厳密に教えることでした。これは「自己回帰的(オートレグレッシブ)」な生成と呼ばれます。これはうまく機能しますが、少し硬直しています。もしロボットが最初の文章で間違いを犯した場合、その間違いに基づいたまま残りの物語を書き続けなければならないか、あるいは最初からやり直さなければなりません。人間が編集者のように、真ん中を書いている間に最初の方に戻って修正するということが、簡単にはできないのです。

最近、科学者たちは「マスク付き拡散モデル(Masked Diffusion Model)」と呼ばれる新しいタイプのAIを発見しました。これは「穴埋めゲーム」のようなものだと考えてください。言葉を一つずつ書いていく代わりに、このAIはいくつかの単語が隠されている(マスクされている)文章を見て、それらが何であるかを推測しようとします。どの隠された単語でもいつでも見ることができるため、理論上は、前後左右に飛び回り、最初を直し、次に最後を直し、それから真ん中を直すといった、好きな順序で行うことができるはずです。これは、プログラマーが全体像と細部の間を行き来する、コーディングのような複雑なタスクにとって完璧なツールに聞こえます。しかし、ここに落とし穴があります。AIが自由に飛び回る「能力」を持っていたとしても、実際にそうするとは限らないのです。

この論文は、なぜこれほど強力な「穴埋め」ロボットが、自由があるにもかかわらず、まるで古い「左から右へ」のロボットのように決まりきった動きをしてしまうのかを調査しています。テキサス大学オースティン校とハーバード大学の研究チームである著者らは、「位置の不確実性(positional uncertainty)」という隠れた罠を発見しました。彼らは、AIが「何」という単語が必要か(例えば、コンピュータプログラム内の特定の関数など)は分かっていても、「どこ」にその単語を置くべきかについては混乱してしまうことを発見しました。配置場所が不確かなため、AIは安全策をとって、退屈で予測可能な順序で空白を埋めてしまい、本来得意とするはずだった創造的で非線形な思考を逃してしまうのです。

これを解決するために、研究者たちは単にロボットの自信を調整したのではなく、二つの新しい「超能力」を与えました。第一の超能力は、ロボットにハサミと糊を与えるようなものです。固定された数の空白に縛られる代わりに、ロボットは必要に応じて新しい空白を挿入することができ、文章全体を動かして新しいアイデアのためのスペースを作ることができます。第二の超能力は、ロボットに単語単位ではなく「チャンク(塊)」や「段落」単位で考えることを教えるようなものです。一つ一つの文字を推測するのではなく、意味の大きなブロックを一度に推測することで、細部に迷うことなく、次にどの大きなアイデアを構築すべきかを決定できるようになります。

チームはこれらのアイデアをコンピュータのコーディングと数学の問題でテストしました。彼らは、これらの新しい手法を用いることで、ロボットが実際に人間のプログラマーのように考え、コードの異なる部分を行ったり来たりしながら作業を洗練させていることを発見しました。これにより、より良い結果が得られ、ロボットは以前よりも多くの問題を正しく解けるようになりました。この論文は、AIに真に人間のように推論させるためには、単に「飛び回る能力」を持たせるだけでなく、飛び回ることが「自然で簡単な選択」となるような設計にする必要があると示唆しています。

問題点: 「固定されたキャンバス」の罠

研究者たちは、まずなぜこれらの「穴埋め」モデル(マスク付き拡散モデル、またはMDM)が、期待されていたほどの成果を出せていないのかを探りました。理論的には、MDMはシーケンス内の任意のトークンをいつでも明らかにできるはずです。もしPythonプログラムを書くよう指示すれば、関数名を書き、次にループへ飛び、それから変数定義へと戻るという、混沌とした人間らしい順序で書けるはずです。

しかし、モデルの動作を観察すると、失望させられる光景が見られました。モデルには任意の順序を選択する自由があるにもかかわらず、ほとんどの場合、古い形式のロボットと同じように、左から右へと空白を埋めることを選択していたのです。著者らはこれを「因果的崩壊(causal collapse)」と呼んでいます。それはまるで、街全体の地図を持っているのに、結局は一ブロックずつ通りを進むことを決めたロボットのようです。

論文では、これは単なる悪い癖ではなく、これらのモデルの構築における根本的な欠陥であると主張しています。問題は「位置の不確実性」です。レゴのお城を作っているところを想像してください。あなたは「塔」のパーツが必要だと分かっています。しかし、周囲の壁をまだ作っていないため、その塔を正確にどこに置けばよいのか、まだ分かっていません。今、塔を置こうとすると、間違った場所に置いてしまうかもしれません。

標準的なMDMでは、「キャンバス」(トークンのシーケンス)は固定されています。モデルは、「『return』をここに置くべきか、それともあそこか、あるいはここか?」と決断しなければなりません。もしモデルが「return」文が必要だと分かっていても、それがループの中にあるべきか、ループの後にあるべきかが不明確な場合、その自信はそれらすべての可能性のある場所に分散されてしまいます。自信が分散されるため、モデルは、直前の単語に続く単純な単語を配置する場合よりも、「return」文を配置することに対して「確信が持てない」状態になります。そのため、安全策として、まずは簡単なローカルな単語から埋めていき、事実上、自分自身を左から右への順序の中に閉じ込めてしまうのです。論文は、たとえモデルが非常に賢かったとしても、固定されたグリッドのキャンバスが、時期尚早なコミットメントを強いてしまうことを示しています。

解決策1:FlexMDM(ハサミと糊)

「これをどこに置けばいいのか?」という問題を解決するための第一の解決策は、FlexMDMと呼ばれるものです。このアプローチは、固定されたキャンバスというルールを変えることで、ゲームのルールを変更します。

物語を紙に書いている場面を想像してください。ただし、最初に引いた線に縛られるのではなく、魔法の消しゴムと糊を持っているとします。もし文章を書いていて、途中に新しい段落が必要だと気づいたら、魔法のようにそこに新しい行のスペースを挿れることができます。先に書いた言葉は、スペースを作るためにスライドして移動できます。

FlexMDMはまさにこれを行います。モデルが生成プロセス中に新しいトークン(またはマスク)を挿入することを可能にします。モデルがトークンを明らかにすると決定したとき、最終的なシーケンスにおける永久的な場所にコミットする必要はありません。後で、もしモデルがもっとスペースや異なる構造が必要だと判断した場合、新しい隙間を挿入することができ、以前に明らかにされたトークンは、新しい正しい位置へとシフトします。

この単純な変更が、「位置の不確実性」の罠を打破します。モデルはもはや「これは正しい場所だろうか?」と心配する必要はありません。なぜなら、その場所は動かせるからです。研究者らは、これによりモデルがはるかに人間らしい方法でコードを生成できるようになったことを発見しました。一行を完全に書き終えてから次の行を始めるのではなく、関数名をドラフトし、次にループを書くために飛び、それから関数の詳細を埋めるために戻ってくることができます。彼らはコードの「ツリー」構造を見ることでこれを測定し、FlexMDMはコードの異なるブランチ間を飛び回る可能性がはるかに高い一方で、標準的なモデルはただ一つの道を真っ直ぐ進んでしまうことを発見しました。

テストにおいて、彼らは70億パラメータのモデル(Dream-Coder)をこの手法を用いて微調整しました。HumanEvalやMBPPといったコーディング・ベンチマークにおいて、この新しい「柔軟な」モデルは、特に複数の試行を許可した場合(Pass@16)、オリジナルよりも優れた性能を示しました。キャンバスを再構成させることで、モデルがより創造的な解決策を探索できることが示されました。

解決策2:LatentMDM(チャンクで考える)

第二の解決策であるLatentMDMは、異なるアプローチを取ります。個々の単語の位置と戦う代わりに、モデルが考えるレベル自体を変更します。

友人に映画の内容を説明しようとしていると想像してください。もし、言葉を一つずつ(「男が歩いた、それから止まった、それから見た……」のように)説明しようとすると、全体像を捉えるのが難しくなります。しかし、「シーン」や「チャンク」単位で説明すれば(「まず、ヒーローが部屋に入る。次に、彼は悪役を見る。最後に、二人は戦う」)、あちこちへ飛び回ることがずっと簡単になります。「戦いのシーンについて先に話そう」と言うことは、入場シーンで使われた正確な言葉を気にすることなく可能です。

LatentMDMは、トークンを意味的なセグメント(コードの行や論理的なブロックなど)にグループ化し、各セグメントを「潜在空間(latent space)」(圧縮された抽象的な意味表現)における単一のユニットとして扱うことでこれを行います。一つ一つのトークンを推測する代わりに、モデルは次にどのセグメントを明らかにするかを決定します。

これにより、「位置の不確実性」は、個々の単語のレベルから、思考の塊(チャンク)のレベルへと移行します。モデルは特定の単語がスロット5に入るべきかスロット6に入るべきかといったことは気にしません。単に「次に『ループ』のセグメントを書こう」と決定するのです。セグメントはより粗い単位であるため、モデルは、その中の正確な言葉がまだ検討中であったとしても、アイデアの順序についてははるかに自信を持つことができます。

研究者らは、TinyGSMと呼ばれる数学データセットを用いて、この手法を用いて1億2500万パラメータの小さなモデルをゼロから学習させました。彼らは、このモデルが標準的なモデルにはできなかった、非左から右の順序でセグメントを明らかにする選択ができることを発見しました。実際、LatentMDMは、標準的なモデルや一部のより大きな自己回帰モデルをも凌駕する数学の問題解決能力を示しました。これは、チャンク単位で考えることで、モデルが詳細に迷い込むことなく、解決空間を効率的にナビゲートできることを示唆しています。

これが意味すること

この論文は、任意の順序での推論のための「インターフェース(能力)」を持つだけでは不十分であることを結論づけています。モデルの内部メカニズムもそれをサポートしていなければなりません。もしモデルが固定された単語のグリッドに縛られているなら、どこに何を置くかについてのミスを恐れて、自然と左から右への順序へと崩壊してしまいます。

グリッドを柔軟にする(FlexMDM)、あるいはより大きなチャンクで考える(LatentMDM)ことによって、研究者たちは、AIが真に「左から右へ」の習慣から脱却できることを示しました。これらのモデルは単にテキストを生成するのではなく、人間が実際に思考し、複雑なものを構築する様子を模倣した構造を持って生成しているのです。つまり、何度も行き来し、アイデアを洗練させ、最終的な解決策に落ち着く前に、さまざまな経路を探索しながら生成しているのです。

著者らは、これらは有望なステップではあるものの、AIの推論問題に対する最終的な解決策ではないことも注意深く述べています。彼らは主にコーディングと数学でこれらのアイデアをテストしており、結果は強力であったものの、これらの「任意の順序」の振る舞いが他の種類のタスクやより大規模なスケールでどのように機能するかを確認するには、さらなる研究が必要であるとしています。しかし、核心となるメッセージは明確です。人間のように推論するAIを構築するためには、タイプライターのように書くことを強制するのをやめ、建築家のように考えられるようにする必要があるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →