← 最新の論文
💬 NLP

Mask-Aware Policy Gradients for Diffusion Language Models

本論文は、Masked Diffusion Language Modelによる生成を、トークンの選択と位置のマスキングを共同で最適化する二段階の意思決定プロセスとして定式化することで、対数尤度の計算困難性を克服し、数学的推論およびコーディングのベンチマークにおいて最先端の性能を達成する強化学習フレームワークである、Mask-Aware Policy Gradientsを導入するものである。

原著者: Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl

公開日 2026-07-17
📖 1 分で読めます☕ さくっと読める

原著者: Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに物語を書かせたり、数学の問題を解かせたりする方法を教えようとしている場面を想像してみてください。長い間、最も優れた方法は、人間がキーボードでタイピングするように、ロボットに一単語ずつ書いていく方法でした。これは「自己回帰的(autoregressive)」な生成と呼ばれます。これは信頼性は高いのですが、高速道路を横切るカタツムリのように、非常に低速です。最近、科学者たちは「拡散(Diffusion)」と呼ばれるより速い方法を発見しました。ゼロから書き始める代わりに、ロボットは空白のマスク([MASK]のようなもの)で埋め尽くされたページからスタートし、文章が完成するまで、一つずつ空白を埋めていくのです。これは、覆われた絵から、カバーを少しずつ持ち上げて画像を見せていくパズルのようなものです。

しかし、この速い「拡散」ロボットに対し、報酬を使って賢くする方法(「強化学習」と呼ばれる手法)を教えることは、悪夢のような作業でした。従来の「一単語ずつ」という手法では、ロボットが特定の選択をした確率を正確に計算することが容易でした。しかし、「拡散」法では、ロボットはあらゆるステップにおいて2つの選択を行います。つまり、「どの単語を空白に入れるか」と、「次にどの空白を明らかにするか」の2つです。これまでの手法は、ロボットに教える際に、最初の選択(単語)だけに着目し、二番目の選択(明らかにする順番)を無視しようとしてきました。これは、シェフに完璧な料理を作る方法を教える際に、選んだ食材についてだけ批評し、それらをどの順番で刻み、混ぜたのかについては完全に無視して教えるようなものです。

COLM 2026カンファレンスで発表されたこの論文は、私たちがパズルの極めて重要な部分を見落としていたことを示唆しています。著者であるHaran Raajesh氏、Kulin Shah氏、そしてテキサス大学オースティン校のチームは、拡散の技術を真にマスターするためには、正しい単語を選ぶことと、それを明らかにする正しい順番を選ぶことの両方に対して報酬を与えなければならないと主張しています。彼らは「マスク認識型ポリシー勾配(Mask-Aware Policy Gradients)」と呼ばれる新しい手法を開発しました。このシステムは、単に次の単語を推測するのではなく、「次にどのマスクを持ち上げるか」という決定を、ロボットの戦略の極めて重要な一部として扱います。学習プロセスをこれら2つの明確な部分に数学的に分解することで、ロボットがより速く学習し、ミスが減ることを発見しました。

その結果は非常に印象的です。彼らがこの新しい手法を難解な数学問題やコーディングの課題でテストしたところ、ロボットの解決能力は大幅に向上しました。有名な数学テストであるGSM8Kにおいて、彼らの手法は87.1%の精度に達し、コーディングテストであるMBPPでは53.4%を記録しました。これらの数値は、報酬を用いて拡散モデルを教えようとしたこれまでのどの手法よりも高いものです。この論文は、「マスキング」の決定、つまりロボットが自分の思考を明らかにする順番に注意を払うことで、これらの速く柔軟なAIモデルの新たなレベルの知能を解き放つことができることを示しています。これにより、モデルは単に速くなるだけでなく、より賢くなれるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →