Amortizing intractable inference in large language models
本論文は、大規模言語モデルにおける計算困難な推論を償却するためにGFlowNetsを用いることを提案しており、これにより、制約付き生成や思考の連鎖(chain-of-thought)推論といったタスクにおいて、従来の最大尤度推定や報酬最大化トレーニングに代わるデータ効率の高い手法として、複雑な事後分布からのサンプリングを可能にする。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大規模言語モデルは、人間の知識の膨大なライブラリであり、それまでの内容に基づいて文の次の単語を予測するデジタルネットワークへと圧縮されたものです。これらのモデルは、出発点が与えられた際に物語を継続したり、質問に答えたりすることに長けて訓練されており、そのプロセスは左から右へと自然に流れます。しかし、私たちがこれらのモデルに実行させたい最も興味深いタスクの多くは、逆方向に考えたり、物語の中間部分を埋めたりすることを必要とします。物語の始まりと終わりを与えられ、その中間を考案するように求められる場面や、特定の回答の背後にある推論を説明するように求められる場面を想像してみてください。これらのシナリオでは、モデルは単に次の単語を推測するだけでは不十分です。始まりから終点へとつながる特定の経路を見つけ出すために、巨大で複雑な可能性の風景を探索しなければなりません。これは非常に困難な数学的問題です。なぜなら、可能な経路の数はあまりにも膨大であるため、一つずつチェックすることは不可能であり、この風景をナビゲートするための標準的な手法は、しばしば一般的すぎる一、二のルートに固執してしまい、存在する豊かで多様な正解のバリエーションを見逃してしまうからです。
Mila – ケベックAI研究所とオックスフォード大学の研究者たちは、これらのモデルにその複雑な風景をナビゲートする方法を教える新しい手法を開発しました。モデルに「最善」の回答に対してスコアを最大化させるように訓練する代わりに(これはしばしば反復的で限定的な思考につながります)、彼らは「アモルタイズド・インファレンス(償却推論)」と呼ばれる手法を用いました。このアプローチは、問題を単一の完璧な解の探索としてではなく、多様な正解の経路の探索として扱います。これを行うために、彼らは「ジェネレーティブ・フロー・ネットワーク」として知られる技術を採用しました。これは、モデルが単一の使い古されたパターンに陥ることなく、あらゆる範囲の解をサンプリングすることを学習し、異なる有効な推論の連鎖を探索することを保証するガイドのような役割を果たします。
チームは、算術計算や、映画のレビューが意見を述べているのか事実を述べているのかを分類するといった、多段階の推論を必要とする問題を解くように大規模言語モデルを微調整することで、これを実証しました。ある実験では、始まりと終わりが与えられた短い物語の欠落している中間の一文を埋めるようモデルに求めました。標準的な手法では、文法的には正しいものの物語の流れに適合しない文章が生成されることがよくありました。しかし、この新手法は、始まりと終わりを首尾よくつなぐ中間の一文を生成することに成功し、文脈全体を理解する能力が大幅に高いことを示しました。計算機ツールを備えた単純な数学の問題を用いた別のテストでは、モデルに計算をステップに分解するよう求めました。他の訓練手法ではモデルが数字を繰り返したり、ツールを正しく使えなかったりしましたが、この新しいアプローチは、モデルにステップを注意深く計画することを教え、特に未学習の問題に対して劇的な精度の向上をもたらしました。
結果は、この手法がデータが乏しい場合に特に強力であることを示唆しています。わずか10例の映画レビューから学習するテストにおいて、新手法は標準的な訓練技術よりも有意に高い精度を達成し、50例の例を用いた場合でもそれらを上回り続けました。研究者たちは、モデルに幅広い推論経路をサンプリングさせ、その結論を組み合わせるように促すことで、システムがより堅牢で信頼できるものになることを発見しました。これは極めて重要な違いです。なぜなら、モデルが問題を解くための単一の方法を暗記しているのではなく、どのように思考を進めるかという根本的な構造を学習していることを意味するからです。この研究は、目標を「最も可能性の高い単一の答えを見つけること」から「正解の全多様性を探索すること」へとシフトさせることで、これらの強力なツールをより柔軟にし、複雑な推論タスクに適したものにできることを示しています。
また、この研究は現在のモデルがどのように訓練されることが多いかという限界も浮き彫りにしています。モデルが高報酬を最大化するように促されると、高スコアを得るためだけに、同じフレーズを繰り返したり問題の実際の論理を無視したりといった「近道」を見つけ出す傾向があります。研究者たちは、モデルが解の分布全体に一致するようにすることで、この罠を回避し、モデルが単一の欠陥のある思考モードに陥らないようにすることを示しました。このアプローチにより、モデルは、訓練されたものよりも多くの数字を含む算術問題を解くといった新しい状況に対して、より良く汎化できるようになります。これらの知見は、単純なパターンマッチングを超えて、議論を構築し、ステップバイステップで問題を解決する方法をより微細に理解させる、真の推論能力を備えた人工知能へと向かう有望な道筋を提示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。