人工知能の世界には、「人間のフィードバックからの学習におけるサンプル非効率性」として知られる根強い課題が存在します。複雑なコンピュータ・プログラムに、人間の価値観に沿った振る舞いをさせる方法を想像してみてください。現在利用可能な最も強力な手法は、人間に2つの異なる結果(例えば、2つのロボットの動きや、2つの文章の回答など)を比較させ、どちらを好むかを述べてもらうというものです。このフィードバックは人間にとって容易に与えられるものですが、情報は極めて希薄です。たった一つの好みの提示から得られる情報は、ごくわずかな断片に過ぎません。信頼できるモデルを構築するためには、アルゴリズムは何千もの質問を投げかける必要があります。もしコンピュータが間違った質問をすれば、時間と費用を無駄にしてしまいます。逆に、正しい質問をすれば、より速く学習できます。困難な点は、どの質問が最も情報量が多いかを知ることにあります。これを行うためには、コンピュータは自身がまだ理解していないこと、すなわち「不確実性」と呼ばれる概念を理解する必要があります。しかし、大規模で現代的なニューラルネットワークに対してこの不確実性を計算することは非常に困難であり、計算コストも膨大です。多くの場合、大まかな推定値を得るためだけに、数十の独立したモデルを訓練する必要さえあります。
南カリフォルニア大学の研究チームは、このボトルネックを解決し、コンピュータが人間の好みをはるかに高速かつ効率的に学習できる新しいアプローチを開発しました。彼らは「PreferenceEKF」と呼ばれる手法を導入しました。これは、好みの学習プロセスを、巨大な一度限りの計算としてではなく、連続的なステップバイステップのフィルタリング問題として扱うものです。研究者たちは、巨大なニューラルネットワークのあらゆるバリエーションを一度にマッピングしようとする代わりに、ネットワークの挙動はより小さな低次元の空間内で正確に追跡できることに気づきました。このコンパクトな部分空間に計算を集中させることで、古典的な数学的ツールである拡張カルマンフィルタを用いて、新しい回答が届くたびにリアルタイムでモデルの理解を更新することが可能になりました。この技術により、複数の独立したネットワークを訓練するという重い計算コストをかけることなく、数千もの異なるバージョンの報酬モデルを即座に生成することができました。
研究者たちは、ロボット制御や意思決定に関する様々な標準的なベンチマークを用いて、彼らの手法を既存のいくつかの手法と比較検証しました。その結果、彼らのアプローチは、最先端の代替手法と比較して大幅に高速である(一部の高度な手法よりも最大40倍速い)だけでなく、予測の精度も高いことが分かりました。限られた数の人間の比較から報酬モデルを学習することを目的とした実験において、この新手法は他の手法よりも少ない質問数で正しい好みを一貫して学習しました。さらに、生成されたモデルはより適切に校正(キャリブレーション)されており、つまり、コンピュータの回答に対する自信が、実際の回答の正確性とより密接に一致していました。この精度は、アクティブラーニング(能動学習)において極めて重要です。システムは次にどの質問をすべきかを決定しなければなりません。もしシステムが確信を持てない場合は、その不確実性を解消するために質問を行い、確信がある場合は次のステップへ進みます。この新手法はこのバランス調整において優れており、より高価で時間のかかる手法で訓練されたポリシーに匹敵する性能を持つ、複雑なタスクを実行できるロボット・ポリシーを訓練するための報酬モデルを生み出しました。
この研究の最も顕著な側面の一つは、これらのシステムの訓練におけるワークフローをどのように変えるかという点です。従来の手法では、新しいフィードバックを受け取るたびに、コンピュータが世界の理解を再訓練または再評価する必要があることが多く、システムが大きくなるにつれてプロセスが遅くなる傾向があります。対照的に、この新手法は、これまでに学習した内容の実行中の推定値を維持しながら、最新の情報のみを取り込んで逐次的に知識を更新します。これにより、システムは効率的にスケールアップでき、メモリや時間に制限されることなく、より大きなニューラルネットワークを扱い、より多くの報酬モデルのサンプルを生成することができます。また、研究者たちは、初期データがない状態からでも、ランダム投影技術を用いて必要な部分空間をゼロから構築できることを実証しました。さらに、入力データが単純な数値よりもはるかに複雑な画像ベースのタスクにおいても、この手法が有望であることを示しました。
この手法は大きな期待を集めている一方で、研究者たちはその限界についても慎重に述べています。彼らが用いた数学的枠組みは、学習される好みが単一の、一貫したソースから来ることを前提としています。彼らが、互いに相反する意見を持つ可能性のある複数の人間のアノテーター(注釈者)からのデータを用いてテストを行った際、この手法はそれらの異なる意見の複雑さを捉えるのに苦戦しました。このことは、このアプローチが学習プロセスを合理化するための強力なツールである一方で、単一の、一貫した一連の好みをモデル化するシナリオに最適であることを示唆しています。それにもかかわらず、今回の結果は、人工知能を人間の意図に適合させるための大きな前進であることを示しています。フィードバックからの学習プロセスをより速く、より効率的にすることで、この研究は、人間の時間のコストが高く、迅速かつ正確な学習が不可ントとなる、パーソナライズされた推奨システムから自律型ロボットに至るまで、現実世界の環境へのインテリジェントなシステムの導入における大きな障壁を取り除いています。
技術要約:部分空間推論による好みに基づく効率的な能動的報酬学習
問題提起
人間の意図にエージェントを適合させるための主要な技術として、人間からのフィードバックに基づく強化学習(RLHF)があるが、これはサンプル効率の低さに課題を抱えている。人間の好みのフィードバックは、1回のクエリあたり最大でも1ビットの情報しか提供しないため、報酬モデル(RM)の学習には数千回の比較が必要となることが多く、スケーラビリティに欠ける。能動学習(Active Learning)は、情報の利得を最大化するようにクエリを賢明に選択することで、この問題に対処する。しかし、効果的な能動学習には、報酬モデルの堅牢な不確実性定量化(UQ)が必要である。
ベイズ的手法は原理的な不確地性の表現を提供するものの、高次元のパラメータ空間に対して事後分布の推論を行う際の計算量的な困難さから、大規模なニューラルネットワーク(NN)報酬モデルへの適用が難しい。一方、ディープアンサンブル法やドロップアウトといった一般的な代替手法は、計算コストが高すぎる(複数の独立したモデルの訓練が必要)、あるいは事後分布の近似精度が低いという問題がある。核心となる課題は、アンサンブルの訓練オーバーヘッドを伴わずに、ニューラルネットワーク報酬モデルのためのスケーラブルでサンプル効率の高い能動学習を実現する手法を開発することである。
手法:PreferenceEKF
著者らは、能動的な好みの学習を逐次的なベイズフィルタリング問題として定式化する手法、PreferenceEKFを提案する。この手法は、以下の2つの重要な知見を活用している:
- 逐次的フィルタリング: バッチ訓練の代わりに、新しい好みのクエリが到着するたびに、拡張カルマンフィルタ(EKF)を用いて報酬モデルの事後分布を逐次的に更新する。
- 部分空間推論: ニューラルネットワークは過剰パラメータ化されており、解が低次元の部分空間内に存在することが多いという認識に基づき、全パラメータ空間ではなく、この部分空間内でのEKF推論を実行する。
技術的ワークフロー
部分空間の構築:
- 初期データセットを使用して、数イテレーションの確率的勾配降下法(SGD)を実行する。
- 得られたパラメータの反復値を用いて、低次元の部分空間を構築する。これは、SGDの反復値の特異値分解(SVD)を通じて射影行列 A を得るか、あるいはランダム射影を用いることで行われる。
- 全パラメータ空間 θ は、アフィン写像 θ(z)=Az+θ∗ によって近似される。ここで、z は低次元の部分空間パラメータ(∣z∣≪∣θ∣)を表す。
逐次的ベイズフィルタリング(EKF):
- ニューラルネットワークのパラメータを、時間とともに進化する隠れ状態として扱う。
- ダイナミクスモデル: 加法的ガウスノイズを伴う恒等関数を仮定する(p(θi∣θi−1)=N(θi∣θi−1,U))。
- 観測モデル: 軌跡のペアに対して好みのラベルを予測するためにBradley-Terry(BT)モデルを使用する。BT尤度は、EKFの枠組みに適合させるために、現在の事後平均の周りで線形化される。
- 更新ステップ: 新しいクエリと応答のペア (Qi,yi) を受け取ると、EKFは部分空間パラメータ z の事後分布を閉形式で更新する。事後分布はガウス分布を維持する:bi=N(μi′,Σi′)。
能動学習ループ:
- 学習された部分空間の事後分布から、任意の数のモデルをサンプリングする。
- これらのサンプルを全空間に射影して、獲得関数を計算する。著者らは特に、最も情報量の多いクエリを選択するために、InfoGain(クエリのラベルとモデルパラメータ間の相互情報量)を利用する。
- 全データに対して再訓練を行うアンサンブル法とは異なり、PreferenceEKFは最新のクエリのみに基づいて更新を行うため、計算効率が高い。
主な貢献
- NN報酬モデルのための初の部分空間フィルタリング: 本論文は、好みのフィードバックからニューラルネットワーク報酬モデルを訓練するために、部分空間フィルタリングを活用した最初の事例であると主張している。
- スケーラブルなベイズ推論: 推論を低次元の部分空間に限定することで、深層ニューラルネットワークに対する拡張カルマンフィルタを扱いやすくし、全共分散行列に伴う O(∣θ∣2) の複雑さを回避している。
- 効率的な獲得関数の計算: 部分空間の事後分布から任意の数のモデルをサンプリングできる能力により、これまで低次元モデルに限定されていた最先端の獲得関数であるInfoGainのスケール可能な計算を可能にした。
- アンサンブル訓練のオーバーヘッドなし: DeepEnsembleとは異なり、PreferenceEKFは複数の独立したモデルを訓練する必要がなく、実行時間とメモリ使用量を大幅に削減できる。
実験結果
著者らは、MuJoCoの移動、Adroitの操作、Maze2Dのナビゲーションを含む12のタスクに関わるD4RLおよびV-D4RLベンチマークにおいて、PreferenceEKFを評価した。比較対象として、DeepEnsemble、Dropout、Laplace Approximation、およびLast-Layer MCMC (LLMCMC) の4つのベースラインを用いた。
- サンプル効率: PreferenceEKFは、サンプル効率およびホールドアウト・テスト・クエリに対する最終的な対数尤度の観点において、すべてのベイズ深層学習ベースラインと同等またはそれ以上の性能を示した。
- 実行時間とスケーラビリティ:
- PreferenceEKFは、DeepEnsembleと比較して約5倍の高速化を、LLMCMCと比較して40倍以上の高速化を達成した。
- 本手法は、事後分布サンプル数(M)およびニューラルネットワーク・アーキテクチャのサイズの両方に対して緩やかにスケールするが、ベースライン(特にアンサンブル)はメモリ制約や線形スケーリングの問題に直面する。
- 較正(Calibration): PreferenceEKFは優れたモデル較正を示し、すべての手法の中で最も低い期待較正誤差(ECE)と、2番目に低いBrierスコアを達成した。
- 方策最適化: 学習された報酬モデルがオフライン強化学習(Implicit Q-Learning経由)に使用された際、得られた方策は、他の手法から得られた報酬モデルを用いて訓練された方策と同等の性能を達成し、しばしばグラウンドトゥルースの報酬方策に匹敵するか、わずかに下回る程度であった。
- 堅牢性: 本手法は、初期のウォームアップ・データセットがない場合(ランダム射影を使用)でも効果的であり、疎なフィードバック設定(実ロボットデータ)やピクセルベースのタスク(事前学習済み画像埋め込みを使用)においても有望な結果を示した。
意義と主張
本論文は、PreferenceEKFを、RLHFにおける大規模なニューラルネットワーク報酬モデルへのベイズ深層学習をスケールさせるための実行可能な解決策として位置づけている。著者らは、本アプローチが、原理的な不確実性定量化の必要性と計算の実行可能性をうまく両立させていると主張している。
- 効率性: 主要な貢献は、好みに基づく報酬学習のサンプル効率を向上させつつ、既存のベイズ手法と比較して訓練および推論の計算コストを劇的に削減したことにある。
- 実用性: 本手法は、高次元の獲得関数であるInfoGainをニューラルネットワークで使用することを可能にし、これは従来不可能であった。
- 限界: 著者らは、EKFのガウス仮定が単一アノテーターの設定(単峰性の事後分布)に限定されることを控えめに認め、基盤モデル規模の報酬モデルや多峰性の好み分布(例:多様な人間のアノテーター)への拡張は依然として未解決の課題であることを述べている。また、学習された報酬モデルが競争力のある方策をもたらす一方で、報酬モデルの対数尤度と最終的な方策性能の直接的な相関関係は複雑であり、報酬学習の改善のみによってそれが保証されるわけではないことも指摘している。
結論として、本論文は、部分空間推論を介したEKFが、人間の好みに基づく能動的報酬学習のための、アンサンブルベースのベイズ深層学習手法やその他の手法に代わる、スケーラブルで効率的かつ高度に較正された選択肢であることを示している。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録