Mitigating Exploration Bias in RL for Multi-Instruction Following
本論文は、行動的ブートストラップによって困難な指示を活性化させ、希少性認識報酬によってそれらを優先させる二段階のフレームワークを提案することで、強化学習ベースのマルチ指示遂行における容易な指示への探索バイアスに対処し、検証可能なベンチマークにおけるモデルの性能を大幅に向上させている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大規模言語モデルは、日常生活の一部となったチャットボットや執筆アシスタントを支えるエンジンです。これらのシステムの核心は、ユーザーのリクエストを受け取り、それを役立つ応答へと変換するという、指示に従うように設計されている点にあります。長年、研究者たちは、これらのモデルがいかにしてこのタスクをより上手くこなせるようになるかを教えるために、「強化学習」と呼ばれる訓練手法を用いてきました。このアプローチでは、モデルが問題を解決しようと試み、その出来栄えに基づいてスコアを受け取り、そのフィードバックを利用して次の試みを改善していきます。これは、動物に報酬を与えて訓練するのとよく似ていますが、複雑なデジタル的推論に適用された強力な手法です。しかし、新しい研究によると、これらのモデルが複数の異なるルールや制約を含む単一のリクエストに直面した際、標準的な訓練方法では失敗してしまうことが多いことが示唆されています。モデルはすべての指示を満たそうとするのではなく、難しい部分を無視して簡単な部分だけに集中してしまい、結果としてユーザーには部分的にしか正しくない応答が返されることになります。
テキサス州とカリフォルニア州の大学のチームと協力したこの研究の背後にいる研究者たちは、なぜこのようなことが起こるのか、そしてどのように修正すべきかを探求しました。彼らは、問題が主に2つの要因に起因することを発見しました。第一に、モデルが訓練を開始する際、複雑なリクエストの最も難しい部分を解決するには能力が不足していることが多々あります。モデルはこれらの困難なタスクを成功させることができないため、学習に必要なポジティブなフィードバックを得られず、単に諦めてしまうのです。第二に、訓練中に使用されるスコアリングシステムは、すべての指示を平等に扱います。もしモデルが1つの簡単なルールと1つの難しいルールを満たした場合、2つの簡単なルールを満たした場合と同じ合計スコアを受け取ります。これにより、モデルは困難な制約に苦戦するよりも、スコアを素早く上げるために「簡単な成功」を追い求めるよう促されてしまいます。その結果、モデルは容易な道へと偏り、より困難な課題は未探索のまま残されてしまうのです。
これを解決するために、チームはモデルに難しい指示への注意を強制するための2段階のフレームワークを提案しました。最初のステップは、「行動的ブートストラップ(behavioral bootstrapping)」と呼ばれる準備フェーズです。本格的な訓練が始まる前に、研究者たちはモデルが現在従うことに失敗している特定の種類の指示を特定します。次に、モデルがそれら特定の困難なタスクを遂行できるように導いた、小規模で焦点を絞った例のセットを生成します。この厳選されたデータを用いて短期間訓練することで、モデルはこれらの困難な制約を扱う能力を「呼び覚まし」ます。これはモデルにゼロからすべてを教えることではなく、本番の訓練が始まる前に、成功するチャンスを確実にするための小さな後押しを与えるものです。このステップにより、モデルが本番の訓練が始まった際に、難しい部分に対してすぐに諦めてしまうことを防ぎます。
第2のステップでは、メインの訓練フェーズにおける報酬の与え方を変えます。すべての指示に同じ重みを与えるのではなく、研究者たちは、特定の指示がどれほど稀であるか、あるいはどれほど難しいかに注目する新しいスコアリング方法を導入しました。もしモデルが、めったに正解できない指示に従うことができれば、より大きな報酬を与えます。逆に、すでに容易にマスターしている指示に従った場合は、報酬を小さくします。これにより、モデルが以前避けていた困難な領域を探索する強力な動機付けが生まれます。また、研究者たちは指示を組み合わせることに成功した場合のボーナスも追加しました。もしモデルが2つのルールを同時に満たすことができれば、特にそれらのルールを同時に満たすことが難しい場合、追加のクレジットを与えます。これにより、モデルが単に簡単なものを選び取るのではなく、一連の制約全体を満たす解決策を探すよう促されます。
チームは、17億パラメータを持つバージョンと70億パラメータを持つバージョンの2種類の言語モデルを使用して、これらのアイデアをテストしました。彼らは、それぞれ3つから5つの指示を含むプロンプトのデータセットを用いてこれらのモデルを訓練しました。結果は驚くべきものでした。新しい2段階の方法で訓練されたモデルは、標準的な手法で訓練されたモデルを大幅に上回りました。指示への追従性をチェックするために設計された主要なテストセットにおいて、最高のモデルは標準的な手法と比較して、精度が9ポイント以上向上しました。この向上は非常に顕著であり、この新しい方法で訓練された小さな17億パラメータのモデルは、数十倍の計算能力を持つはるかに大きな商用モデルと同等の性能を発揮しました。研究者たちはまた、モデルのパフォーマンスのバランスを測定し、新手法が、モデルが簡単な指示と難しい指示を扱う際の格差を縮小させることに成功したことを確認しました。
研究では、訓練中にモデルの内部で何が起きているかも調査されました。彼らは、標準的な訓練方法が、モデルがさまざまな可能性を探索する能力を失わせる「エントロピー崩壊(entropy collapse)」と呼ばれる現象を引き起こすことを観察しました。これは、モデルが安全で容易な回答の狭いループに陥ってしまう現象です。対照的に、新しい手法はモデルの探索能力を維持し、複雑な解決策を検索し続けられるようにしました。研究者たちは、このアプローチは訓練データが慎重にバランスされている場合に最も効果的であると指摘しました。初期の準備フェーズにおけるデータが多すぎると、後のモデルの柔軟性を損なう可能性があります。この手法はコンピュータプログラムによってチェック可能な指示に対してテストされましたが、研究者たちは、スタイルやトーンに関わるような、よりオープンエンドなリクエストにこれを適用するにはさらなる作業が必要であることを認めています。それにもかかわらず、今回の知見は、複雑で多面的なリクエストに直面した際に、人工知能をより信頼性の高いものにするための明確な道筋を示しています。容易な道へのバイアスに対処することで、この研究は、これらの強力なツールがユーザーの意図の全容を真に理解できるよう、貢献しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。