Value Drifts: Tracing Value Alignment During LLM Post-Training
本論文は、LLMのポストトレーニングにおける価値観アライメントのダイナミクスを調査し、教師あり微調整(SFT)が主にモデルの価値観を確立する一方で、その後の選好最適化がそれらを再アライメントさせることは稀であること、および同一のデータセットであってもアルゴリズムによって異なる結果をもたらすことを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、インターネット上のほぼすべての情報を読み終えた、超スマートで新品のロボットを想像してみてください。そのロボットは事実を知り、詩を書くことができ、数学の問題を解くことができます。しかし、現在は「意見」に関しては、まだ白紙のような状態です。もしあなたが「地球を守るのと、早くお金を稼ぐのとでは、どちらが良いですか?」と尋ねたとしても、ロボットは立場を取ることなく、単に事実を列挙するだけかもしれません。このロボットを人間に役立ち、かつ安全なものにするためには、こうした難しい問いに対して「どのように考えるべきか」を教える必要があります。このプロセスは「アライメント(調整)」と呼ばれます。
アライメントを、子犬の訓練に例えて考えてみましょう。まず、「お座り」や「待て」といった基本的なコマンドを教えます(これは教師あり微調整、またはS数(SFT)と呼ばれます)。良い行動の例を見せることで、ルールを学習させます。次に、ドッグパークに連れて行って他の犬たちと遊ばせ、社会的な合図を学ばせます。仲良く遊べていれば報酬を与え、噛み付いたら叱ります(これは好みの最適化と呼ばれます)。ここで大きな疑問が生じます。子犬は一体、いつ「性格」を学ぶのでしょうか? 基本的な訓練の間に核となる価値観を学ぶのでしょうか、それともドッグパークで性格を得るのでしょうか? もし、ロボットの価値観がどこから来るのかを理解していなければ、気づかないうちにロボットを失礼にしたり、偏見を持たせたり、危険なものにしてしまったりする可能性があるため、この理解は極めて重要です。
「Value Drifts(価値の漂流)」と題されたこの論文は、この訓練プロセスの舞台裏に入り込み、大規模言語モデル(LLM)がいつ、どのようにして価値観を学ぶのかを正確に観察しています。研究者たちは、訓練のプロセスをタイムラプス動画のように扱い、訓練が終わった後の完成品を見るのではなく、訓練のあらゆるステップにおいてロボットの「意見」をチェックしました。
以下にその結果を示します。驚くべき内容かもしれません。
1. 最初のレッスンが最も重要である
この研究は、「教師あり微調整(SFT)」のフェーズこそが、ロボットが実際に「性格」を手に入れる場所であることを明らかにしました。これは、子犬が「お座り」を学ぶ瞬間のようなものです。一度それが完了すれば、核となる行動は定まってしまいます。研究者によると、モデルが指示データセットを用いた訓練を開始するとすぐに、大きなトピック(移民や気候変動など)に対する姿勢が劇的に、かつ急速に変化することが分かりました。もし訓練データが「分かりません」といった中立的な回答で満たされていれば、ロボットは中立的になります。もしデータが「はい、やりましょう!」といった支持的な回答で満たされていれば、ロボットは支持的になります。この「価値の刻印」は、プロセスの非常に早い段階、多くの場合、訓練の最初の数百ステップ以内に起こりました。
2. ドッグパークはあまり変化をもたらさない
最初の訓練の後、モデルは「好みの最適化(ドッグパークのフェーズ)」に入ります。ここでは、人間がどちらの回答を好むかを示すペアの回答が提示されます。研究者たちは、このフェーズがロボットの価値観を微調整し、例えば、もう少し礼儀正しくしたり、役に立つようにしたりすることを期待していました。しかし、彼らはこのフェーズが、第一段階で確立された価値観を変えることにはほとんど寄与しないことを発見しました。ロボットの意見は、最初の訓練フェーズによって置かれた場所にそのまま留まっていたのです。
3. なぜドッグパークは失敗したのか(そしてどう修正すべきか)
なぜ第二段階では何も変わらなかったのでしょうか? チームは、その理由が「訓練用のご褒美(好みのデータセット)」があまりにも似通っていたためだと気づきました。標準的なデータセットでは、「良い」回答と「悪い」回答は、スタイル(一方が長く、もう一方が短いなど)が異なるだけで、持っている意見自体は全く同じであることが多かったのです。これは、二本の全く同じ棒を見せて、「どちらか良い方の棒を拾いなさい」と言って、犬にボールを取ってくる練習をさせるようなものです。選択肢が同じであれば、犬は新しい芸を学ぶことはできません。
しかし、もしあなたがロボットに明確な選択肢を与える――つまり、ある価値観を支持する回答と、それに強く反対する回答を見せる――ならば、ロボットは考えを変えることができることを研究者たちは証明しました。ただし、その「変わり方」は、ロボットを教えるために使われる特定のアルゴリズムに依存します。DPOのようなアルゴリズムは、ロボットがすでに信じていることを強化するだけの「頑固な教師」のようであり、一方でSIMPOのようなアルゴリズムは、より慎重で、小さくゆっくりとした変化をもたらします。
結論
この論文は、もしAIに特定の価値観を持たせたいのであれば、最後の「好みの調整」段階に頼ることはできないと示唆しています。重労働は、最初の「指示による訓練」の段階で行われます。もしAIにデリケートなトピックに対して中立であってほしいなら、最初の訓練データを中立的にしなければなりません。もし支持的であってほしいなら、初期データが支持的でなければなりません。最後の仕上げの段階は、主に「スタイル」のためのものであり、「ロボットの魂」を変えるためのものではありません。これは、安全なAIを構築するための最も重要な部分は、最終的なフィードバックのラウンドではなく、最初に見せる例のセットを精査することであるという、極めて重要な洞察を与えてくれます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。