Mitigating Cognitive Bias in RLHF by Altering Rationality
本論文は、報酬学習中に合理性パラメータを動的に調整し、LLM をジャッジとして用いてバイアスのかかった人間の比較を特定し重みを下げることで、不完全なデータセットであってもより頑健なモデルを訓練する、人間のフィードバックからの強化学習における認知バイアスを軽減する手法を提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに良い意思決定を教える方法を想像してみてください。その標準的な手法はRLHF(人間のフィードバックからの強化学習)と呼ばれます。ロボットに質問に対する 2 つの異なる回答を示し、どちらが優れているかを人間に尋ね、ロボットはその選択を模倣するように学習します。
この論文によると、問題は人間は完璧な教師ではないという点にあります。時には、脳に組み込まれたショートカットである認知的バイアスのために、私たちは間違いを犯します。
認知的バイアスを歪んだ眼鏡のペアだと考えてみてください。それらを着用すると、世界を明確に見ることもありますが、時には実際には存在しないものが見えたり、重要な詳細を見逃したりすることがあります。有名な例に「リンダ問題」があります:リンダがフェミニストの哲学専攻だと誰かに伝えれば、その人は数学的には第二の選択肢の方が確率が高いにもかかわらず、リンダが単なる「銀行員」よりも「フェミニストの銀行員」である可能性がより高いと非合理的に考えてしまうかもしれません。人間がこの「歪んだ眼鏡」を着用してロボットを教える場合、ロボットもそれらを着用して学習することになります。
従来の方法 vs 新しい方法
従来の方法(固定された眼鏡):
従来の訓練では、ロボットは人間の教師がすべての質問において同等に信頼できると仮定します。「この回答が好き」という投票を、注意を払っているか、ぼんやりしているかに関係なく、教師がすべての生徒に同じ成績をつけるのと同じ重みで扱います。研究者たちはこれを固定された「合理性パラメータ」(これをベータと呼びましょう)と呼んでいます。これは、人間の教師が常に 100% 清醒で集中していると仮定するようなものです。
新しい方法(動的な眼鏡):
著者のティファニー・ホーターと彼女のチームは、より賢明なアプローチを提案しています。ロボットはこう問うべきだと提案しています:「この人間の教師は、今バイアスにかかっている可能性が高いだろうか?」
彼らはスポットチェックを行う監督者のようなシステムを構築しました。ロボットが人間の選択から学習する前に、2 番目の AI(「LLM による判定者」)が質問と人間の選択を見て、認知的バイアス臭がするかを確認します。
- 監督者が「ああ、これは典型的なバイアスの罠に見える」と考えれば、ロボットにその人間のフィードバックの音量を下げるように伝えます。それにより「ベータ」値を下げ、その特定のレッスンの重要性を低くします。
- 監督者が「これは堅実で合理的な選択に見える」と考えれば、音量を上げ、ロボットがそこから重く学習できるようにします。
比喩:騒がしい教室
数学を教える教師と生徒(AI)がいる教室を想像してみてください。
- 問題点: 時には教師は疲れていたり、気が散っていたり、トリック質問に引っかかったりします。生徒が教師の間違いをコピーすれば、テストに落ちます。
- 従来の方法: 生徒は教師が黒板に書くすべてをコピーし、教師は常に正しいと仮定します。
- 新しい方法: 生徒の隣には賢いアシスタントが座っています。教師が答えを書くと、アシスタントは「ねえ、ここはトリック質問のせいで教師が間違っていると思うよ」とささやきます。生徒はその後、その特定の答えを無視し、教師が鋭いように見える答えに集中します。
試した結果はどうだったか?
研究者たちは、人間の論理を混乱させるように設計された 2 つのセットの難しい質問(「リンダ」問題や医療診断シナリオなど)でこれをテストしました。
- ロボットが間違いをコピーするのを防いだ: 人間が主に間違っていた(バイアスがかかっていた)データでロボットを訓練した場合でも、新しい方法はロボットが正解を見つけるのを助けました。ロボットは「歪んだ眼鏡」を無視し、真実を見つけることを学びました。
- ロボットを壊さなかった: ロボットは混乱したり、他のことをする方法を忘れたりしませんでした。バイアスを無視する能力を高める一方で、一般的なタスクにおいては賢明さを保ちました。
- 「欠陥のある」監督者でも機能した: システムはすべてのバイアスを特定する完璧な監督者を必要としませんでした。監督者が 80% の確率で正しい場合でも、ロボットは監督者が全くいない場合よりもよく学習しました。
大きな教訓
この論文は、人間のフィードバックを完璧で不変のシグナルとして扱うべきではないと主張しています。代わりに、文脈に応じて変化するノイズの多いシグナルとして扱うべきです。バイアスがかかっている可能性に応じて、人間フィードバックに与える重みを動的に調整することで、より合理的で、人間の欠陥を継承する可能性が低い AI を構築できます。
要約すると:人間が何を言ったかだけでなく、彼らがそれをどのように言ったかに耳を傾け、それに応じて学習を調整してください。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。