Analysing Moral Bias in Finetuned LLMs through Mechanistic Interpretability
本論文は、意図性判断における道徳的バイアスであるクノーブ効果が、ファインチューニングされた大規模言語モデルにおいて出現すること、そしてそれが特定の層に局在化可能であり、再学習を行うことなく標的を絞ったレイヤー・パッチング介入を通じて軽減可能であることを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに「優れた裁判官」になる方法を教える場面を想像してみてください。単にルールブックを与えるのではなく、人々が選択を行う何千もの物語を見せ、「その人は善かったですか、それとも悪かったですか?」と問いかけます。時間をかけて、ロボットはパターンを学習していきます。しかし、ここからが厄介なところです。人間は完璧な裁判官ではありません。私たちにはしばしば、隠れたバイアスがあります。例えば、もし人が偶然に悪い結果を引き起こした場合、私たちは「彼はそれを意図していたのだ!」と言いやすく、良い結果を引き起こした場合よりもその傾向が強くなります。これは「クノーベ効果(Knobe effect)」と呼ばれる有名な心理学的特性です。まるで私たちの脳に、悪い事故は意図的なものだと考え、良い事故は単なる運だったと考える組み込みのフィルターがあるかのようです。
科学者たちは、もしロボットを私たちのように振る舞うよう教えるなら、ロボットも同じような奇妙なフィルターを拾ってしまうのではないかと懸念しています。もしロボットが私たちのために道徳的な決定を下すのであれば、私たちは知る必要があります。それは人間のように考えているのか、それとも単なる巨大な計算機なのか? ここで「メカニスティック・インタープリタビリティ(機械論的解釈可能性)」が登場します。巨大なロボットの脳を、何百万もの小さな作業員(ニューロン)がメモをやり取りしている巨大な都市だと考えてみてください。メカニスティック・インタープリタビリティとは、どの作業員がどのメモを渡しているのかを正確に見通すための、X線メガネをかけるようなものです。ロボットがなぜ特定の答えを出したのかを推測する代わりに、機械の内部を覗き込み、特定の歯車がどのように回っているかを見るのです。これが重要なのは、もしバイアスがどこに存在するかを特定できれば、システム全体を再構築することなく、その一つの歯車だけを修正できるかもしれないからです。
この論文の研究者たちは、このアイデアをテストすることに決めました。彼らは、人気のあるAIモデル(具体的にはLlama、Mistral、Gemma)が「クノーベ効果」を習得しているかどうか、そしてもし習得しているならば、AIの脳内のどこにそのバイアスが隠れているかを見つけられるかどうかを調べたいと考えました。彼らはまず、人間のボランティアに対して行われたものと同じ道徳的な物語を用いて、AIモデルをテストしました。その結果、「生の(raw)」AIモデル(まだ人間に話すように教えられていない状態)は、このバイアスをほとんど示さないことが分かりました。彼らの回答は非常にバランスが取れていました。しかし、研究者がモデルを「ファインチューニング(微調整)」したとき、つまり、指示に従ったり人間の好みに合わせたりするように訓練したとき、バイアスが突如として現れました。AIはまさに人間のように振る舞い始めたのです。つまり、悪い結果は意図的なものであると言う確率が、良い結果の場合よりもはるかに高くなったのです。
しかし、本当の魔法は機械の内部を見たときに起こりました。「レイヤー・パッチング(層のパッチ適用)」という手法を用いて、研究者たちはAIを、高層ビルのフロアのような積み重なったレイヤーの集合体として扱いました。彼らは、バイアスがいたるところに散らばっているのではなく、特定の層に固まっているのではないかと疑いました。これをテストするために、彼らはバイアスのない「生の」モデルから「思考(活性化)」を取り出し、それをバイアスのある「ファインチューニング済み」のモデルへと、一層ずつ入れ替えました。それは、クリーンで偏りのない設計図を取り出し、腐敗した建物の特定のフロアの上に貼り付けることで、構造全体が再び正直なものに戻るかどうかを確認するような作業でした。
結果は驚くほど精密でした。彼らは、バイアスがランダムに散らばっているのではなく、AIの脳の中層から上層にかけて局所化していることを発見しました。さらにエキサイティングなことに、バイアスのないバージョンの特定のレイヤーを一つ入れ替えるだけで、クノーベ効果をほぼ完全に消し去ることができることが分かりました。一部のモデルでは、バイアスが1.6や3.8という強い値から、ほぼゼロ(0.00または0.03)まで低下しました。しかも素晴らしいことに、彼らはモデルを再学習させたり、重みを変更したりすることなくこれを行いました。それは外科的な修正でした。彼らはまた、この「手術」によって、一般的な質問に答えるといったAIの他の能力が損なわれないかを確認しましたが、モデルは以前と同じくらい賢いままでした。
この論文は、こうした社会的バイアスは、システム全体から湧き上がる謎めいた、修正不可能な魔法ではないことを示唆しています。むしろ、それらはAIの脳に書き込まれる、特定の局所的なパターンであり、私たちがAIを人間らしく振る舞わせようとする訓練プロセスの中で刻み込まれるものです。これらのX線メガネと外科的な入れ替えを用いることで、研究者たちは、AIを役に立つままの状態に保ちつつ、望まない人間の癖を取り除くための標的を絞った介入が可能であることを示しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。