General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level
本論文は、Wikipediaからステレオタイプなフレーズを生成し、それらを用いてバイアスを誘発するプロンプトを特定・除去することで、マスク付き言語モデルにおけるフレーズレベルのバイアスを軽減する自動マルチトークン・パイプラインであるGeneral Phrase Debiaserを紹介しており、様々なドメインおよびモデルサイズにおいてジェンダー・ステレオタイプの有意な減少を実現している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
言語を読み書きするコンピュータは驚くほど熟練しており、ニュースの要約、文書の翻訳、さらには詩の作成さえも可能になっています。これらのシステムは「言語モデル」と呼ばれ、インターネット上の膨大なテキストを学習することで、そこに含まれるパターン、事実、意見を吸収します。しかし、人間の言語には歴史的な偏見や文化的ステレオタイプが満ちているため、これらのモデルはそれらを繰り返してしまうことがよくあります。例えば、学習データの中で最も頻繁に目にした結果として、コンピュータが「看護師は常に女性である」「数学者は常に男性である」と想定してしまうことがあります。これは、これらのツールを公平に使用しようとする人々にとって重大な問題です。なぜなら、機械が無意識のうちにジェンダー、人種、職業に関する有害なバイアスを強化してしまう可能性があるからです。研究者たちは長年こうした問題の解決を試みてきましたが、これまでの試みの多くは単語の修正に焦点を当てており、バイアスを単にいくつかの問題のある用語を入れ替えるだけの単純な問題として扱っていました。しかし、現実世界のバイアスはめったに孤立して存在しません。それは言葉がフレーズや文章へと組み合わさる方法の中に潜んでおり、そこでは意味が微妙かつ危険な形で変化するのです。
中国科学院、アリババグループ、およびブリストル大学の研究チームは、このより深い層にある偏見に対処するための新しい手法を開発しました。彼らはそのアプローチを「General Phrase Debiaser(汎用フレーズ・デバイザー)」と呼び、単一の単語ではなく言葉のグループに着目することで、言語モデルを浄化するように設計されたシステムです。研究者たちは、問題を真に解決するためには、モデルのバイアスが最も強い特定のフレーズを見つけ出し、モデルにそれらの関連性を無視するように教え込む必要があると認識しました。彼らのプロセスは、修正に必要な証拠を集めるための巧妙な方法から始まります。人間が考えられるあらゆるバイアスのあるフレーズを手動で書き出すことは、時間がかかる上に不完全であるため、このシステムはWikipediaのページをスキャンします。システムは、キャリア、数学、芸術、科学などのトピックに接続するハイパーリンクを探し出し、それらを利用してモデルが学習した可能性のあるステレオタイプなフレーズを特定します。例えば、「男性」を「数学理論」と強く結びつけ、「女性」を「ダンス芸術」と結ぶといったケースを見つけ出すのです。
システムがこれらのバイアスのあるフレーズを特定すると、次に第2段階へと進みます。それは、モデルの偏見を引き起こす正確な質問、すなわち「プロンプト」を見つけ出すことです。コンピュータに「[人物]は[空白]の専門家である」といった文章の完成を求める場面を想像してみてください。研究者たちは、コンピュータに何百万もの可能な文章を探索させ、モデルがバイアスのある推測をする可能性が最も高い文章を見つけ出させます。彼らは単一の単答を探すのではなく、「数学理論」対「ダンス芸術」のような多単語の回答を探します。なぜなら、そこにこそ真のバイアスが隠れているからです。男性の場合と女性の場合で、これらのフレーズに対してモデルがどのように異なる反応を示すかを測定することで、システムはバイアスの強さを表すスコアを算出します。研究者たちは、このスコアを用いてファインチューニング(微調整)のプロセスを導きます。彼らはこれらの特定の、バイアスを誘発する文章をモデルに再入力しますが、このとき、モデルの内部設定を調整して、その反応の差を減少させます。目的は、モデルの数学や芸術に関する知識を消去することではなく、それらの分野を特定のジェンダーと結びつけないようにすることです。
この研究の結果は、フレーズを対象にすることが単一の単語を対象にすることよりもはるかに効果的であることを示しています。研究者たちは、サイズの異なる3つの有名な言語モデルに対してこの手法をテストし、キャリアおよび学術分野の両方においてジェンダーバイアスを大幅に減少させたことを発見しました。標準的なバイアス測定テストにおいて、モデルは劇的に改善しました。例えば、モデルの一つであるBERTはバイアススコアが0.35から0.12に低下し、別のモデルであるALBERTは0.72から0.16に低下しました。これらの数値は、モデルが特定の職業や分野を特定のジェンダーと結びつける可能性が著しく低くなったことを示しています。極めて重要な点として、研究者たちはこの浄化プロセスが言語全般に対するモデルの理解能力を損なわないかどうかも確認しました。彼らは、デバイズ(脱バイアス)されたモデルに対して、文法、感情、論理をカバーする一連の標準的な言語テストを実行しましたが、モデルは元のスキルのほぼすべてを維持していることが分かりました。言語を理解する能力は損なわれておらず、有害なステレオタイプを取り除きながら、機械の知能を壊すことなく可能であることを証明しました。
このアプローチは、人工知能の修正に関する研究者の考え方の転換を意味しています。従来の方法は、人間が作成した外部の単語リストに依存したり、モデルの語彙全体を一度に修正しようとしたりすることがあり、それらは非効率であったり、バイアスの実際の仕組みにおけるニュアンスを見逃したりすることがありました。対照的に、General Phrase Debiaserは、バイアスのあるフレーズの発見を自動化し、問題が存在する言葉の組み合わせを標的にします。研究者たちは、人間によるバイアスは単一の単語ではなく、フレーズにわたる関連性のパターンであるため、このマルチトークン・レベルの修正が不可欠であると主張しています。今回の研究はエンコーダーのみのモデル(特定の種類の言語モデル)に焦点を当てたものですが、彼らが明らかにした原理は、他のタイプのシステムにも適用できる可能性があります。この研究は、言語の構造をより詳細に観察することで、よりスマートであるだけでなく、より公平なツールを構築できることを示しており、未来のコンピュータが、学習データの限界ではなく、それが仕える世界の多様性を反映するようにすることを保証するものなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。