Position: Fairness Failure in Generative Models is an Evaluation Problem
本ポジションペーパーは、生成モデルにおける公平性の失敗は、主に非比較可能かつ非実行可能な知見に起因する評価の問題であると論じ、バイアス評価における再現性、比較可能性、および説明責任を可能にするための標準化された報告用アーティファクトとして「フェアネス・カード(Fairness Cards)」を提案するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ここ10年、コンピュータは、かつては不可能と思われていたほどの流暢さで、芸術を創造し、物語を書き、会話を行うことを学習してきました。単純な指示から画像、テキスト、動画を生み出すことができるこれらの生成システムは、今や日常生活の構造に組み込まれています。しかし、これらのツールが強力になればなるなるほど、ある執拗な影がそれらに付きまといます。それは、社会的な不平等を再現し、増幅させてしまう傾向です。コンピュータが医師の画像を生成するとき、多くの場合、男性をデフォルトとして選択します。また、リーダーについての物語を書くとき、特定の性別や人種を頻繁に選択します。これは単なるコードの不具合ではなく、機械が学習したデータの反映であり、人類の歴史におけるバイアスを映し出した鏡なのです。長年、研究者や規制当局はこの問題を修正しようと試み、これらの不公平なパターンを検出し、軽減する方法を開発してきました。その目標は常に、これらの強力なツールがすべての人々を平等な尊厳と正確さをもって扱うようにすることでした。
しかし、新たな視点は、問題はより優れた修正策の欠如にあるのではなく、むしろ修正が機能しているかどうかを判断する方法にあるのではないかと示唆しています。ある研究チームは、公平性を判定するために使用されるテストがあまりにも柔軟すぎるために、この分野が混乱のサイクルに陥っていると主張しています。ゴム製の定規が、どのように引き伸ばすかによって異なる測定値を示すのと同様に、AIの公平性をテストするための現在の手法は、研究者が行った、しばしば報告されない微細な選択によって結果を変えてしまいます。ある研究では、特定の質問の仕方を使い、そのAIは公平であると結論付ける一方で、別の研究では、わずかに異なる言い回しを用いたことで、同じAIが深く偏っていると結論付けるかもしれません。両方の研究は、それぞれの狭いルール内では技術的に正しい可能性がありますが、公衆や政策立決定者に対しては正反対の物語を伝えてしまいます。この不一致により、テクノロジーが実際に改善されているのか、それとも単に同じ問題の異なる角度を見ているだけなのかを知ることは不可能になります。
この新しい研究の背後にいる研究者たち、マリア・ヴラディミロヴァとその同僚たちは、なぜ生成モデルにおける公平性がこれほどまでに頑固な問題であり続けるのかを診断しようとしました。彼らは単にAIをより「礼儀正しく」するための新しいアルゴリズムを提案したのではなく、評価プロセスそのものを検証しました。一連の制御された実験を通じて、彼らはAIが公平であるか不公平であるかという判定が、多くの場合、テストに使用される「プロトコル」に完全に依存していることを実証しました。ある衝撃的なデモンストレーションにおいて、彼らは単一の、変化しないAIモデルを取り上げ、それをさまざまなシナリオのグリッドに対してテストしました。彼らは、質問の仕方、期待される回答のスタイル、およびテキストを生成するために使用される設定を変えてみました。その結果、同じモデルであっても、ある条件下では深刻な公平性の問題があると判断され、別の条件下では完全にバランスが取れていると判断されることがわかりました。
例えば、研究者がモデルに対して特定の職業に従事する人物についての物語を書くよう求めたとき、結果はステレオタイプに大きく偏っていました。しかし、同じモデルに対して、その人物に関する専門的なメモを書くよう求めたとき、そのバイアスは消失しました。別のテストでは、コンピュータが言葉を選択する方法、すなわち「デコーディング・レジーム(復号体制)」と呼ばれる設定を変更しました。他の研究では偶然やデフォルト設定に任せられがちなこの設定のわずかな変化だけで、「偏っている」という結論から「偏っていない」という結論へと覆るのに十分でした。研究者たちは、これらの変動がランダムなノイズではなく、評価者の選択次第で害を隠したり露呈させたりできる体系的なシフトであることを発見しました。これは、ある企業が、特定のテスト方法がたまたま良い結果を示したために、自社のモデルが公平であるという報告書を出してリリースできる可能性があることを意味します。別の方法を用いれば、重大な問題が明らかになったはずなのに、です。
論文は、この標準化の欠如こそが真のボトルネックであると論じています。私たちがより公平なモデルを構築する方法を知らないのではなく、成功したかどうかを信頼性を持って判断できないのです。現在の状況は、「アドホック(即興的)」なチェックに満ちており、研究者がテストするためのいくつかの例を選んで結果を報告しています。このアプローチは、システムが良く見えるようにテストが設計されたために、あるいはテストが狭すぎたために真の改善が見逃されたりする、著者らが言うところの「チェリーピッキング(つまみ食い)」を許してしまいます。さらに、研究者たちは、現代のAIシステムには特定の質問への回答を拒否する安全層が含まれていることが多いことを指摘しました。もしモデルがあるグループの人々に対しては質問への回答を拒否し、別のグループに対しては回答する場合、それは「アクセスの格差」と呼ばれる不公平の一形態です。しかし、現在の多くのテストは、これらの拒否を単に無視するか、あるいはエラーとして破棄しており、結果として、一部の人々が声を封じられている一方で他の人々は聞かれているという事実を隠してしまっています。
これを解決するために、チームは「フェアネス・カード(公平性カード)」と呼ばれる新しい標準を提案しています。食品のパッケージにある栄養成分表示を想像してください。AIシステムのためのものですが、栄養成分表示が食品の中に何が含まれているか、砂糖がどれくらい含まれているか、どのように加工されたかを正確に伝えるのと同様に、フェアネス・カードは、AIがどのようにテストされたかについてのあらゆる詳細をリストアップします。それは、どのような質問が行われたか、テストが何回実行されたか、回答を生成するためにどのような設定が使用されたか、そして研究者が拒否や安全ブロックをどのように扱ったかを明記します。この文書は、「公平」とは何かを規定するものではありませんが、公平性を測定するプロセスを透明かつ再現可能なものにします。もし二人の異なる研究者が結果を比較したい場合、彼らはどのようにテストを再現すべきかを正確に知ることになり、リンゴとオレンジを比較するのではなく、リンゴとリンゴを比較することを確実にします。
研究者たちは、自身の実験のために詳細なフェアネス・カードを作成することで、このアイデアをテストしました。彼らは、プロンプトに使用された具体的な言葉から、コンピュータの選択に影響を与えたランダムなシードに至るまで、あらゆる変数について記録しました。これらの詳細を公開したことで、彼らは、同じモデルであっても、どの部分のカードを見るかによって、幅広い公平性スコアを生み出し得ることを示しました。あるプロンプトのスタイルでは、モデルはステレオタイプな言語の高い割合を示しましたが、別のスタイルでは、それはほとんど見られませんでした。これらすべての数値を単一の標準化された形式で提示することにより、彼らは、モデルの公平性に関する「真実」は単一の数字ではなく、すべての変数が可視化されたときに初めて明らかになる複雑な絵図であることを証明したのです。
このアプローチは、完璧な「万能の定義」を見つけることではなく、評価自体が誠実で完全なシステムを構築することへと焦点を移します。著者らは、これがすべての問題を解決するわけではないことも認めています。一部の企業が依然としてデータを隠す可能性があることや、文化によって公平性に関する考え方が異なる可能性があることを指摘しています。しかし、彼らは、システムのテスト方法に関する詳細な共通の記録がなければ、いかなる進歩も遂げられないと主張しています。一貫して測定できないものを改善することは不可能であり、ルールの変わるゲームの中で解決策を比較することも不可能です。
論文は、研究者、開発者、および規制当局への行動喚起で締めくくられています。彼らは、新しいAIシステムがリリースされたり、その公平性に関する主張がなされたりする際には、必ずフェアネス・カードが提供されるべきであると強く求めています。この文書は、安全マニュアルやユーザーガイドと同様に、リリース時の必須項目として扱われるべきです。それは、テストされた具体的なグループ、質問を行うために使用された正確な方法、および最悪のシナリオを含む全範囲の結果を詳述すべきです。これらの選択肢を明示的にすることで、この分野は曖昧な約束から脱却し、公平性が、これらの強力なツールが構築され使用される際に、測定可能で、追跡可能であり、説明責任を伴うものであるという未来へと進むことができます。目標は、すべてのバイアスを排除すること(それは不可能かもしれません)ではなく、私たちがそのシステムを使用しても安全かどうかを判断する際に、全員が同じ証拠を見ていることを確実にすることなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。