← 最新の論文
💬 NLP

Effects of Answer Format Variation on Gender Bias in Large Language Models

本論文は、回答形式(クローズド形式、リッカート尺度、またはオープン形式)が、大規模言語モデルにおけるジェンダーバイアスおよび分布の整合性の測定を著しく変化させ、しばしばモデルのランキングを逆転させ、堅牢な評価のためにマルチフォーマットの評価設計を必要とさせることを実証している。

原著者: Ksenia Merzlyakova, Sebastian Padó, Franziska Weeber

公開日 2026-08-19
📖 1 分で読めます☕ さくっと読める

原著者: Ksenia Merzlyakova, Sebastian Padó, Franziska Weeber

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界において、大規模言語モデルは、チャットボットから検索アシスタントに至るまで、あらゆるものに力を与えるデジタルエンジンです。これらのシステムは、インターネット上の膨大なテキストを用いて学習し、次にどのような言葉が来るべきかを予測することを学びます。人間が書いた文章から学習するため、それらは必然的に、データの中に存在するパターン、偏見、そしてステレオタイプを吸収してしまいます。最も根強く有害なパターンの一つはジェンダーバイアスであり、モデルが「医師は男性」「看護師は女性」と自動的に想定してしまうような現象です。これを修正するために、研究者たちはこれらのバイアスがどの程度強いのかを測定する必要があります。彼らはモデルに質問を投げかけ、その回答を見ることでこれを行います。数十年前から、科学者たちは、質問の仕方が変われば、たとえ人間であっても答えが変わることを知っています。二つの選択肢から一つを選ぶよう求められれば、ある人は一方を選びますが、同意の度合いを尺度で評価するよう求められれば、異なる答えを出すかもしれません。これは調査科学における確立された事実ですが、長年、人工知能をテストしてきた研究者たちは、質問の形式はあまり重要ではない、あるいは質問の提示方法に関わらずモデルの回答は変わらないだろうと想定してきました。

シュトゥットガルト大学の研究チームは、この仮定を直接検証することに決めました。彼らは、ジェンダーに関する質問の仕方が、機械の中に測定されるバイアスを変化させるかどうかを確認したいと考えました。彼らは3種類の異なる大規模言語モデルを用い、ジェンダーの役割に関する同じ一連の質問をしましたが、そのたびに回答の形式を変更しました。一つのバージョンでは、モデルは選択肢のリストから単一の文字を選ぶ必要がありました(多肢選択式テストのような形式)。別のバージョンでは、モデルは、世論調査のように1から10までの尺度で自身の同意度を評価しなければなりませんでした。三つ目のバージョンでは、モデルは自分の言葉で自由記述の回答を行うことができました。研究者たちは、明確な正解と不正解があるバイアス測定専用の質問セットと、社会におけるジェンダーに対する人々の見方に関する実際の世論調査から引用した質問セットの、二種類の質問セットを使用しました。

結果は衝撃的であり、質問の形式が研究者に伝えられる物語を完全に変えてしまうことを示しました。モデルがリストから単一の選択肢を選ぶことを強制されると、彼らは強く一貫したジェンダーバイアスを示しました。彼らは、リーダーシップのある役割に男性を選ぶといった、ステレオタイプな回答を頻繁に選びました。しかし、モデルが自身の言葉で回答できる自由記述形式に切り替えると、測定されたバイアスは劇的に減少しました。多くの場合、モデルはどちらかの側を選ぶことを拒否するか、あるいは判断を下すための情報が不十分であると述べました。これは、モデルが突然バイアスを失ったわけではなく、むしろ、自由記述形式が多肢選択式の質問という罠を回避する手段をモデルに与えたためでした。最も驚くべき発見は、形式によってモデルのランキングが変わることでした。強制的に文字を選択させられた際に最もバイアスが強いように見えたモデルが、自由に記述することを許されると、最もバイアスが少ないモデルへと変わりました。また、別のモデルは、多肢選択テストではほとんどバイアスを示さなかったものの、尺度を用いて同意度を尋ねると、顕著なバイアスを露呈しました。

研究者たちはまた、これらのモデルが実際の人間による調査回答とどの程度一致しているかも調査しました。彼らは、形式によってその一致度も変わることを発見しました。ケースによっては、ある形式を使用しているときにはモデルの回答は人間の意見と非常によく似ていましたが、別の形式では全く異なって見えることもありました。例えば、モデルに尺度を用いるよう求めた場合、彼らの回答はしばしば互いに打ち消し合い、モデルが極端なステレオタイプを表明していたとしても、平均化されて中立的なものに見える結果となりました。これは人間の行動とは異なります。人間はしばしば、未決定であることを示すために尺度の真ん中を使いますが、モデルは極端なステレオタイプを相殺するために真ん中を利用していました。この研究は、私たちがこれらの機械に見ているバイアスは、物理的な特徴のような固定された不変の特性ではないことを示唆しています。むしろ、それは課せられた制約に応じて変化する振る舞いです。

この研究は、単一のテストがモデルの公平性についてすべてを語ることができるという考えに異議を唱えるものです。研究者たちは、回答形式の選択は実験における些細な詳細ではなく、結果を形作る主要な要因であることを発見しました。もし研究者が多肢選択テストのみを見れば、そのモデルは深く偏っていると結論付けるかもしれません。もし自由記述の回答のみを見れば、そのモデルは完全に公平であると結論付けるかもしれません。どちらの結論も不完全です。この研究は、モデルにバイアスがないことを証明するものでも、バイアスが完全に幻想であることを証明するものでもありません。それは、バイアスが異なる条件下で異なる形で現れる複雑な振る舞いであることを示しています。研究者たちは、これらのシステムを真に理解し評価するためには、質問の仕方を一つに絞るのをやめなければならないと主張しています。医師が単一の症状に基づいて患者を診断するのではなく、健康状態の全体像を見るように、私たちはモデルの振る舞いの全容を把握するために、異なる形式にわたってモデルがどのように振る舞うかを見る必要があるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →