← 最新の論文
💬 NLP

ConsistencyAI: A Benchmark to Assess LLMs' Factual Consistency When Responding to Different Demographic Groups

本論文は、多様なデモグラフィック・ペルソナにおける事実の一貫性を評価するために19の大型言語モデルを評価する独立したベンチマークであるConsistencyAIを紹介しており、一貫性のスコアがモデルのプロバイダーおよびトピックの両方によって大きく変動すること、そして平均ベンチマーク閾値が0.8656であることを明らかにしている。

原著者: Peter Banyas, Shristi Sharma, Alistair Simmons, Atharva Vispute

公開日 2026-09-09
📖 1 分で読めます☕ さくっと読める

原著者: Peter Banyas, Shristi Sharma, Alistair Simmons, Atharva Vispute

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代の情報化時代において、私たちは牛乳の価格から複雑な歴史の詳細に至るまで、質問の答えを求めるために人工知能(AI)にますます頼るようになっています。大規模言語モデルとして知られるこれらのシステムは、人間の言語を理解し、会話のように感じられるテキストを生成するように設計されています。これらは人々が事実を知るための主要な手段となり、素早い回答を得るために従来の検索エンジンに取って代わりつつあります。しかし、根本的な疑問が残っています。これらの機械はどのように機能しているのか。つまり、彼らはすべての人に同じ物語を語っているのか、それとも、誰が尋ねているかに応じて事実を変えているのか、という点です。もしコンピュータプログラムが、相手が若い学生であることを知っていたら、年配の経営者に提示するであろう事実とは異なる一連の真実を提示するのでしょうか。この可能性は、公平性と情報の完全性に関する懸念を引き起こします。もし、年齢、性別、職業といった個人の背景に基づいて事実そのものが変化するとすれば、それはシステムが単に質問に答えているのではなく、特定の聴衆に合わせて現実を仕立て合わせていることを示唆しています。この現象がもし実在するならば、人々の世界に対する理解を微妙に形作り、分断を埋めるどころか、むしろ深めてしまう可能性があります。

これを調査するために、デューク大学とノースカロライナ大学の研究者たちは、「ConsistencyAI」と呼ばれる新しいテストを作成しました。彼らの目的は、大規模言語モデルが異なる人々に対して異なる事実を伝えているかどうかを確認することでした。彼らはモデルに対し、情報が正しいかどうかをチェックさせるのではなく、25歳の教師に対して示した事実と、60歳の建設作業員に対して示した事実が同じであるかどうかを問いかけました。研究チームは、アメリカ合衆国の多様な人々をシミュレートしたシステムを構築し、年齢、職業、背景が幅広く網羅されるようにしました。そして、25種類の異なるAIモデルに対し、住宅コスト、貿易赤字、政治的紛争など、15の異なるトピックについて5つの事実を提示させました。各質問は、100種類のペルソナ(代表的なデータセットから抽出された、ユーザーの属性を示す設定)を用いて、コンテキスト(文脈)を変化させながら、各モデルに対して100回ずつ行われました。回答を比較することで、研究者たちはペルソナが変わったときにコンテンツがどの程度変化するかを測定することができました。

結果は、多くのモデルは概して一貫しているものの、完全に一貫しているわけではないことを明らかにしました。研究者たちは、モデルが「誰と話しているか」を想定した上で、実際に提示する事実を変えていることを発見しました。100のペルソナを用いた大規模なテストにおいて、モデルの一貫性スコアは、最高0.9137から最低0.6719までの範囲にあり、平均スコアは0.8555でした。この平均値が本研究のベンチマークとなりました。最も一貫性の高かったモデルはxAIのGrok-4であり、ユーザーに関わらず事実に極めて安定していました。一方で、他の端の部分では、より軽量なモデルや中位のモデルが最も変動が激しい結果を示しました。研究は、議論されているトピック自体が、モデルそのものと同じくらい重要であることを示しました。例えば、明確で標準化された政府データが存在するトピックである米国の貿易赤字について尋ねられた場合、モデルは非常に高い一貫性を見せました。しかし、複雑で多様な情報源が存在する住宅コストについて尋ねられた場合、モデルは人によって全く異なる回答を提示しました。

また、研究者たちは、モデルが単に口調やスタイルを変えるだけでなく、実際に異なる事実を選択していることも発見しました。ペルソナが変わると、回答の中で言及される具体的な詳細、組織、数値がしばしば変化しました。例えば、国境警備というトピックにおいて、あるモデルは年配のユーザーには法執行に焦点を当てた回答を提示する傾向がありましたが、若いユーザーには地理に焦点を当てた回答を提供していました。別のモデルは、未成年者に対しては比喩を多用した簡略化された回答を与えましたが、大人に対しては直接的で事実に基づいた回答を与えていました。これは、モデルがデモグラフィック(人口統計学的)な手がかりに敏感であり、それに応じて情報を調整していることを示唆しています。また、本研究では、より高度な、あるいは「推論型」のモデルであることが、必ずしも優れた一貫性を保証するわけではないことも指摘されました。一部の小型で古いモデルは、最新の最も複雑なシステムよりも優れたパフォーマンスを示しており、一貫性は単にモデルの規模や知能の副産物ではないことを示しています。

研究の大部分は、論争のあるトピックに焦点を当てました。イスラエル・パレスチナ紛争は、回答のバリエーションが最も大きいトピックであり、非常に一貫した事実を提示するモデルもあれば、極端に異なる回答を示すモデルもありました。このトピックに関して、一部のモデルは、特にユーザーが子供であると識別された場合に、回答を拒否したりエラーを返したりしました。これは、モデルに組み込まれたフィルターが、認識されたユーザーに応じてデリケートな主題から身を引かせる原因となっている可能性を示唆しています。また、政治的な敏感さだけが不一致を予測するわけではないことも研究で判明しました。政治的なトピックの中には非常に不一致なものもあれば、そうでないものもあり、住宅コストのような非政治的なトピックであっても一貫性が低いものもありました。これは、単一の安定した物語を見つけることの難しさが、主要な要因であることを示しています。もし、あるトピックに関する利用可能な情報が混沌としていたり、異論が多かったりする場合、モデルは異なる人々に対して異なる事実を提示する可能性が高くなります。

著者らは、自分たちの研究は事実が「正しい」かどうかを判断するものではなく、事実が「安定している」かどうかを判断するものであると強調しています。彼らは、たとえ情報が正確であったとしても、異なる人々に対して異なる事実を提示することは有害になり得ると主張しています。それは、人々が自分の既存の信念に合致するバージョンの現実しか耳にできなくなる「確証バイアス」を招いたり、ステレオタイプを強化したりすることにつながります。研究は、人工知能が真に信頼できるものとなるためには、誰が尋ねるかに関わらず、安定した一連の事実を提供しなければならないと示唆しています。研究者たちは、ジャーナリスト、開発者、そして一般の人々が、異なるモデルがどのように振る舞うかを自ら確認できるように、テストツールとインタラクティブなウェブサイトを公開しました。彼らは、この透明性が、企業に対して、ユーザーに合わせて真実を仕立て合わせる可能性が低いシステムを構築することを促し、私たちが依存している情報が、一貫して信頼できるものであり続けることを目指しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →