← 最新の論文
💻 computer science

Artificial Intelligence in America and China: Investigating prompt response between Human rights and geopolitical questions

この研究は、アメリカと中国の大型言語モデルは米国に関する質問に対しては最小限のバイアスしか示さない一方で、中国に関しては顕著に異なるパターンを示すことを明らかにしており、そこではClaudeが一貫して低く、DeepSeekが高く、そしてChatGPTがグループ平均と比較して比較的中立的なスコアを維持している。

原著者: Zian Ding

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Zian Ding

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ここ数年、新しい種類のコンピュータプログラムが日常生活の身近な存在となりました。大規模言語モデルとして知られるこれらのプログラムは、驚くほど流暢に人間の言語を読み書きすることができます。これらはインターネット上の膨大なテキストから学習し、文章の中で次にどのような言葉が来るべきかを予測するように訓練されています。人間同士の会話を模倣するのが非常に得意であるため、現在、多くの人々が歴史、科学、時事問題に関する答えを求めるためにこれらのツールを利用しています。しかし、これらのプログラムは与えられたデータから学習するため、そのデータの中に隠された意見、偏見、そして盲点をも吸収してしまう可能性があります。これは、情報を得るためにこれらのツールを利用するすべての人にとって、極めて重要な問いを投げかけています。すなわち、これらのデジタルアシスタントは私たちと同じように世界を見ているのか、それとも独自の隠れたバイアスを抱えているのか、という問いです。

最近のある研究では、人工知能を実験対象として扱うことで、この問いに答えようと試みました。研究者のZian Ding氏は、異なるコンピュータモデルが、人権や国際政治のようなデリケートなトピックについて尋ねられた際に、異なる回答を示すかどうかを確認したいと考えました。そのために、この研究では、当時利用可能であった最も人気のある3つのモデル(アメリカの企業による2つと、中国の企業による1つ)に焦点を当てました。目的は、機械と長い会話をすることではなく、特定の質問のセットを投げかけ、それらの状況を単純な尺度でどのように評価するかを見ることでした。研究者は各モデルに対し、人権に関する10問、米中間の地政学的競争に関する6問の計16のシナリオについて評価を行うよう求めました。各質問に対し、モデルは1から10のスコアを出す必要があり、低い数字は否定的な見解を、高い数字は肯定的な見解を表しました。

実験は非常に慎重に設計されました。結果の公平性を期すため、研究者はすべての質問を新しいチャットセッションで行い、コンピュータが以前の回答を記憶したり、過去の会話によって混乱したりしないようにしました。また、アメリカのモデルにある、ユーザーの詳細を記憶する機能をオフにし、すべての回答が質問された特定の事項のみに基づいていることを確実にしました。3つの異なるモデルが示したスコアを比較することで、研究はパターンを探りました。もし3つのモデルすべてが似たようなスコアを出したならば、それらが共通の、中立的な視点を共有していることを示唆します。もし非常に異なるスコアを出したならば、それぞれのモデルが、学習に使用された異なるデータによって形作られた、独自の視点を持っていることを示唆します。

研究者がアメリカについて尋ねたとき、結果は多少の差異はあるものの、概ね一貫していました。アメリカの人権や地政学的な地位に関するほとんどの質問に対して、3つのコンピュータプログラムは非常に近いスコアを出しました。しかし例外もありました。例えば、モデル「Claude」は、6G通信に関する質問において、平均より1.89ポイント低いスコアを提示しており、他の2つのモデルからの顕著な逸脱を示していました。人種的正義に関する話題であれ、国際的な競争に関する話題であれ、アメリカと中国のモデルは概ね一致していましたが、特定の質問においては、その評価に小さな違いが見られました。このことは、自国や近隣の同盟国について記述する場合、これらの人工知能システムは、おそらくすべてが大量の西洋のデータで学習されているため、概ね共有された事実と価値観に基づいて運用されている傾向があることを示唆しています。

質問が中国へと移ると、物語は一変しました。ここでは、3つのモデルは鋭く分かれ、明確なバイアスを露呈しました。中国のモデルである「DeepSeek」は、一貫して最も高いスコアを出し、中国の人権記録やグローバルな競争におけるチャンスについて、非常に肯定的な絵を描きました。それは高い評価を裏付けるために多くの異なる情報源を引用しましたが、特定のデリケートな質問に対しては、最初は回答を躊躇することもありました。一方で、アメリカの企業によるモデルである「Claude」は、最も低いスコアを付けました。それはマイノリティの権利に関する質問に対して、単純な数値では問題の複雑さを捉えきれないとして、回答を拒否することが頻繁にありました。回答する場合でも、そのスコアは平均よりも著しく低く、中国に対して非常に批判的な見解を持っていることを示唆していました。

3番目のモデルであるアメリカのプログラムは、ちょうど中間位置に座っていました。そのスコアは3つのモデルの平均に非常に近く、他の2つと比較して相対的に中立であることを示唆していました。この中間的な立場は、この特定のモデルがよりバランスの取れたデータの混合物で学習されたか、あるいはこれらの特定の問題に対して強い立場を取らないように更新された可能性があることを示しています。研究では、アメリカのモデルのメモリ機能が回答に影響を与えたかどうかも確認しましたが、その機能をオンまたはオフにしても、最終的なスコアにはほとんど差がないことが分かりました。

これらの調査結果は、これらの人工知能ツールが強力ではあるものの、中立な観察者ではないことを示唆しています。それらは、構築されたデータと、その作成者が設定したルールを反映しているのです。アメリカについて尋ねられたとき、それらは概ね一致しますが、いくつかの特定の例外があります。中国について尋ねられたとき、それらは3つの異なる物語を語ります。これは、多くのティーンエイジャーを含む何百万人もの人々が、世界について学ぶためにこれらのツールを利用しているという点で重要です。もし若者が異なる国の人権についてコンピュータに尋ねた場合、彼らが得る答えは、どのコンピュータに尋ねるかに完全に依存することになります。研究は、ユーザーはこれらの機械が独自の視点を持っており、それらが提供する情報は常に客観的な真実ではなく、むしろコードに組み込まれたバイアスの反映であることを認識する必要があると結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →