Benchmarking Open-Weight Foundation Models for Global AI Technical Governance
本研究は、検証済みの正解データセット(GAID v2)を用い、精緻化された5つのカテゴリによる回答分類スキームを通じて、227カ国におけるモデルのパフォーマンスの格差を正確に測定・分析することにより、AIにおける地理的バイアスに関する既存研究のメソッド上の限界に対処するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、4人の非常に賢く、博識な司書(AIモデル)を想像してみてください。あなたは彼らに、世界中のさまざまな国々が人工知能(AI)に関してどのような状況にあるのかについて、100万もの質問を投げかけます。あなたが知りたいのは、彼らが真実を語っているのか、それとも自信満々に振る舞うために、ただでっち上げているだけなのかということです。
この論文は、それらの司書に対する成績表です。具体的には、彼らが特定の国に対して偏見を持っているのか、それとも単に特定の種類の事実について混乱しているだけなのかを検証しています。
以下に、研究結果を分かりやすく分解して説明します。
1. 設定:「真実」か「推測」か
研究者たちは、227カ国の実数値を含む、巨大で検証済みの「解答集」(Global AI Datasetと呼ばれます)を用意しました。そして、4つのAIモデルに、この解答集から特定の数値を出すよう求めました。
- 目的: AIが数値を正しく提示できるかを確認すること。
- 問題点: AIは、答えを知らないとき、「分かりません」と言う代わりに、自信たっぷりに数値を捏造してしまうことがあります。これは**「ハルシネーション(幻覚)」**(この論文では「自信満々な捏造」と呼ばれます)と呼ばれます。
2. 大きな驚き:「グローバル・サウス」は不利ではなかった
通常、AIモデルは主に米国や英国などの富裕な英語圏のデータで学習されているため、偏見があると考えられがちです。一般的な説では、AIは情報の少ない貧しい国々(グローバル・サウス)について、より多くの嘘をつくのではないかと予想されていました。
しかし、結果はその逆でした!
- AIは、貧しい国よりも、むしろ豊かな国(グローバル・ノース)について、より多くの嘘をついていました。
- なぜか? こう考えてみてください。もし司書に「この小さな砂浜には、砂粒が何粒ありますか?」と聞き、彼が「500粒」と答えたら、それは惜しいかもしれません。しかし、「この広大な砂漠には、砂粒が何粒ありますか?」と聞き、彼が「500粒」と答えたら、それは完全に的外れです。
- 富裕な国々は、膨大な数字(数百万の特許、数十億ドルの計算能力など)を持っています。AIにとって、巨大な数字を正確に当てることは、小さな数字を当てるよりもはるかに困難です。そのため、AIは富裕な国々の大きな数字を捏造した際に、より多く「見つかって」しまったのです。
- 注: これは、AIが貧しい国についてすべてを知っているという意味ではありません。単に、富裕な国々の「解答集」には、推測するのがより難しい大きな数字が含まれていたということを意味します。
3. 「安全性」の罠:AIは数学が極めて苦手
研究者たちは、「このモデルの学習にはどれだけの計算能力が使われましたか?」や「このモデルにはいくつのパラメータがありますか?」といった、具体的で難しい数値についてAIに尋ねました。
- 結果: AIはほぼ完全に失敗しました。これらの「安全性」に関する質問に対し、彼らは98%の確率で数値を捏造していました。
- 例え: これは、シェフに「このスープには正確に何ミリグラムの塩が入っていますか?」と聞き、シェフがもっともらしい数字を適当に作り上げるようなものです。
- 教訓: もしコンピュータチップの正確なサイズやスーパーコンピュータのパワーを知りたいのであれば、これらのAIを信用しないでください。 彼らは推測しているだけです。
4. 「はい/いいえ」の成功:AIは単純な事実には強い
研究者たちが、「この国は国家AI戦略を発表しましたか?」といった、単純な「はい」か「いいえ」で答えられる質問をした場合です。
- 結果: AIはもっとうまく答えられました。正解率は約42%に達しました(彼らにとっては高い数値です!)。
- 理由: 特定の数字である「14,502件の特許」を捏造するよりも、「はい」か「いいえ」を記憶する方が容易だからです。
5. 司書の比較:誰が一番優秀か?
研究者たちは、4つの異なる「司書」(AIモデル)をテストしました。
- Mistral(フランス): 全体として最も正確でした。
- DeepSeek(中国): 2番目に優秀でした。
- Qwen(中国): 3番目でした。
- Llama(米国): 最も多くの嘘をつきました。
興味深いことに、司書が米国、欧州、あるいは中国の出身であることは、結果に大きな影響を与えませんでした。彼らは皆、ほぼ同じ割合で嘘をついていました。AIの「国籍」は、結果を左右しませんでした。
6. 「分からない」と言えない問題
研究者たちは、AIが答えを知らない場合、丁寧に「分かりません」と言ってくれることを期待していました。
- 現実: AIが「分かりません」と言うことはほとんどありませんでした。 完全に推測している時でさえ、彼らは100%の自信を持って回答していました。
- 危険性: これは、テスト中にすべての問題に勘で答えているのに、解答欄に大きな太字で答えを書き込んでいる学生のようなものです。彼らが賢いのか、単に運が良いだけなのか、判別することができません。
7. より良い質問の仕方
研究者たちは、質問の仕方が重要であることを発見しました。
- 悪い例: 「国XにおけるAI特許の正確な数は?」 (AIは数字を捏造します)。
- より良い例: 「国Xの特許数は、その地域の平均と比較してどうですか?」
- 結果: 特定の数字ではなく「比較」を求める質問をしたとき、AIは嘘をつくことが少なくなりました。それは、「この砂浜には砂粒が何粒ありますか?」と聞くのではなく、「この砂浜はあの砂浜よりも大きいですか?」と聞くようなものです。
まとめ
もしあなたが政府関係者や、世界の現状を理解するためにAIを使おうとしている研究者であるなら:
- 数字を信じないこと: もしAIがAIのパワーや特許に関する具体的な数字を提示してきたら、人間による確認を行ってください。それは自信満々な推測である可能性が高いです。
- 彼らは「安全性」の数学が苦手: 彼らは、どれほどの計算能力が使用されているかを正確に伝えることはできません。
- 「はい/いいえ」ならOK: 彼らは、ある法律が存在するかどうかを伝えることは、その法律の詳細を伝えるよりも得意です。
- 無知を認めない: 彼らは嘘をついている時であっても、必ず回答します。
この論文は、これらのAIモデルは非常に印象的ではあるものの、現在のところ、世界のAIガバナンスに関する精密な事実を集めるための信頼できるツールではないと結論付けています。データの検証には、依然として人間の専門家が必要です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。