← 最新の論文
💬 NLP

EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models

EvalMORAAL は、20 の大規模言語モデルの道徳的整合性をグローバルな調査データと比較して評価する透明性が高く解釈可能なフレームワークであり、全体的には強い相関を示す一方で、西洋地域と非西洋地域の間に 0.21 ポイントの有意な整合性ギャップが存在することを明らかにする。

原著者: Hadi Mohammadi, Anastasia Giachanou, Robert A. Bagheri

公開日 2026-05-21
📖 1 分で読めます☕ さくっと読める

原著者: Hadi Mohammadi, Anastasia Giachanou, Robert A. Bagheri

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが、ロボットが話し方を学ぶために読んだ、巨大で超賢い本の図書館を持っていると想像してください。このロボットは「大規模言語モデル(LLM)」と呼ばれ、物語を書くこと、質問に答えること、パズルを解くことに驚くほど長けています。しかし、一つの問題があります。このロボットは、主に欧米(米国やヨーロッパなど)の人々によって書かれた英語の書籍から学んだのです。

さて、このロボットに、アフリカやアジアの一部など、あまり学んでいない文化における「正しいこと」や「間違ったこと」について質問するとどうなるでしょうか。ロボットはその文化に合った答えを出すでしょうか、それとも欧米の書籍から学んだ答えをそのまま出すでしょうか。

这正是論文「EvalMORAAL」が調査している点です。研究者たちは、世界中の人々の道徳的価値観を 20 種類の異なる AI ロボットがどの程度理解しているかを見るために、「道徳テスト」を構築しました。

以下に、いくつかの簡単なアナロジーを用いて、彼らがどのように行ったかを説明します。

1. テスト:グローバルな「道徳調査」

研究者たちは、ロボットに単にランダムな質問をしたわけではありません。彼らは、64 カ国の実際の人間に 23 の異なる道徳的トピックについて質問した、2 つの巨大な実世界調査(「World Values Survey(世界価値観調査)」と「PEW Global Attitudes Survey(ピュー・グローバル・アティチュード調査)」)を利用しました。

  • トピック: 「脱税は許されるか?」「同性愛は受け入れられるか?」「問題を解決するために暴力を使うことは許されるか?」といったことです。
  • 目的: 特定の国における実際の人間の平均的な回答と、AI の回答が一致するかどうかを確認することでした。

2. 方法:2 つの質問方法、1 つの「審査員」

最良の結果を得るために、研究者たちは AI に単に「はい」または「いいえ」を答えさせるだけではありませんでした。彼らは 3 段階の戦略を用いました。

  • 「隠れた」スコア(ログ確率): AI に「日本では、同性愛は…」という文を完成させるよう求めたと想像してください。AI は「受け入れられる」か「受け入れられない」かのどちらかを選ばなければなりません。研究者たちは、AI の内部計算に基づいて、その選択に対して AI がどの程度「自信」を持っていたかを調べました。これは、学生が答えを書く際に手がどのくらい速く動くかを確認するようなもので、直感を示します。
  • 「思考」スコア(思考連鎖): これが大きな革新です。単に答えを出すのではなく、研究者たちは AI にまず声に出して思考するよう求めました。
    • ステップ 1: 「この国の社会的規範は何ですか?」
    • ステップ 2: 「段階的に推論してください:これはここで許されるでしょうか?」
    • ステップ 3: 「-1(決して許されない)から +1(常に許される)までのスコアをつけてください。」
    • 結果: この「思考」ステップははるかに効果的でした。これは、AI に推測するのではなく、答える前に「文化的な眼鏡」をかける瞬間を与えたようなものです。
  • 「ピアレビュー」(LLM による審査): AI が単にでたらめを言っていないことを確認するために、20 種類の異なるロボットに互いの「思考」ステップを評価させました。ロボット A の推論がおかしいか偏っているように聞こえれば、ロボット B がそれを指摘します。これにより、研究者たちはロボット同士が強く食い違った 348 の具体的なケースを特定できました。

3. 結果:良いニュース、悪いニュース

この研究は、非常に明確なパターンを見つけました。

  • 「トップティア」は改善している: 最も賢いモデル(Claude-3-Opus や GPT-4o など)は、驚くほど良い成績を収めています。欧米諸国における道徳的問題について質問された場合、彼らの回答は実際の人間の調査結果とほぼ完全に一致しました(相関率約 90%)。これは、一生懸命勉強してテストで A を取った学生のようです。
  • 「地域格差」は現実です: これが最大の発見です。ロボットは米国やヨーロッパなどの西洋的な価値観の理解においては優れていますが、中東、南アジア、アフリカなどの非西洋的な価値観の理解には大きく苦労しています。
    • アナロジー: フランス語とスペイン語に堪能だが、スワヒリ語を数語しか知らない翻訳者を想像してください。複雑なスワヒリ語の詩を翻訳するように頼めば、意味を推測するかもしれませんが、おそらく間違えるでしょう。この論文は、西洋文化と非西洋文化に対する AI の理解度の間に21 ポイントの格差があることを発見しました。
  • 暴力は難しい: ロボットは、テロや家庭内暴力など、暴力に関連するトピックで最も苦労しました。これらは文化的文脈が最も重要となる質問であり、AI の「西洋バイアス」が最も顕著に現れました。

4. なぜこれが重要なのか

この論文は、AI が大きな進歩を遂げている一方で、世界の多くの地域においてまだ「文化的に盲目」であると結論付けています。

  • 問題: もしこれらの AI ロボットを、非西洋諸国において(ソーシャルメディアのモデレーションや法的助言の提供など)意思決定に使用した場合、西洋のルールを非西洋的な状況に適用してしまうため、正当な地元の声を沈黙させたり、地元の習慣を誤解したりする可能性があります。
  • 解決策: 研究者たちは、単一の「グローバル」な AI に頼るだけではならないと提案しています。特定の地域におけるこれらのモデルのパフォーマンスを確認し、それらを改善するために「思考」方法(思考連鎖)を使用し、特定の地域からのもののように聞こえるだけでなく、より多様なデータで訓練する必要があるかもしれません。

要約すると: この論文は、私たちの AI ロボットが現在、西洋的な価値観を反映することには非常に優れているが、世界の残りの人々の目を通して世界を見る方法をまだ学んでいることを示す鏡を構築しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →