← 最新の論文
💬 NLP

Cultural Awareness is Represented but Not Decoded: Tracing Mythological Knowledge across 18 Open-Source LLMs

本論文は18種類のオープンソースLLMを調査し、それらが多様な文化の神話的知識を内部的に表現している一方で、非主流派の伝統を一貫して想起できない原因は、これらの表現を主流派の伝統のトークンへと崩壊させてしまうデコーダーの読み出しバイアスにあり、この限界はプロンプトの言語によってさらに影響を受けるものであることを明らかにしている。

原著者: Iaroslav Chelombitko, Ekaterina Chelombitko, Mika Hämäläinen

公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Iaroslav Chelombitko, Ekaterina Chelombitko, Mika Hämäläinen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

文化的な大バグ:なぜAIはゼウスを知りながらウッコを忘れるのか

想像してみてください。あなたは、インターネット上のほぼすべての本が入っている、巨大でハイテクな図書館に足を踏み入れました。この図書館は、あらゆるページを読み終えた超スマートなロボット司書によって運営されています。あなたが司書に「ギリシャ神話における神々の王は誰ですか?」と尋ねると、司書は即座に「ゼウス!」と叫びます。「ローマ神話の神々の王は?」と聞けば、「ジュピター!」。「北欧神話の神々の王は?」と聞けば、「トール!」。「ロボットは完璧です。しかし、次にあなたが「フィンランド神話における最高位の空の神は誰ですか?」と尋ねると、ロボットはためらい、口ごもり、最終的には間違った答えを出すか、あるいは「わかりません」と言うかもしれません。

これは単なるランダムな間違いではありません。一つのパターンなのです。ロボットは「人気のある」物語(ギリシャ、ローマ、北欧)については知っていますが、「あまり有名ではない」もの(フィンランド、スラブ、エジプト、中国)については苦戦しているようです。これは、ロボットが学習した図書館が、主に英語の本や西洋の物語で満たされていたために起こります。しかし、ここで大きな謎があります。ロボットは本当にこれらのあまり知られていない神々を「忘れて」いるのでしょうか、それとも知っているのに正しい名前を言うことを拒んでいるのでしょうか?

これを解決するために、科学者たちはロボットの「脳」(実際には大規模言語モデルと呼ばれる複雑なコンピュータプログラム)の内部を覗き見るための特別なツールを使用します。彼らは、情報がメモリ(エンコーダー)の中で失われたのか、それともメモリは正常だが答えを話す部分(デコーダー)が壊れているのかを知りたいと考えています。これは、テストを受けている学生に例えることができます。もし学生が間違った答えを書いたとしたら、それは知識がなかったからでしょうか、それとも完璧に知っていたのに緊張して間違ったことを書いてしまったのでしょうか? この論文は、文化的なバイアスが正確にどこで発生しているのかを見つけ出すための、ロボットの脳の中へと踏み込む探偵物語です。

調査:ロボットの脳の内側へ

研究者のイアロスラフ、エカテリーナ・チェロムビトコ、そしてミカ・ヘマライネンは、18種類の異なるオープンソースAIモデルをテストすることに決めました。彼らはただランダムな質問をしたわけではありません。古い民俗学の本に基づいた、非常に巧妙で構造化されたゲームを用いました。彼らは有名な神話のカタログから27の特定の役割(「最高位の空の神」、「太陽の神」、あるいは「トリックスター」など)を選び出し、10の異なる文化(ギリシャ、ローマ、北欧、フィンランド、ウクライナ、インド、エジプト、中国、日本、メソポタミア)におけるその役割のキャラクターを名指しするようロボットに求めました。

ロボットの内部で何が起きているかを見るために、彼らは4つの異なる「X線」ツールを使用しました。

  1. 線形プロービング(Linear Probing): ロボットの内部メモリに正しい文化的ラベルが「含まれている」かどうかを確認するテスト。
  2. ロジット・レンズ(Logit Lens): レイヤーごとにロボットの思考を覗き込み、いつ答えを決めているのかを確認する方法。
  3. アクティベーション・パッチング(Activation Patching): 「もしも」の実験。ある文化の内部的な思考を別の文化に入れ替えて、答えが変わるかどうかを確認する。
  4. 出力抽出(Output Extraction): 単純にロボットに質問し、実際に何と答えるかを見る。

大きな発見:脳は正常だが、口が壊れている

結果は驚くべきほど明確でした。研究者がロボットのメモリ(残差ストリーム)を覗き込んだとき、ロボットは実際にはその文化を完璧に理解していることがわかりました。

想像してみてください。ロボットの脳が巨大なファイルキャビネットだとします。あなたがフィンランドの神について尋ねると、ロボットの内部ファイルには明らかに「フィンランド神話」というラベルが付いたフォルダがあり、その中に正しい名前が入っています。「線形プロービング」ツールを使うと、このフォルダを高い精度(多くの場合60%から88%の正解率)で読み取ることができました。ロボットは、ギリシャの神とフィンランドの神の違いを理解していたのです。

しかし、ロボットが言葉を発そうとすると、失敗したのです。

これが主要な発見です。失敗は「表現(representation)」ではなく、「読み出し(readout)」で起きています。 ロボットは答えを知っていますが、言葉として出力しようとする際、固有のユニークな名前(例えばフィンランドの空の神に対する「ウッコ」)を、最もポピュラーでデフォルトな名前(例えば「ゼウス」や「トール」)へと崩壊させてしまうのです。

研究者はこれを**「デコーディング抑制(Decoding Suppressed)」**と呼んでいます。18のモデルを用いた研究において、これが最大の課題でした。すべてのモデルにおいて、大部分の時間(51%から76%の間)で、ロボットの内部メモリは正しかったにもかかわらず、最終的な回答は間違っていました。それは、答えが「フィンランド」であることを知っている学生が、書き留める際に、先生の机の上にあるもの(=西洋的なもの)が目に入っているために、自動的に「ギリシャ」と書いてしまうようなものです。

否定された仮説

論文では、自分たちの正しさを確実にするために、他のいくつかのアイデアについても検証を行いました。

  • ロボットは「翻訳のみ」を行っているのではない: 一部の人々は、ロボットは頭の中ですべてを英語に翻訳してから、再び翻訳しているだけだと考えていました。もしそうであれば、ロボットの脳内では文化的な違いさえ認識されていないはずです。しかし、研究によれば、脳内では明確に違いを認識しています。
  • モデルのサイズだけの問題ではない: 研究者は、より大きなモデル(より多くの「脳の力」を持つもの)がこの問題を解決するかどうかをチェックしました。その結果、大きなモデルはわずかに改善は見られるものの、「答えを知っていること」と「答えを言うこと」の間のギャップは決して埋まらないことがわかりました。最大級のモデルであっても、依然としてこのバイアスを持っていました。
  • 単なる言語の問題ではない: ロボットがネイティブ言語(フィンランド語やウクライナ語など)を読めないために失敗しているのかどうかをテストしました。その結果、たとえロボットがその言語を読めていたとしても、依然として「英語/西洋的」なデフォルトの回答を好むことが判明しました。バイアスは、ロボットの読解能力にあるのではなく、意思決定の部分にあるのです。

言語のひねり

この研究の中で最も興味深い部分の一つは、同じ質問を2通りの方法、つまり英語と、その文化の母国語(例:フィンランドの神について英語で聞く場合と、フィンランド語で聞く場合)で尋ねることでした。

彼らは、ロボットの脳がスイッチのように機能することを発見しました。英語で尋ねると、答えを決めるために一つの経路を使用します。フィンランド語で尋ねると、少し異なる経路を使用します。母国語で尋ねることでロボットが正しい答えを出せるようになることもありましたが、多くの場合、ロボットは依然として有名な西洋の名前をデフォルトとして選んでしまいました。

研究者は、もし同じ質問を英語と母国語の両方で行い、どちらかから最良の答えを取り出せば、ロボットに新しいことを教えなくても、エラーの約36%を修正できることを発見しました。これは、二人の友人に答えを確認してもらうようなものです。一人が「ゼウス」と言い、もう一人が「ウッコ」と言った場合、正しい方を選ぶことができるのです。

結論:脳ではなく、口を直す

論文は、問題はAIがフィンランドやスラブ、あるいはエジプトの神話を知らないことではないと結論づけています。AIはそれらを知っています。 問題は、テキストを生成するAIの部分が、文化的デフォルトによって「ゲート(門)」をかけられていることです。AIは、トレーニングデータの中で最も一般的で支配的な詳細へと、ユニークで具体的な文化的詳細を平坦化してしまう癖があるのです。

これは、文化的なバイアスを修正するためには、単にロボットにフィンランド神話の本をもっと読み込ませる(それはメモリには役立ちますが、メモリはすでに存在しています)べきではないことを意味します。むしろ、ロボットが「話す」部分を修正する必要があります。たとえ「ゼウス」の方が安全で一般的な答えだと感じても、「ウッコ」と言うことが許されるのだと、ロボットに教える必要があるのです。

この研究は、解決策は単に脳全体を再学習させることではなく、「読み出し(readout)」への介入、つまりロボットが最終的な言葉を選択する方法を変えることにあると示唆しています。これは、機械がすべての情報を持っているからといって、必ずしも真実を話してくれるとは限らないということを思い出させてくれます。時には、彼らは単に、あなたがそれを望んでいると思うことを言っているだけなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →