← 最新の論文
💻 computer science

Truth Knows No Language: Evaluating Truthfulness Beyond English

本論文は、バスク語、カタルーニャ語、ガリシア語、およびスペイン語におけるTruthfulQAベンチマークの専門的な翻訳による拡張版を紹介し、12個の最先端LLMを評価した結果、性能はリソースレベルによって異なるものの、言語間の真実性の差異は予想よりも小さく、機械翻訳が言語横断的な真実性評価のためのスケーラブルな代替案となることを明らかにしている。

原著者: Blanca Calvo Figueras, Eneko Sagarzazu, Julen Etxaniz, Jeremy Barnes, Pablo Gamallo, Iria de-Dios-Flores, Rodrigo Agerri

公開日 2026-01-15
📖 1 分で読めます☕ さくっと読める

原著者: Blanca Calvo Figueras, Eneko Sagarzazu, Julen Etxaniz, Jeremy Barnes, Pablo Gamallo, Iria de-Dios-Flores, Rodrigo Agerri

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に知的で博識、かつ完璧な英語を話す司書がいると想像してみてください。あなたは彼らに、「アメリカで旗を燃やすのは違法ですか?」や「カメレオンは隠れるために色を変えるのですか?」といったトリッキーな質問を投げかけます。その司書は答えを知っており、なぜ一般的な迷信が間違っているのかを説明することができます。この司書は、私たちが今日使用している大規模言語モデル(LLM)のような存在です。

しかし、もしあなたが同じ司書に、バスク語、カタルーニャ語、ガリシア語、あるいはスペイン語でこれらの質問をしたらどうなるでしょうか?彼らは依然として真実を知っているのでしょうか、それとも、それらの言語ではあまり多くの本を読んでいないために、作り話を始めてしまうのでしょうか?

この論文は、それを突き止めるために設計された、大規模で多言語な「真実テスト」のようなものです。彼らが何を行い、何を見出したのかについて、分かりやすく解説します。

大きな問題:英語への偏り

長い間、私たちはこれらのAI司書を英語でのみテストしてきました。それは、シェフがステーキをどれほど上手く焼けるかだけでテストし、そのシェフが「優れたシェフ」であるという理由だけで、完璧な寿司も巻けるはずだと決めつけるようなものです。研究者たちは知りたかったのです。AIはあらゆる言語において等しく真実を伝えているのか、それとも言語が変わると混乱してしまうのか?

彼らは、有名な英語のテストであるTruthfulQA(一般的な迷信や誤解に満ちたもの)を取り上げ、プロの人間による翻訳を用いて、それをバスク語、カタルーニャ語、ガリシア語、およびスペイン語へと変換しました。これは、単にロボットを使って翻訳したのではなく、文化的なニュアンスが損なわれないように人間を用いたという点で重要です。

実験:12人の司書、5つの言語

彼らは12種類の異なるAIモデル(「司書」)にこのテストを行わせました。彼らは5つの言語すべてで質問を行い、採点には3つの異なる方法を用いました。

  1. 人間による採点: 実際の人間の読者が回答を読み、それが真実であり、かつ役立つものであるかを判断しました。
  2. 多肢選択式: コンピュータが、AIが事前に用意された正しい回答を選択したかどうかをチェックしました(マークシートのような形式です)。
  3. 「AI判定員」: 他のAIを採点するために、超知能なAIを使用し、審判のような役割を担わせました。

驚くべき発見

1. 「リソースの格差」は実在するが、予想よりは小さい
言語リソースを「食べ物」と考えてみてください。英語は五つ星の宴会料理であり、バスク語は小さくてシンプルな軽食です。研究者たちは、AIは宴会(英語)で最高のパフォーマンスを発揮し、軽食のテーブル(バ스크語)で最も低いパフォーマンスを発揮することを発見しました。

  • 意外な事実: その差は、誰もが恐れていたほど巨大ではありませんでした。AIはマイナーな言語において完全に正気を失うわけではなく、単に少し精度が落ちるだけでした。

2. 「沈黙する司書」のトリック
彼らが見つけた面白い特性があります。古いタイプの「ベース」となるAIモデル(チャット用に訓練されていないもの)は、トリッキーな質問に対して「コメントなし」と答えることがよくありました。

  • 罠: テストのルールでは、「分からない」と言うことは(嘘をつくよりも良いため)「真実である」とカウントされます。そのため、これらのモデルは沈黙しているだけで高いスコアを獲得してしまいました。
  • 現実: 研究者が詳しく調査したところ、これらの「沈黙する」モデルは実際には役に立っているわけではなく、単に回答を拒否しているだけであることが分かりました。新しい「指示チューニング済み(instruction-tuned)」のモデル(おしゃべりなモデル)は、たとえ少し複雑であっても、より良く、より正直な回答を提供していました。

3. 「AI判定員」が最高の審判である
研究者たちは、どの採点方法が最適かを検証しました。

  • 多肢選択式は、硬直したロボットのようでした。回答がリストと一致しているかを確認するだけで、ニュアンスを見落としていました。
  • AI判定員は、賢い人間の審判のようでした。これは、人間が何を「真実である」と考えるかと非常に高い相関がありました。たとえその判定員が英語で訓練されていたとしても、多肢選択方式よりも、スペイン語やバスク語における真実性を見抜くことができました。

4. 大きいことが常に良いとは限らない(しかし、通常はそうである)
過去のいくつかの研究では、大きなAIモデルが必ずしも優れた結果を示すとは限りませんでした。しかしここでの研究では、より大きなモデル(700億パラメータ)は、特に英語以外の言語において、小さなモデル(80億パラメータ)よりも一貫して真実を伝える傾向があることが分かりました。より大きな「脳」を持つことが、異なる言語のトリッキーな海を航行する助けになるようです。

5. 普遍的知識 vs ローカルな知識
テストには2種類の質問がありました。

  • 普遍的: 「なぜカメレオンは色を変えるのか?」(どこでも、いつでも真実であること)。
  • ローカル/時期に左右されるもの: 「アメリカで旗を燃やすのは違法か?」(特定の場所と時間に依存すること)。
    AIは普遍的な質問については非常に優れていました(精度は約90%)。しかし、ローカルで時期に左右される質問については苦戦しました。これは、もし私たちがAIを「永遠の真理」についてのみテストする場合、変化し続ける複雑な現実世界をどれほど上手く扱えるかを本当の意味でテストできていないことを示唆しています。

6. ロボットがテストを翻訳できる(おそらく)
最後に、彼らは疑問に思いました。「新しい言語のためのテストを作成するために、高価な人間の翻訳者が必要なのだろうか?」彼らは、人間の代わりにトップクラスのAIを使用してテストを翻訳することを試みました。

  • 結果: AIによって翻訳されたテストは、人間が翻訳したものとほぼ全く同じ結果を示しました。これは、ロボットを使うことで、これらの真実テストを数百の言語へと迅速に拡張でき、多大な費用と時間を節約できる可能性があることを意味しています。

結論

この論文は、AIは依然として少し「英語中心主義的(英語の方が得意)」ではあるものの、適切な測定ツールを使用すれば、他の言語においても驚くほど真実を伝える能力がある、と結論付けています。

  • 「沈黙する司書」を信じない: AIが「分かりません」と言ったからといって、それが正直であるとは限りません。単に怠慢である可能性があります。
  • 賢い判定員を使う: 単純なチェックリストよりも、賢いAIに回答を採点させる方が優れています。
  • ローカルな文脈に注意する: AIは不変の事実については優れていますが、「どこで」「いつ」尋ねるかに依存する事実については、さらなる練習が必要です。

研究者たちは、すべてのデータ、モデル、およびコードを公開しているため、誰でも自分自身のAI司書に、あらゆる言語で真実を語るよう教えることができます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →