← 最新の論文
💬 NLP

A multilingual hallucination benchmark: MultiWikiQHalluA

本論文は 306 言語を網羅する多言語幻覚ベンチマーク「MultiWikiQHalluA」を導入し、それを用いて幻覚発生率が低リソース言語および小規模モデルにおいて有意に高く、評価対象の欧州言語においては最大規模のモデルが最良の性能を示すことを実証する。

原著者: Freja Thoresen, Dan Saattrup Smart

公開日 2026-05-06
📖 1 分で読めます☕ さくっと読める

原著者: Freja Thoresen, Dan Saattrup Smart

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが非常に賢く、多言語を操り、ウィキペディアの記事を読み、それに関する質問に答えるのが大好きなロボットを想像してみてください。あなたが「アイスランドの首都はどこですか?」と尋ねると、ロボットは「レイキャビク」と答えます。素晴らしい!しかし、このロボットはときどき少し創造的になりすぎることがあります。「レイキャビクは月に位置しています」とか、「首都は『アイスバーグ』という都市です」といった具合にです。文は滑らかで自信に満ちて聞こえますが、それは完全に作り話です。AI の世界では、これをハルシネーション(幻覚)と呼びます。

この論文は、ロボットのための新しい「嘘発見器」のようなものです。しかし、英語のみをチェックするのではなく、研究者たちは306 種類の異なる言語、コンピューターがあまり見慣れない言語(アイスランド語などを含む)でも機能するテストを構築しました。

彼らがどのように行ったか、その物語を簡単に説明しましょう。

1. 問題:「流暢な嘘つき」

ロボットが正直かどうかを検証するテストのほとんどは、英語のみをチェックするものです。これは、ある一つの都市だけで運転免許試験を受け、他のすべての地域でも安全に運転できると想定するようなものです。研究者たちは知りたいと考えていました:ロボットは、あまり得意でない言語を話すとき、より頻繁に嘘をつくのでしょうか?

彼らは「ハルシネーション」を具体的に忠実性(faithfulness)として定義しました。つまり、ロボットはあなたが話した物語に忠実でしたか?

  • 良いロボット: 猫についての物語を読み、「猫はオレンジ色です」と言います。
  • ハルシネーションを起こすロボット: 猫についての物語を読み、「実は猫はドラゴンです」と言います。(もっともらしく聞こえますが、物語には含まれていません)

2. 解決策:「フェイクニュース」工場の構築

嘘発見器を教育するために、研究者たちはロボットが実際に嘘をついた膨大な量の例が必要でした。しかし、ロボットが自然に嘘をつくのを待つのは、時間がかかりすぎます。

そこで、彼らは合成工場を構築しました。

  • 306 言語を網羅する、膨大な実在の質問と回答のデータセット(MultiWikiQA)を取得しました。
  • 超高性能な AI(GPT-5)を用いて、正解を意図的に書き換え、出典テキストに基づけば事実誤認であるが、もっともらしく聞こえるようにしました。
  • これを306 言語すべてで行い、「偽の回答」の巨大なライブラリを作成しました。
  • その後、これらの嘘を見分けるために、より小さく専門的な AI(「トークンレベルの分類器」)を訓練しました。この分類器は、真実のためのスペルチェックのようなものです。単語の綴りが正しいかチェックするのではなく、文の中の特定の単語が元の物語に属しているのか、それとも作り上げられたものなのかをチェックします。

彼らはこれらの「真実のスペルチェック」を30 のヨーロッパ言語で訓練し、英語、ドイツ語、デンマーク語、アイスランド語の 4 言語でテストしました。

3. 実験:ロボットをテストする

研究者たちは 5 つの異なる AI モデル(小さなものから巨大なものまで)を入手し、それらに 4 つの言語で質問に答えるよう求めました。その後、彼らの新しい「真実のスペルチェック」を回答に適用し、テキストの中にどれだけの嘘が隠されているかを確認しました。

4. 結果:サイズは重要だが、言語の方がより重要

彼らが発見したことを、いくつかの簡単な比喩を使って示しましょう。

  • 「小さなロボット」は苦労する: 最小の AI モデル(Qwen3-0.6B)は、最悪の嘘つきでした。まるで十分に勉強せず、ただ推測した学生のようなものです。アイスランド語では、**回答の 60%**に少なくとも 1 つの嘘が含まれていました。
  • 「大きなロボット」は優れている: より大きく強力なモデル(700 億パラメータのものなど)は、事実に忠実である点で格段に優れていました。彼らはグループ内の「優等生」でした。
  • 「言語の格差」: これが最も重要な発見です。ロボットは、あまりよく知らない言語では、はるかに頻繁に嘘をつきました
    • 英語とドイツ語(ロボットが非常に得意とする言語):嘘は非常に少ない。
    • デンマーク語とアイスランド語(ロボットがあまり得意としない言語):嘘がはるかに多い。
    • アイスランド語が最も困難でした。最高のロボットでさえ、英語よりもここで多く嘘をつきました。まるで、一度も見たことのない料理をシェフに作らせるようなもので、材料を間違えて推測する可能性が高くなります。

5. 意外な展開

「ロボットが大きいほど、嘘は少なくなる」と思うかもしれません。しかし、そう単純ではありません。場合によっては、言語によっては中型のロボットの方が巨大なロボットよりも優れていました。これは、ロボットがどれほど大きいかだけでなく、どのように訓練されたか(どの言語を学んだか)が同様に重要であることを示唆しています。

6. 落とし穴(「トークン」の問題)

研究者たちはまた、技術的な奇妙な点にも注意を促しました。アイスランド語のような言語では、コンピューターは理解するために単語を多くの小さな断片(トークン)に分割します。英語では 1 つの単語が 1 つの断片として扱われるかもしれませんが、アイスランド語では、同じ単語が 5 つの断片になることがあります。

  • 比喩: 文のエラーをチェックすると想像してください。単語ごとにチェックすると 1 つのエラーが見つかるかもしれません。しかし、文字ごとにチェックすると、単語が長いだけで 5 つのエラーが見つかるかもしれません。
  • 研究者たちは警告しています。アイスランド語における「嘘の数」が高く見えるのは、部分的に単語がより多くの断片に切り分けられているためであり、意味が同じであっても、検出器が「嘘」を見つける機会が増えているからだと。

まとめ

この論文は、306 言語で AI モデルが事実を捏造しているかどうかを検出できる、新しいオープンソースのツールを紹介しています。彼らは、より大きなモデルが一般的に正直である一方で、ロボットはアイスランド語のようにあまり馴染みのない言語では、ハルシネーションを起こしやすいことを発見しました。彼らは、誰でも使用できるように、「フェイクニュース」データセットと「真実の検出器」を公開しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →