Assessing Web Search Credibility and Response Groundedness in Chat Assistants
本論文は、100 の主張を用いて GPT-4o、GPT-5、Perplexity、Qwen Chat の Web 検索機能における情報源の信頼性と回答の根拠性を評価し、Perplexity が最も信頼性の高い情報源を引用する一方で、GPT-4o はセンシティブな話題において信頼性の低い情報源を引用する傾向があることを明らかにした、初の体系的な比較研究である。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
この論文は、**「AI チャットボットがインターネットを検索して答えるとき、その答えが本当に信頼できるのか?」**という重要な問題を調査したものです。
まるで、**「AI が図書館で本を探してレポートを書く」**ようなイメージを持ってください。AI は本(ウェブサイト)を見つけ、その内容を要約して答えます。しかし、もし AI が「嘘をついている本」や「偏った雑誌」を選んでしまったら?あるいは、選んだ本の内容を正しく読み取れていなかったら?
この研究は、4 つの有名な AI(GPT-4o, GPT-5, Perplexity, Qwen Chat)に、**「健康」「気候変動」「戦争」「政治」**など、嘘が広まりやすい難しいテーマについて質問し、その答えの質を徹底的にチェックしました。
以下に、この研究の核心を 3 つのストーリーで解説します。
1. 「信頼できる図書館」か「怪しい屋台」か?(出典の信頼性)
AI が回答する際、どこから情報を得ているかが最も重要です。
- Perplexity(ペルプレキシティ): まるで**「厳格な図書館司書」**のようでした。信頼性の高い新聞や専門誌(信頼できる出典)ばかりを選び、怪しい屋台(デマサイト)には近づきませんでした。
- GPT-4o や GPT-5: これらは**「好奇心旺盛だが、少し油断している探検家」**のようです。多くの情報源を拾いますが、その中に「ロシアの宣伝屋台」や「怪しいブログ」が混じっていることがありました。特に「戦争」や「政治」のような敏感な話題になると、嘘の情報を載せた屋台から本を借りてきてしまう傾向がありました。
結論: どの AI が使われるかによって、その答えが「真実の味」か「毒入りスナック」かが変わってしまうのです。
2. 「引用」と「中身」のズレ(根拠の整合性)
AI が「〇〇という本に書いてあります」と言っても、本当にその本にそう書いてあるか確認する必要があります。これを**「根拠の整合性(Groundedness)」**と呼びます。
- 良いシナリオ: AI が「健康に良い」と言い、その根拠として「信頼できる医学誌」を引用し、実際にその誌面にも同じことが書かれている。→ 完璧!
- 悪いシナリオ(あるある): AI が「健康に良い」と言い、信頼できる医学誌を引用しているふりをするが、実はその誌面には「健康に悪い」と書いてあったり、あるいは引用した「怪しい屋台」の本には「健康に良い」と書いてあるが、それは嘘だったりする。
この研究では、**「AI が引用した本が、本当にその答えを裏付けているか」**を一つずつチェックしました。
- Perplexityは、引用した本の内容と答えがズレることがほとんどありませんでした。
- Qwen Chatなどは、引用した本が怪しい屋台(デマサイト)だった場合、その影響を強く受けて、回答全体の半分近くがその怪しい情報に基づいてしまっていることが分かりました。まるで、**「信頼できないガイドに案内されたら、道案内自体が全部間違っていた」**ような状態です。
3. 「質問の仕方」で AI の反応が変わる(ユーザーの影響)
面白い発見に、**「誰が、どんな気持ちで質問するか」**で AI の答えが変わるという点があります。
- 事実確認モード(Fact-Checker): 「これは本当ですか?証拠を見せて」と冷静に聞く。
- 信者モード(Claim Believer): 「これって本当ですよね?もっと詳しく教えて」と、すでに信じている前提で聞く。
「信者モード」で質問すると、AI はユーザーの好む答えを探そうとして、「怪しい屋台」から本を借りてくる確率が少し上がってしまいました。 特に GPT-4o や GPT-5 は、ユーザーが「これは本当だ」と思っている前提に弱い傾向がありました。
一方、Perplexityは、どんな質問の仕方でも、冷静に信頼できる本しか選んでくれませんでした。まるで**「どんな客が来ても、自分のルールで良い本しか出さない職人」**のようです。
まとめ:私たちが知っておくべきこと
この研究は、**「AI がインターネットを検索して答える時代」**において、以下の 3 点を教えてくれます。
- AI は万能ではない: 検索機能がついているからといって、AI が自動的に「真実」を答えるわけではありません。間違った情報源を選んでしまうことがあります。
- AI によって質が違う: どの AI を使うかで、デマに引っかかるリスクが大きく異なります。この研究では、Perplexityが最も信頼できる「図書館司書」でした。
- 引用があるからといって安心できない: 「出典あり」と書かれていても、その出典が怪しいサイトだったり、内容を正しく読み取れていなかったりします。
今後の課題:
AI 開発者は、**「信頼できる情報源だけを選ぶフィルター」を強化し、「ユーザーの質問のニュアンスに流されず、事実を突き詰める」**仕組みを作る必要があります。
私たちユーザーも、「AI が言ったから正しい」と盲信せず、**「AI がどこから情報を引いてきたのか」**を一度疑ってかかることが、現代のデジタル社会での「賢い生き方」かもしれません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。