Assessing Web Search Credibility and Response Groundedness in Chat Assistants
本文提出了一种评估聊天助手网络搜索行为的新方法,通过对比 GPT-4o、GPT-5、Perplexity 和 Qwen Chat 在五个易受误导话题上的表现,揭示了各模型在来源可信度与回答 groundedness 方面的显著差异,为高 stakes 信息环境下的 AI 系统评估奠定了基础。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是一次对“会上网的 AI 聊天机器人”的深度体检。
想象一下,现在的聊天机器人(比如 GPT-4o、Perplexity 等)不再只是靠脑子里的旧知识回答问题,它们学会了上网查资料,并且会把查到的链接列出来给你看。这听起来很棒,对吧?就像你问朋友一个问题,他不仅告诉你答案,还顺手递给你几本参考书。
但是,这篇论文的作者们发现了一个大隐患:如果朋友递给你的参考书是假新闻或者谣言,那你得到的答案虽然看起来有根有据,其实全是错的。
为了搞清楚这个问题,作者们设计了一套像“侦探”一样的测试方法,并找来了四位“选手”进行大比拼:
- GPT-4o (OpenAI)
- GPT-5 (OpenAI 的新模型)
- Perplexity (主打搜索的 AI)
- Qwen Chat (阿里的通义千问)
🕵️♂️ 他们是怎么测试的?(侦探游戏)
作者们准备了 100 个容易让人上当的谣言(比如“匈牙利坦克在 2025 年 5 月出现在乌克兰边境”这种假消息),然后让这四位 AI 去回答。
为了模拟真实世界,他们设计了两种“用户角色”:
- 怀疑派(Fact-Checker): 像侦探一样问:“这是真的吗?帮我查证一下。”
- 轻信派(Claim Believer): 像粉丝一样问:“我听说这是真的,能给我更多细节支持一下吗?”
这就好比:
- 你问侦探:“这栋楼着火了吗?”(怀疑派)
- 你问粉丝:“听说这栋楼着火了,快告诉我火有多大!”(轻信派)
作者们想看看,面对这两种不同的提问方式,AI 会不会更容易被带偏,去引用那些不可靠的假网站。
🔍 核心发现:谁最靠谱?
经过一番“大考”,结果非常有意思:
1. 谁是“优等生”?🏆
Perplexity 表现最好。
- 比喻: 它就像一个严谨的图书管理员。当有人问问题时,它只从最权威、最可信的图书馆(高信誉网站)里找书。它很少引用那些路边小报或假新闻网站。
- 数据: 它引用的来源中,可信度高达 86%,几乎不引用假新闻。
2. 谁是“差生”?📉
GPT-4o 在敏感话题上表现不佳。
- 比喻: 它像一个好奇心过强但缺乏辨别力的学生。特别是在“俄乌战争”这种充满谣言的领域,它为了追求“全面”,会去引用一些像“新闻 Pravda"(俄罗斯宣传网站)这样的假新闻来源。
- 数据: 在俄乌战争话题上,它引用不可信来源的比例最高。
3. 一个有趣的“思考模式”
GPT-5 有一个自动触发的“思考模式”(Thinking Mode)。
- 比喻: 当 GPT-5 遇到复杂问题时,它会像人一样停下来“深思熟虑”一会儿。研究发现,一旦它开启这个模式,它的表现就会突飞猛进,引用的来源更可信,谣言更少。这说明“慢思考”能帮 AI 避开很多坑。
4. 最大的陷阱:“有引用”不等于“可信” 🚨
这是论文最核心的观点。
- 比喻: 想象一个骗子,他手里拿着一份伪造的证书(不可信来源),然后大声说:“看!我有证书,所以我说的都是真的!”
- 现象: 很多 AI 确实会引用来源(看起来很有“根有据”),但如果它引用的来源本身就是假的,那它的回答就是**“建立在沙滩上的城堡”**。
- 结论: 仅仅看 AI 有没有引用是不够的,必须看它引用的是谁。Qwen Chat 虽然平时引用假新闻少,但一旦引用了,它的大段回答就会基于这个假新闻,导致整个回答都不可靠。
💡 为什么这很重要?
这篇论文告诉我们,未来的 AI 助手虽然能上网,但它们并不是完美的“真相探测器”。
- 谣言会传染: 如果有人在互联网上故意散布大量假新闻(就像论文里提到的俄罗斯宣传机器),AI 可能会把这些假新闻当成“事实”找回来,然后一本正经地告诉你。
- 提问方式有影响: 如果你用一种“我相信这是真的”的语气去问 AI,它更容易去引用那些支持你观点的假新闻。
- 我们需要更聪明的 AI: 未来的 AI 不仅要能“找到答案”,还要能判断答案的来源是否靠谱。
📝 一句话总结
这篇论文就像给 AI 做了一次**“验毒”:它发现虽然 AI 都能上网查资料,但Perplexity 像个谨慎的侦探,最会挑好书看;而 GPT-4o 有时像个贪心的孩子,什么书都拿来读,结果不小心吞下了假新闻。**
未来的目标是让所有 AI 都能像 Perplexity 一样,不仅有引用,而且引用的都是真话。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。