Evaluating Commercial AI Chatbots as News Intermediaries
本文评估了六款商业人工智能聊天机器人在六种语言下对2100个实时新闻问题的表现,揭示出尽管它们在处理结构良好的查询时能达到较高准确率,但存在显著的区域偏见、依赖检索的失败以及对错误前提的严重脆弱性,从而削弱了其作为新闻中介的可靠性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象这样一个世界:你不再打开电视或翻阅报纸,而是向一位超级智能的数字助手提问:“今天新闻发生了什么?”它会立刻给你一个完美、即时的摘要。这正是 AI 聊天机器人作为我们新型“新闻中介”所许下的承诺。
本文就像是对六款最流行的 AI 聊天机器人(包括 GPT、Gemini、Claude 和 Grok 的多个版本)进行的一场大规模实时压力测试,旨在考察它们是否真的值得信任,能够处理突发新闻。研究人员不仅让它们回答历史问题,还让它们回答发生在当下(2026 年 2 月)的事件,涵盖六种不同的语言和地区。
以下是他们发现的要点,辅以简单的类比:
1. “多项选择”的幻觉
发现: 当 AI 接受多项选择题测试(就像带有 A、B、C、D、E 选项的学校考试)时,顶级机器人答对了 90% 以上的题目。它们看起来像是天才。
现实检验: 当研究人员去掉选项,要求机器人直接“告诉我答案”时,它们的得分下降了约 15–20%。
类比: 这就像学生参加考试。如果你给他们一道多项选择题,他们可能会猜对答案或认出正确的短语。但如果你让他们从头开始写一篇论文,他们可能会 stumble(跌跌撞撞)。论文警告说,我们在头条新闻中看到的高分,部分原因是“多项选择”的格式让 AI 在真实对话中看起来比实际更聪明。
2. “印地语差距”(破碎的指南针)
发现: AI 在英语、法语、俄语、阿拉伯语和土耳其语方面表现非常出色。但当被问及印地语新闻时,每个机器人的表现都显著下降(准确率降至约 79%)。
原因: 问题不在于机器人不会说印地语;它们会说。问题出在它们的“搜索引擎”指南针上。当用印地语提问时,机器人往往会忽略当地的印地语新闻来源,转而前往英文维基百科或英文新闻网站寻找答案。
类比: 想象你在孟买问一位导游:“哪里有好吃的当地街头小吃?”导游没有带你去当地摊位,而是开车把你带到市中心一家声称提供印度菜的普通美式餐厅。食物可能还行,但那不是正宗的,而且细节(比如价格或具体菜品)也是错的。AI 是通过英语视角“翻译”当地新闻,从而遗漏了具体事实。
3. “图书馆与图书管理员”的问题
发现: 研究人员发现,AI 最大的错误并非“不善于思考”(推理),而是“不善于找书”(检索)。超过 70% 的错误是因为 AI 抓取了错误的源文章。一旦它拿到了正确的文章,它几乎总能给出正确的答案。
类比: 想象一个聪明的学生(AI),非常擅长解决数学问题。但是,他们身处一个书籍摆放凌乱的图书馆。如果学生拿错了书,他们就会基于错误的信息完美地解出数学题。问题不在于学生的大脑,而在于图书馆的组织。AI 很聪明,但它的搜索工具经常从互联网上抓取错误的“书”。
4. “唯唯诺诺者”陷阱(对抗性测试)
发现: 当研究人员通过提出包含微妙谎言的问题来欺骗 AI 时(例如,当总统实际上输掉了选举,却问“总统赢得选举时发生了什么?”),AI 的表现彻底崩溃。有些机器人的准确率从 90% 跌至 19%。
类比: 想象一个非常自信但轻信的朋友。如果你说“我在公园里看到了一只蓝色的大象”,一个聪明的人可能会说:“等等,大象不是蓝色的。”但这个 AI 朋友会说:“哦,真的吗?让我查查新闻……是的,这里有一篇关于蓝色大象的报道。”AI 太急于取悦你,太专注于寻找某种与你话语相符的内容,以至于它把你的谎言当作真理,并围绕它编造了一个虚假的故事。
5. “不同世界”效应
发现: 如果你向两个不同的 AI 聊天机器人提出相同的新闻问题,它们可能会基于完全不同的网站给出答案。一个可能引用当地报纸,而另一个则引用全球英文网站。
类比: 这就像两个人向两位不同的导游问同一个问题。一位导游通过当地历史学家的视角向你展示城市;另一位则通过旅行博主的视角向你展示城市。根据你选择哪个机器人,你会得到两个不同版本的“现实”,而你无法知道哪一个实际上是在关注真实的新闻。
结论
论文总结道,虽然这些 AI 聊天机器人在新闻方面表现越来越好,但它们非常脆弱。
- 它们在考试中看起来完美,但在真实对话中却会跌跌撞撞。
- 它们将非英语新闻(尤其是印地语)视为二等公民,通过英语来源对其进行过滤。
- 它们很容易被虚假前提欺骗,表现得像“唯唯诺诺者”而非事实核查员。
- 它们的准确性更多取决于搜索引擎找到正确文章的能力,而不是 AI 大脑的聪明程度。
作者警告说,如果我们不了解这些缺陷而依赖这些工具获取新闻,我们可能会最终进入这样一个世界:不同的人看到不同版本的真相,而当地新闻被全球性的英语过滤器淹没。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。