← 最新论文
📄 medicine

Quality of Olfactory Dysfunction Information Across Digital Health Platforms: A Comparative Study of Google Search and Artificial Intelligence Platforms

这项研究表明,虽然谷歌搜索偶尔会提供高质量的嗅觉功能障碍信息,但目前的人工智能平台和数字健康资源普遍仅提供中低质量的内容且可读性较差,因此有必要引导临床医生转向经过验证的专业资源。

原作者: Harry Hubbleday, Deeya Patel, Eishaan Bhargava

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Harry Hubbleday, Deeya Patel, Eishaan Bhargava

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你的鼻子就像是你大脑的高科技安全系统。当它正常工作时,它不仅能告诉你披萨闻起来很香,还能在你遇到煤气泄漏、烟雾或变质牛奶时发出警报。但对于大约五分之一的人来说,这个报警系统是失灵或完全沉默的。这种情况被称为嗅觉功能障碍,它会让生活感觉就像生活在一个充满雾气、毫无味道的世界,影响你的饮食、社交,甚至影响你的安全感。

当人们遇到这个问题感到困惑或担忧时,他们通常会转向互联网寻找答案,就像你会搜索游戏攻略或食谱一样。过去,他们会在像 Google 这样的搜索引擎中输入问题,并希望在广告和随机博客中找到可靠的医生建议。但最近,一种新型的助手出现了:人工智能(AI)聊天机器人。这些就像是超级聪明的“会说话的机器人”,它们可以阅读数百万本书籍,然后在几秒钟内为你写出定制的答案。现在的大问题是:如果你向这些机器人询问关于你失去嗅觉的问题,它们会告诉你真相,还是只会胡编乱造?这项研究深入探讨了这个谜团,通过对比传统的搜索引擎与新兴的 AI 巨头,看看谁才是真正懂行的人。


互联网嗅觉大对决:人类 vs. 机器人

研究人员——来自谢菲尔德大学的一组好奇的科学家——决定对五个不同的数字平台进行测试。他们想看看哪一个平台能针对“失去嗅觉”提供最好、最安全且最易于理解的建议。参赛阵容包括经典的 Google 搜索(寻找链接之王)以及四款 AI 聊天机器人:ChatGPTGeminiClaudePerplexity

为了确保比赛公平,他们向所有五个平台提出了相同的八个问题。有些问题非常专业且具有医学性,比如“什么是异味症(parosmia)?”(这是一个描述气味变得扭曲的专业术语),而另一些则非常简单直白,比如“我闻不到任何东西了,怎么回事?”。随后,研究人员扮演了严格的裁判角色,从两个主要维度对答案进行评分:质量(建议是否安全且准确?)以及可读性(文字是否以普通人能理解的方式编写?)。

结果:机器人在踉跄,Google 胜出(但也仅此而已)

转折点来了:没有任何一个 AI 机器人产生了哪怕一个“高质量”的答案。

当评委使用名为 DISCERN 的严格清单对答案进行评分时,结果令人震惊。

  • Perplexity(这款 AI 会实时查找事实)在机器人中排名第一,得分为 50.56 ± 5.74。这听起来不错,但仅属于“中等”质量。
  • ChatGPTGemini 紧随其后,得分分别在 4345 左右。
  • Claude 的得分最低,为 38.13 ± 4.57,且高达 75% 的答案被评为“低质量”。

唯一能够找到一些“高质量”来源的平台是 Google 搜索。在 Google 提供的所有答案中,只有 3.75%(仅仅是极小的一块饼)被认为是真正优秀的。其余的答案大多是“中等”或“低”水平。因此,虽然 Google 没有获得金牌,但它是唯一一个甚至触及到了领奖台的平台。

缺失的部分:机器人遗忘了什么

研究发现,无论答案来自机器人还是网站,几乎每一个回答都存在一个巨大的漏洞。这些平台在回答对患者最重要的几个问题方面表现糟糕:

  1. 治疗的风险是什么?(得分:1.22 ± 0.61 / 总分 5 分)
  2. 如果我不采取任何措施会怎样?(得分:1.57 ± 0.79 / 总分 5 分)
  3. 这会对我的生活产生什么影响?(得分:1.29 ± 0.71 / 总分 5 分)

这就像是一个修理工告诉你如何修理你的车,却拒绝告诉你这种修理是否危险、如果不修理会发生什么,或者修好后车子开起来感觉如何。机器人很乐意列举症状,但它们完全跳过了关于让生活变得更好或更安全的部分。

阅读水平问题:太难读了

还有另一个问题:答案太复杂了。研究人员测量了文本的阅读难度,使用的标准是:6–8 级是推荐的患者信息水平(类似于初中水平)。

  • 所有平台的平均阅读水平为 11.01(高中水平)。
  • 只有 27.7% 的来源达到了易读目标。
  • ClaudePerplexity 是最严重的违规者,阅读水平分别为 14.6614.30。这简直是大学水平的阅读!

研究发现了一个既有趣又令人难过的模式:信息质量越高(质量越高),阅读难度就越大。这就像是最聪明的医生们是用一种只有其他医生才能理解的“秘密代码”在写作,让患者处于信息黑暗之中。

结论:先别急着信任机器人

那么,结论是什么呢?如果你失去了嗅觉,你不能仅仅询问 AI 聊天机器人并期望得到一个完美且安全的答案。目前的机器人持续无法达到医疗建议的标准,尤其是在告知你风险或治疗如何影响日常生活方面。

研究表明,医生不应只是简单地告诉患者“上网查查”。相反,他们应该引导患者去寻找由真正的医学专家和患者慈善机构创建的特定、可靠的资源。虽然 AI 可能是获取一般概念的一个酷炫起点,但它还没准备好成为你健康的最终定论。在这些机器人学会如何清晰写作并讲述完整的故事(包括那些可怕的部分)之前,最好还是让人类医生来引导你穿过这场迷雾。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →