Generative AI Responses to Patient-Presented Orthodontic Misinformation and Controversial Claims: A Comparative Cross-Sectional Evaluation of Safety, Accuracy, Evidence Concordance, Misinformation Correction, Uncertainty Communication, Transparency, and Actionability
这项比较性横断面研究评估了五种生成式人工智能聊天机器人在面对患者的牙科咨询中的表现,结果发现,虽然大多数机器人避免了提供明显不安全的建议,但它们在准确性、证据一致性和纠错能力方面表现出显著差异,这强调了需要将它们视为辅助工具而非专业评估的替代品。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人们越来越多地转向搜索引擎、社交媒体和短视频来寻找健康方面的答案。这些渠道让信息变得易于获取,但也让判断谁在说实话变得更加困难。这在正畸领域(即通过矫正牙齿和颌骨使之整齐的牙科领域)尤为明显。网络上发现的建议往往将事实与夸张、个人经历或销售手段混杂在一起。患者可能会读到某种特定类型的牙套可以改变其脸型,或者可以通过橡皮圈在家自行矫正牙齿。虽然其中一些信息是无害的,但其他说法可能会导致不切实际的期望、延迟医疗护理,甚至造成身体损伤。当一个人遇到令人困惑或危险的主张时,他们需要一个清晰、安全且准确的解释,以帮助他们决定下一步该怎么做。
近年来,一种新的工具出现了,旨在帮助人们整理信息:生成式人工智能。这些系统可以进行对话并以流利、自然的语言回答问题。它们正在变得深入日常生活,许多人现在也会向它们寻求健康建议。然而,目前尚不清楚这些系统是否能够处理纠正错误医疗主张这一棘手任务,而不至于在无意中给出危险的指令。计算机程序可能会表现得自信且礼貌,但却忽略了关键的警告,或者未能解释为什么某个流行的观点是错误的。为了了解这些工具在现实场景中的表现如何,研究人员需要针对患者实际会提出的误导性问题对它们进行测试。
来自中国医院的一组研究人员着手测试了五种最受欢迎的消费级人工智能聊天机器人。他们想看看当用户提出关于正畸治疗的错误或有争议的主张时,这些系统是如何反应的。该研究重点关注了五个特定的系统:ChatGPT、Gemini、Microsoft Copilot、DeepSeek 和 Doubao。研究人员并没有询问这类系统像“什么是牙齿?”这样简单的问题,而是根据现实世界的误导信息创建了六十八个特定的提示词。这些提示词包括关于拔牙、改变面部特征、使用自助矫正器或使用未经证实的方案加速治疗的错误想法。每个提示词都被设计包含一个错误的预设,聊天机器人需要识别并纠正这一预设。
研究人员将这六十八个问题提交给了所有五个聊天机器人,共生成了三百四十个回答。他们将每个问题视为单次的、一次性的对话,以确保结果的一致性。为了评估这些回答,五位经验丰富正畸医生进行了独立评审。他们检查了几个关键特质。首先,他们检查了安全性:回答是否鼓励了可能伤害患者的行为,例如在没有专业检查的情况下尝试移动牙齿?其次,他们衡量了准确性:信息是否符合事实?第三,他们评估了回答与既定医学证据的匹配程度。他们还检查了聊天机器人是否积极纠正了问题中的错误预设,而不是仅仅忽略它并给出一个笼统的回答。最后,他们评估了回答是否适当地传达了不确定性,是否对其来源保持透明,以及是否为患者提供了清晰、安全的下一步行动方案。
结果显示,所有五个聊天机器人通常都能避免最明显的危险。在三百四十个回答中,有三百零七个被归类为安全,意味着它们不包含可能导致直接身体伤害的建议。然而,这些系统在其他方面表现并不均衡。研究人员发现,聊天机器人在处理回答质量方面存在显著差异。ChatGPT 始终能提供最准确的信息,并且最擅长纠正问题中呈现的错误观念。它在解释自身知识局限性以及提供清晰、可操作的步骤方面也做得最好。Gemini 在某些领域表现良好,在回答与医学证据的匹配度上与 ChatGPT 持平,但在其他类别中的表现不够稳定。其他三个系统(包括 Copilot、DeepSeek 和 Doubao)的整体得分普遍较低,经常无法纠正误导信息或提供足够详细的指导。
研究的一个重要发现是,仅仅做到“安全”并不意味着一个回答足以独立使用。许多回答虽然避免了危险的建议,但仍未能纠正患者的误解或提供必要的背景信息。例如,一个聊天机器人可能正确指出牙齿需要戴牙套,但未能解释问题中提到的某种自助方法是不安全的。研究表明,虽然这些系统很少给出会导致立即受伤的指令,但它们往往缺乏进行医疗指导所需的深度和精准度。研究人员指出,系统之间的差异不仅仅是微小的变化;顶尖的模型在处理复杂且具有误导性的主张方面,明显优于其他模型。
作者得出结论,这些人工智能工具应被视为患者教育的有益补充,而非替代牙医诊疗的工具。它们可以帮助整理信息并回答一般性问题,但无法取代专业检查、X光片或个性化治疗方案的需求。研究强调,患者不应依赖这些聊天机器人来验证他们在网上看到的主张,尤其是当这些主张涉及改变牙齿或面部时。相反,这些工具的最佳用途是收集初步信息,然后寻求合格的专业人士来核实事实,并讨论安全的行动方案。研究表明,尽管技术在进步,但仍需要人类监督,以确保所给出的建议不仅是安全的,而且是准确、完整且真正对个体患者有帮助的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。