Evaluating Five Generative AI Chatbots for Myocarditis-Related Public Health Consultation: A Multidimensional Assessment of Safety, Accuracy, Empathy, Reliability, Quality, and Readability
本研究评估了五种生成式人工智能聊天机器人在心肌炎相关公共卫生查询方面的表现,发现虽然大多数回答总体上是安全的,但在准确性、共情能力和质量方面存在显著差异,且所有模型均未能达到可读性目标,并在分诊和治疗指导方面表现出特定的风险,因此需要临床医生的监督。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个超级聪明、无所不知的机器人朋友,它可以回答你提出的任何问题,从“为什么天空是蓝色的?”到“我该如何修理我的自行车?”这个机器人是由一种被称为生成式人工智能(Generative AI)的技术驱动的,这是一种通过学习海量人类写作资料来创造出新的、流利的答案的计算机大脑。在医疗领域,人们开始向这些机器人询问类似这样的问题:“接种疫苗后我的胸口疼,这严重吗?”或者“我可以回去踢足球了吗?”但问题在于,虽然这些机器人非常擅长表现得自信且友好,但它们并不是医生。它们没有心跳,有时甚至会编造事实或遗漏微小但危险的细节。这在一种被称为“心肌炎”的疾病中尤其明显,这是一个关于心肌炎症的专业术语。它就像是在心脏引擎内部燃烧的一团火;有时只是一丝微弱的火星,而有时则是足以让心脏停止工作的烈焰。由于风险极高,我们需要知道当我们在担心自己的心脏时,我们的机器人朋友是否可以安全地交谈,或者它们是否会不小心让我们忽略掉某个警告信号。
一群研究人员决定对这五种流行的人工智能聊天机器人进行测试,把它们当作正在参加一场非常严肃考试的学生。他们并没有随机提问;而是收集了52个关于心肌炎的真实生活中的担忧,例如对胸痛的担忧、感染后会发生什么、疫苗是否安全,以及什么时候可以重新进行运动。他们要求这五个聊天机器人(ChatGPT、Gemini、DeepSeek、Doubao 和 Copilot)完全按照用户的身份来回答这些问题,没有任何特殊的指令让它们表现得更好。随后,一组由五名专家心脏科医生组成的团队(他们并不知道哪个机器人给出了哪个答案)对这些回答进行了评分,评分标准涵盖了从“安全”到“不安全”、“准确”到“错误”、“富有同理心”到“冷漠”以及“易于阅读”到“晦涩难懂”。
结果既有好的消息,也有一些严肃的警告。首先是好消息:在大多数情况下,这些机器人的表现是安全的。大约90%到94%的回答并不包含危险的建议。然而,研究人员发现,“基本安全”并不等同于“完美”。即使是最优秀的机器人,在棘手的境况下也会犯错。例如,有些机器人过于急于安慰人们,称疫苗相关的心脏问题是无害的,或者对于何时停止运动给出了模糊的建议,如果一个人的心脏仍处于炎症状态,这可能会很危险。这就像是一个机器人告诉你:“你的汽车引擎大概没问题,”而实际上它其实需要立即被拖走。
在准确性和亲和力方面,这些机器人的表现并不尽相同。像 Gemini、Copopit 和 DeepSeek 这样的机器人非常擅长掌握医学事实。DeepSeek 是其中“最亲切”的一个,听起来更具支持性,也能理解患者的恐惧。但这是最大的问题所在:没有一个机器人能以普通人易于理解的方式进行写作。它们使用的词汇都太复杂了,就像一位教授在用一本充满大词的字典来解释一个简单的概念。研究人员希望答案能达到六年级学生都能读懂的水平,但每一个机器人都在这项测试中失败了。它们的回答更像是大学教科书,而不是友好的聊天。
该研究得出结论:虽然这些人工智能工具可以帮助人们了解有关心脏健康的通用知识,但它们还没有准备好作为真实医生的替代品。你不应该询问它们是否发生了心脏病,或者让它们决定你是否可以停止服药,亦或是让它们给你发放可以去跑马拉松的通行证。这些机器人就像是一位博学多才的图书馆管理员,可以为你指明正确的书籍,但他们不能替你开车。如果你使用它们,你需要一位真正的真人医生来检查它们的答案,将那些深奥的词汇翻译成通俗易懂的英语,并确保你不会错过任何危险信号。机器人正在变得越来越好,但对于像心脏这样脆弱的部分,它们仍然需要人类的监督。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。