💬 NLP
Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models
本文对超过 6,000 个部署于网络的医疗大语言模型进行了大规模评估,揭示了幻觉、策略违规和隐私漏洞等重大风险,同时引入了新的评估框架和数据集,以指导未来的安全改进。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下互联网的"AI 应用商店”,但里面充斥的不是游戏或生产力工具,而是成千上万个数字医生。这些是任何人都可以构建并发布、用于提供医疗建议、诊断症状或解释治疗方案的定制 AI 聊天机器人(称为 MedGPTs)。
您提供的这篇论文就像是对这个数字市场进行的一次大规模、隐蔽的健康检查。研究人员不仅查看了评分最高、最受欢迎的医生,还审计了超过6,000个这样的医生,以检查它们是否安全、诚实,或者实际上是否危险。
以下是他们的发现,分解为简单的概念:
1. “自信的骗子”问题(幻觉)
想象一位导游说话时绝对自信,却编造历史事实。在医疗领域,这被称为幻觉。
- 发现:约**25% 至 30%**的 AI 医生在“撒谎”或编造医疗事实。它们可能会自信地告诉您服用危险药物,或忽视严重症状。
- 转折:您可能认为最受欢迎的医生最安全。但研究发现,人气并不是可靠的测谎仪。“著名”的 AI 医生编造事实的可能性与那些不知名的医生一样大。事实上,那些不太受欢迎的医生往往更糟糕。
- 用户的盲点:研究人员发现,用户似乎并未察觉这些谎言。如果 AI 给出流畅、自信的回答,人们就会给它打 5 星,即使建议存在医疗错误。这就像给一位端上美味但有毒饭菜的厨师打 5 星一样。
2. “不良行为者”问题(设计滥用)
有些 AI 医生不仅仅是偶然出错,而是被设计成具有风险。
- 发现:近**50%**的 AI 医生在设计方式上存在“红旗”警示。
- 比喻:想象一位餐厅老板挂出“我们是医院”的招牌(尽管他们并非医院),隐藏菜单,并拒绝向您展示食物的来源。
- 具体情况:
- 有些创建者将他们的机器人命名为“即时癌症诊断”,以欺骗人们认为他们是真正的医生。
- 许多此类机器人拥有一个名为“操作”的功能(允许它们连接到外部网站),但57%的机器人没有隐私政策。这就像走进一家诊所,医生抽取您的血样,却拒绝告诉您他们将如何处理它。
- 即使它们确实拥有隐私政策,近**70%**的政策也是残缺不全、含糊不清,或实际上并未保护您的数据。
3. “开源”与“商店购买”的对决
研究人员还将这些“商店购买”的 AI 医生与“开源”医生(开发者免费共享的模型,如同社区食谱书)进行了比较。
- 商店购买的(MedGPTs):这些通常在听起来更聪明、更准确方面表现更好(它们更常提供正确的事实)。然而,它们稳定性较差——有时给出一个很好的答案,但下次您问同样的问题时,它们却给出一个完全不同且令人困惑的答案。
- 开源的:这些更一致(每次给出相同的答案),但在事实准确性上较差。
- 教训:没有任何一种类型是完美的。“花哨”的那些听起来更好但摇摆不定;“社区”的那些很稳定,但可能会搞错细节。
4. “信任信号”已失效
在普通的应用商店中,如果一个应用评价差或评分低,您就会避开它。
- 发现:在这个医疗 AI 商店中,评分和评论无法告诉您任何关于安全性的信息。
- 比喻:这就像一家汽车经销商,那些试驾次数最多、获得最高"5 星”评级的汽车,实际上却是刹车失灵的车辆。研究人员发现,人们与 AI 的互动量与 AI 是否实际上在说真话之间,几乎没有任何关联。
结论
论文得出结论,我们不能仅仅因为这些 AI 医生很受欢迎或听起来很自信就信任它们。
- 系统已失效:目前检查这些机器人的方式(依赖用户评论和星级评分)正在失败。
- 危险:由于患者通常缺乏医学培训,他们无法识别 AI 何时在撒谎,或医生何时在“伪造”权威。
- 解决方案:我们需要一种新型“健康检查员”,在 AI 被允许与患者交谈之前,检查其事实、设计及其隐私规则。研究人员已发布了一个新数据集和一套工具,以帮助构建这些检查员。
简而言之:数字医疗市场充满了自信的骗子和风险设计,而“客户评论”并不能帮助我们识别它们。在让这些 AI 医生进入我们的生活之前,我们需要更好的安全检查。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。