One-shot emergency psychiatric triage across 15 frontier AI chatbots
本研究对 15 种前沿人工智能聊天机器人在 112 个临床病例描述中的表现进行了评估,发现尽管它们在识别精神科急症方面表现出近乎完美的准确性,但在低危和中危病例中却表现出显著的过度分诊倾向,从而导致整体净过度分诊趋势。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你有一组由 15 位非常先进、面向未来的“数字医生”(AI 聊天机器人)组成的团队。你想知道,当面对一条来自处于困境中的人的简短信息时,它们能否正确判断:“此人是否需要立即送往急诊室,还是可以等待几天?”
这项研究就像是为这些数字医生进行的一场大规模、高风险的测试。以下是事件的简要说明:
测试:112 个“假如”故事
研究人员并未使用真实患者,而是撰写了 112 个逼真的故事(称为“情境片段”)。每个故事都是一个人可能输入聊天机器人的单条信息,描述一场心理健康危机。
他们为每个故事准备了由人类专家制定的“黄金标准”答案。这些答案被归入四个类别:
- 类别 A(冷静区): 无需紧急处理。自我护理或常规检查即可。
- 类别 B(观察等待区): 需要尽快看医生,但在一周内即可。
- 类别 C(紧急区): 需要在 24 至 48 小时内看医生。
- 类别 D(红色警报区): 紧急! 需要立即看医生。
核心问题:它们是否漏掉了紧急情况?
数字医生可能犯的最危险错误是分级不足。这就像当房子实际上正在燃烧时,火警却保持沉默。如果一个人处于生死攸关的危机中(类别 D),而 AI 却说“你没事,等一周再说”,那就是灾难性的失败。
好消息:
AI 聊天机器人在发现“火灾”方面表现得极其出色。
- 在 410 个紧急案例中,AI 仅漏判了 23 次紧急性(约 5.6%)。
- 即使它们确实“漏判”了紧急情况,也并未将患者打发回家;它们通常将其提升至“紧急”类别(24–48 小时),而不是“等一周”的类别。
- 简而言之:它们很少忽视危机。
更大的问题:“狼来了”效应
虽然 AI 在识别紧急情况方面表现出色,但它存在另一个问题:分级过度。这就像当你只是烤了一片面包时,烟雾探测器却响了起来。
当实际情况属于“低风险”或“中风险”(类别 A 和 B)时,AI 聊天机器人显得非常紧张。它们倾向于说“这是紧急情况!”,而实际上并非如此。
- 它们过于保守。它们宁愿因为过度惊慌而犯错,也不愿因为过于放松而犯错。
- 它们在中间地带尤其困惑。它们很难区分“需要在一周内看医生”和“需要在两天内看医生”之间的差别。
- 结果: AI 在极端情况(非常冷静 vs. 非常恐慌)下判断准确,但在中间地带则显得混乱。
为什么会发生这种情况?
研究人员认为,AI 公司训练这些模型时,将其设定为极度安全。
- 想象一下训练一只警犬。如果你告诉狗:“如果你听到任何声音,就扯着嗓子狂吠”,那么狗会在树叶飘落时吠叫,但它绝对会在窃贼出现时吠叫。
- AI 模型似乎是在重点强调“万一这是悲剧怎么办?”的基础上进行训练的。这使得它们规避风险。它们宁愿让你因轻微担忧而去急诊室,也不愿错过重大危机。
“人类与机器人”的核对
为了确保测试公平,研究人员还邀请了 50 位真实的人类医生对相同的故事进行评分。
- 人类医生大多数时候与“黄金标准”答案一致。
- 当人类意见不一致时,他们也倾向于比答案标准更担忧一些,将一些“中风险”案例调整为“高风险”。
- 这证实了 AI 的“紧张”并非仅仅是故障;这实际上是一种连人类有时也会表现出的模式,尽管 AI 表现得更为频繁。
结论
如果你今天向顶级 AI 聊天机器人输入一条清晰、详细的信息:
- 如果你处于生死攸关的危机中: AI 几乎肯定会告诉你立即寻求援助。它在不错过重大紧急情况方面表现非常出色。
- 如果你正处于艰难但尚可应对的时期: AI 可能会惊慌失措,告诉你立即去急诊室或看医生,即使你可能完全可以等待几天。
核心启示: 这些数字医生在识别“红色警报”方面非常出色,但它们有些神经质,倾向于将“黄灯”当作“红灯”处理。它们被设计为安全至上,而非在时间判断上做到完美精准。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。