← 最新论文
💬 NLP

Ask Before You Diagnose: Safe-Psych, a Sequential Evaluation Benchmark for LLMs in Psychiatry

该论文介绍了 Safe-Psych,这是一个使用 1,000 多份真实世界精神科病历构建的序列基准测试,旨在揭示即使是具有安全意识提示词的最先进大语言模型,在识别不完整的临床信息方面仍然存在困难,经常做出过早的诊断,或是在无法请求澄清的情况下表现不佳。

原作者: Oriana Presacan, Andreea Grama, Larisa Irimină, Alireza Nik, Jaya Ojha, Vajira Thambawita, Ciprian I. Băcilă, Bogdan Ionescu, Michael A. Riegler

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Oriana Presacan, Andreea Grama, Larisa Irimină, Alireza Nik, Jaya Ojha, Vajira Thambawita, Ciprian I. Băcilă, Bogdan Ionescu, Michael A. Riegler

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正试图破解谜团的侦探。在人工智能的世界里,存在着一些超级聪明的计算机程序,被称为“大语言模型”(LLMs)。你可以把它们想象成博学多才的侦探,读过几乎所有的书籍、文章和笔记。当事实摆在面前时,它们非常擅长回答问题。但在现实世界中,尤其是在医院这样的地方,侦探很少能一次性获得全部真相。他们可能在这里得到一个线索,在那里得到一份证人陈述,或者得到一个目前还无法拼凑在一起的证据。

科学家们正在提出的核心问题是:这些人工智能侦探能否知道自己何时“缺乏足够的线索”来破案?一个真正聪明的侦探不应该仅仅因为很有信心就去猜测凶手;他应该说:“等等,我还需要再问一个问题,”或者“我现在还无法解决这个问题。”这被称为“校准”——即知道自己知道什么,更重要的是,知道自己“不知道”什么。如果人工智能在诊断过早,可能会导致严重的错误。但如果它在明明可以解决问题时却拒绝回答,那它就会变得毫无用处。寻找这种完美的平衡点,是让人工智能在医疗领域变得安全的“圣杯”。

于是有了 Safe-Psych,这是一个旨在测试这种特殊技能的新型实验,而这个场景设定在复杂的精神医学领域。研究人员创建了一个特殊的游戏,他们并没有一次性把患者的完整档案交给人工智能。相反,他们扮演起真实医生的角色,将患者的故事碎片化地展示出来:首先只给出症状,然后是病史,接着是检查结果,以此类推。在每一步中,人工智能都必须做出决定:“我有足够的资料进行诊断了吗?”“我是否应该要求更多信息?”或者“我是否应该承认我卡住了?”

结果却像是一记警钟。论文发现,即使是科技界最先进的“超级侦探”模型,在判断何时该停下来寻求帮助方面也表现得很糟糕。当信息不完整时,这些模型仍然会坚持进行猜测。事实上,对于测试的大多数模型来说,它们在证据不足的情况下仍尝试进行诊断的频率超过了 60%。这就像是一个侦探在只听到前门打开的声音后,就大喊:“是管家干的!”而从未去检查过客厅。

研究人员还尝试通过给人工智能一条特别指令来教它变得更加谨慎,即:“只有当你确定时才进行猜测,否则请说‘我不知道’。”这确实起到了一点作用,但也产生了一个新问题:人工智能走到了另一个极端。它不仅没有减少过度猜测,反而开始在明明可以得出正确结论时拒绝进行诊断。这就像是那位侦探因为害怕犯错,最后决定永远不去破获任何案件一样。这项研究表明,仅仅告诉人工智能要“安全”并不能真正教会它如何识别信息的缺失;它只是将错误从“猜错”转移到了“拒绝猜测”。

或许最有趣的发现是关于“时机”的问题。当人工智能等到看到所有线索后再做出判断时,它的准确率要高得多。但当它在只看到前几句话后就急于诊断时,其准确性就会大幅下降。论文表明,能力并不等于安全性:仅仅因为一个模型足够聪明,能在拥有完整故事时得出正确答案,并不意味着它知道自己何时拥有了完整的证据。

简而言之,Safe-Psych 揭示了我们目前的 AI 侦探仍然过于急于破解谜团。它们需要学习最难的一课:有时,侦探所能做的最重要的事情,就是在指认嫌疑人之前,先承认自己还需要更多线索。在它们学会这一点之前,我们无法完全信任它们去协助医生做出关乎生死的决策。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →