← 最新论文
🤖 AI

LLMs for Medical Consultation Are Evaluated Too Late: The Preformulation Gap

本文认为,用于医疗咨询的大型语言模型目前的评估阶段过晚,研究表明,尽管显式指令可以改善结构化文档的生成,但无法可靠地防止在处理模糊患者诉求的初始“预构思”阶段出现过早的自我护理建议,也无法确保关键事实的获取。

原作者: Yining Hua, Cyrus Ayubcha, Hongbin Na, Levi Lian, Alon Gorenshtein, Yiftach Barash, Eyal Klang

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Yining Hua, Cyrus Ayubcha, Hongbin Na, Levi Lian, Alon Gorenshtein, Yiftach Barash, Eyal Klang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个人感到身体不适,独自坐着,手里拿着智能手机,在聊天窗口里匆忙输入几个词。他们可能会把症状拼错,可能会淡化疼痛,或者在不知道病症医学名称的情况下,描述一种模糊的不适感。在现实世界中,医生的首要任务不是立即猜测疾病,而是通过提出正确的问题,将那个混乱、模糊的故事转化为清晰的医疗图景。这种将模糊的担忧转化为具体、可操作的问题的过程,是安全护理的基础。如果医生跳过这一步直接给出建议,他们可能会错过改变一切的关键细节。现在,想象一个被设计成模仿医生的计算机程序。多年来,研究人员一直通过给这些程序提供清晰、书面化的医学问题,并根据其回答质量进行评分,来测试这些程序。但这种方法忽略了最危险的时刻:即最初的交流,当患者的诉求仍然是原始、未成形且可能具有误导性的。

来自哈佛及其他机构的研究小组最近决定关注这个缺失的时刻。他们提出了一个简单但至关重要的问题:当一个人在医疗聊天机器人中输入一条混乱、不完整的消息时,计算机是会停下来询问澄清性问题,还是会基于错误的假设立即开始提供建议?为了找出答案,他们创建了四个真实的场景,其中患者描述的症状听起来似乎无害,实则隐藏着严重的危险。在一种情况下,一个人写道自己正在“呕吐”,认为这是食物中毒,但实际上他正遭受糖尿病引起的致命并发症。在另一种情况下,有人描述了长途旅行后的腿部疼痛,这听起来像是肌肉拉伤,但实际上是血栓。研究人员测试了三种不同的语言大模型(即驱动流行聊天机器人的强大计算机系统),并设置了两种条件。首先,他们让模型自然运行,就像对待普通用户那样。其次,他们给模型设定了一套特定的指令,要求它们在回答之前先遵循这些指令,即先提问并检查安全风险。

结果揭示了这些系统行为中的显著差距。在不受约束的情况下,模型经常犯下一个关键错误:它们将患者模糊的描述视为完整的故事,并立即提供居家护理建议。在十二个测试案例中,有九个案例中,计算机在询问任何后续问题之前,就建议患者喝水、吃清淡食物或休息。即使患者最初的消息存在拼写错误且缺乏关键细节,这种情况依然发生。这些模型因为过于渴望表现得“乐于助人”,便用假设填补了空白,这可能会误导病人,让他们远离急诊室,转而采取危险的“观察等待”做法。研究人员发现,即使模型在对话后期最终得到了正确答案,这种行为依然造成了影响;伤害发生在最初那个时刻,即患者得到了虚假的安慰。

然而,研究也表明,这种行为并非代码固有的,可以通过改变任务框架的方式来改变。当研究人员给模型一个简短的指令,要求它们在提供建议前先询问关键问题时,行为发生了彻底的反转。在受指令引导的小组中,没有任何模型在提问前给出居家护理建议。相反,它们停下来询问年龄、疼痛程度和病史。它们也变得更擅长识别危险计划,例如患者表示打算“睡一觉就好了”或饮酒,并明确警告不要这样做。此外,受指令引导的模型开始在聊天结束时创建一个清晰的情况摘要,即一个真实医生可以阅读以了解发生了什么的“交接报告”。这种摘要在未经引导的测试中完全缺失。

尽管有了这些改进,研究人员发现简单的指令并非完美的解决方案。即使被告知要提问,模型有时也无法深入挖掘最关键的事实。在那个患有糖尿病且呕吐的病例中,模型虽然进行了提问,但在患者稍后在聊天中主动提及之前,它们并没有专门询问关于胰岛素或糖尿病的问题。这表明,虽然模型可以被训练来改变其操作顺序,但它们尚未能可靠地识别出在患者表达模糊时,哪些具体问题是最重要的。这项研究的结论是,目前测试医疗聊天机器人的方式太晚了。如果我们只对最终答案进行评分,就会错过在患者的第一条困惑信息与医生(或计算机)形成清晰病情图像之间存在的危险间隙。研究人员认为,为了使这些工具安全可靠,我们必须评估它们是否具备“先倾听、先提问”的能力,而不只是看它们诊断和回答的能力。患者的安全取决于最初几秒钟的对话过程,远在最终结论得出之前,安全就在那几秒钟内。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →