← 最新论文
💻 computer science

CARE-Bench: Benchmarking Patient-Facing LLM Triage

该论文介绍了 CARE-Bench,这是一个用于评估面向患者的医疗大语言模型在顺序分诊任务上表现的基于源文本锚定的基准测试,研究揭示了尽管提示词工程提升了性能,但模型仍频繁在护理建议与信息采集的时机把握上出错,凸显了部署过程中的重大安全风险。

原作者: Yining Hua, Hongbin Na, Cyrus Ayubcha

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Yining Hua, Hongbin Na, Cyrus Ayubcha

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正站在一个拥挤、嘈杂的候诊室里,但里面坐着的不是人,而是各种数字助手——那些聪明、话痨,并承诺能帮你搞清楚身体出了什么问题的机器人。你输入“我头痛”,它们立刻回复你一长串的可能性,从“喝点水”到“叫救护车”。这就是面向患者的医疗人工智能(patient-facing medical AI)的世界,在这里,大语言模型(LLMs)在你在见到真正的医生之前,充当了第一道防线。核心问题不仅仅在于这些机器人是否掌握医学知识,而是在于分诊(triage)。把分诊想象成繁忙路口的一名交通警察。警察不需要知道如何修理坏掉的发动机;他们只需要知道:你是继续行驶,还是靠边检查轮胎,或者现在就下车叫拖车? 如果警察把一次轻微的追尾事故送去了拖车公司,就会造成交通堵塞(不必要的就医);如果他们让一辆爆胎的车直接驶向高速公路,灾难就会发生。挑战在于,如何教导这些“数字警察”准确判断何时该询问更多信息,何时该说“休息一下”,以及何时该大喊“紧急情况!”

你即将听到的这篇关于 CARE-BENCH 的论文,就像是为这些医疗机器人准备的一场大型、高风险的驾驶考试。研究人员利用 500 个真实的医疗故事构建了一个特殊的“模拟道路”,并将这些故事分解成一步步的小对话。他们不仅仅是问机器人“答案是什么?”;相反,他们在每一个转折点观察机器人的反应。当患者描述模糊时,机器人是否提出了正确的澄清性问题?它是否因为过度惊慌而过早将人送往急诊室?或者当患者处于危险之中时,它是否表现得过于冷静?他们测试了 11 种不同的 AI 模型,包括一些来自大型科技公司的模型和一些开源模型,测试环境分为两种情况:一种是机器人没有任何特殊指令(就像真实用户输入一个问题那样),另一种是它们得到了一个微小的提示,要求它们“简洁且安全”。

转折点在于:这些机器人在执行交通警察的工作时仍然做得并不好。 即便是最聪明的模型,在放任自流的情况下表现也很差,其“macro-F1”(衡量平衡不同类型错误能力的专业评分)仅在 31.2 到 50.4 之间波动。当研究人员给出一个简单的提示要求它们“保持安全”时,11 个模型中有 10 个模型的得分有所提高,最高达到了 63.4。但问题在于:提示词并没有解决核心问题。 机器人在时间掌控上仍然犯着危险的错误。当患者对症状的描述很模糊时,正确的做法是在给出建议之前询问:“等等,再多跟我说说那个情况。”但机器人经常完全跳过这一步。它们急于给出建议——有时是告诉人们在不需要时去急诊室,或者在应该赶往医院时却告诉他们留在家里。

事实上,当正确的做法应该是询问更多信息时,经过提示后的机器人只有 33.5% 的概率做对了。它们太渴望变得“乐于助人”,以至于忘记了要“谨慎行事”。这项研究表明,仅仅告诉 AI 要“保持安全”并不足以让它成为一名优秀的分诊护士。错误不仅仅在于是否了解医学事实,而是在于时机。机器人很难意识到自己在做出决定之前还没有足够的信息。它们把模糊的症状当作完整的诊断,导致了过度恐慌与危险延误并存的局面。研究人员得出结论:在我们让这些机器人进入现实世界来决定谁该去医院之前,我们需要对它们进行更严格的测试,不仅是测试它们“说了什么”,还要测试它们“何时说话”。目前的模型就像是那些热情过度但缺乏经验的实习生,在还没听完病人的叙述之前,就急于开出一张处方。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →