Deployment-Centered Evaluation: Predicting Query-Level Rejection Risk in a Clinical LLM System
本文介绍了一种以部署为中心的临床大语言模型评估框架,该框架利用基于部署特定上下文训练的响应前分类器来预测用户拒绝风险,其 AUROC 达到 0.719,证明了在真实电子健康档案系统中实现针对性护栏和弃权机制的可行性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一家医院:医生和护士正在使用一个超级智能的 AI 助手来帮助他们编写病历、总结病史以及回答简短的问题。这个 AI 就像是一个充满热情的新入职实习生,虽然知识渊博,但有时会跑题,或者写出的风格不是医生喜欢的样子。
问题在于:我们如何知道这个 AI 即将给出一个会让医生讨厌的答案?
通常,科学家测试 AI 时,会给它一堆标准化测试题(比如医学执照考试),并根据“正确性”进行评分。但本文的作者认为,这就像仅仅通过评价厨师能否按照书本上的食谱做菜来评判一位厨师,却忽略了餐厅里的顾客是否真的喜欢味道或摆盘。在真实的医院环境中,即使一个答案在事实层面是完全“正确”的,医生也可能因为它太长、太短,或者写给错误的医生看而拒绝它。
新方法:预测“点踩”
与其等待 AI 给出答案,然后祈祷医生会喜欢它,研究人员构建了一个**“水晶球”**(预测模型),在 AI 回答之前就观察问题。
以下是这个“水晶球”的工作原理,我们用一个简单的类比:
“餐厅点餐”类比
想象你是一名服务员,正在记录订单。
- 旧方法: 你只是看着厨师即将烹饪的食物,然后猜测顾客会不会喜欢。
- 新方法(本文研究): 在厨师开始烹饪之前,你会观察三件事:
- 订单: 顾客到底在要求什么?(查询的文本内容)。
- 顾客: 谁坐在桌子旁?是一位挑剔的美食评论家(专科医生),还是一位普通的食客(护士)?
- 厨房: 哪位厨师正在烹饪?(正在使用的哪个 AI 模型)以及今天餐厅的气氛如何?(具体的科室,例如“急诊室”对比“儿科”)。
研究人员发现,了解谁在提问以及在哪里提问,与了解在问什么同样重要。
他们做了什么
- 设置: 他们将这个 AI 系统安装在医院的电子健康档案(EHR)系统中。
- 反馈循环: 在 AI 给出答案后,医生可以点击“点赞”或“点踩”。
- 注: 很少有人点击这些按钮(仅约 1.6%),因此数据是“稀疏的”(就像试图通过观察几朵云来预测天气一样)。
- 训练: 他们训练预测模型去观察问题、医生的职称、医院科室以及所使用的 AI 模型,并进行预测:“这位医生会点击‘点踩’吗?”
- 测试: 他们实时观察了这个系统运行了 4.5 个月。
结果
- 得分: 他们的“水晶球”在预测拒绝方面表现得相当出色。它得到了 0.719 的分数(在 0.5 代表随机猜测、1.0 代表完美预测的量程中)。这意味着它能比随机猜测更好地识别出“点踩”的情况。
- 秘诀: 当模型包含医生的职业和科室等细节时,其表现显著提升(提升了约 16%)。
- 例子: 一位心脏科医生可能会拒绝一个护士长会喜欢的答案,即便那个答案本身是一样的。模型学习到了这种模式。
- 两种使用方式:
- “安全过滤器”(高精确度): 将模型设置为非常严格。只有当几乎可以肯定会被拒绝时才拦截答案。这既避免了用户看到糟糕的答案,又不会因为频繁的误报而干扰他们。
- “安全网”(高召回率): 设置为捕捉几乎所有可能被拒绝的情况。它可能会标记一些好的答案,但它确保几乎没有坏答案溜过去。这对于触发额外检查或警告非常有用。
为什么这很重要
本文认为,我们不能仅仅根据“它在事实层面是否正确”来评判 AI,而应该根据“用户是否真的会使用它”来评判。
通过利用现实世界的上下文信息(谁在提问以及在哪里提问),我们可以在失败发生之前,预测 AI 何时会令用户失望。这使得医院能够设置“护栏”(如警告标志),或者如果 AI 的回答很可能毫无用处,则直接停止其回答,从而节省时间并建立信任。
简而言之: 他们构建了一个系统,该系统通过学习医生说“不,谢谢”的那些少数时刻,并结合谁在提问以及在哪里提问的信息,来预测未来的“不,谢谢”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。