← 最新论文
💻 computer science

Language Models as Interfaces, Not Oracles: A Hybrid LLM-ML System for Pediatric Appendicitis

本文介绍了 ClaMPAPP,这是一个混合系统,它利用大语言模型作为鲁棒的接口,从临床叙述中提取结构化特征,以供稳定的 XGBoost 分类器使用,并证明了在儿科阑尾炎分诊方面,与端到端的大语言模型方法相比,该系统具有更优越的诊断性能和安全性。

原作者: Soheyl Bateni, Maryam Abdolali

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Soheyl Bateni, Maryam Abdolali

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试诊断一名因腹痛就医的患儿。你有两种截然不同的工具可以提供帮助:

  1. “说书人”(大语言模型或 LLM): 这就像一个才华横溢、博学多才的医学生,他能读懂你凌乱的手写笔记,并理解患者疼痛的故事。然而,这个学生容易产生“幻觉”(编造听起来很真实但并不真实的事实),并且如果你改变讲述故事的顺序,他就会感到困惑。如果你要求他做出最终诊断,他可能会猜错。
  2. “计算器”(机器学习模型): 这就像一台超级精准、枯燥乏味的数学机器。它非常擅长处理数字(如年龄、体温和血液检查结果),以计算阑尾炎的确切风险。但它读不了凌乱的故事;它只理解整齐、有序的电子表格。

问题所在:
医生拥有凌乱的故事(临床记录),但需要精确的数学计算来进行安全诊断。如果你让“说书人”去做数学计算,他可能会靠猜;如果你试图强迫“计算器”去读故事,它无法理解。

解决方案:ClaMPAPP
该论文的作者构建了一个名为 ClaMPAPP 的混合系统。他们并没有试图让“说书人”变得更聪明;相反,他们给了他一份新工作。

把 ClaMPAPP 想象成一个高效的工厂流水线

  • 第一站:翻译员(作为接口的 LLM)
    “说书人”(LLM)坐在第一个工位。他的唯一任务是阅读凌乱的临床记录,并将它们转化为一份整齐、有序的清单。他不被允许做出诊断。他只需说:“好的,患者 12 岁,体温 38°C,右下腹疼痛。”
  • 第二站:安全检查员(验证器)
    在清单移交给下一站之前,一位严格的安全检查员会对其进行检查。如果“翻译员”不小心写了患者 200 岁或者体温 500°C,检查员会将其拦截,并将其标记为“缺失”,而不是让错误的数据通过。这可以防止系统被愚蠢的错误所误导。
  • 第三站:计算器(XGBoost 模型)
    这份干净、经过验证的清单被交到了“计算器”(一种特定的数学模型,称为 XGBoost)手中。这台机器负责繁重的计算工作。它观察数字并计算阑尾炎的风险。因为它是对经过验证的数字进行数学运算,所以它非常可靠,不会被故事的顺序所干扰。
  • 第四站:报告员(再次使用 LLM)
    最后,“翻译员”回到岗位,将“计算器”的结果转化为一份清晰、易读的摘要供医生参考。

为什么这更好?
研究人员将该系统与仅使用“说书人”(即直接询问 LLM 诊断结果)进行了对比测试。以下是他们的发现:

  • 单独的“说书人”表现不稳定: 当研究人员打乱笔记中句子的顺序(比如倒着讲故事)时,“说书人”会变得非常困惑并犯下许多错误。他们还漏掉了许多真实的阑尾炎病例(假阴性),这在急诊室是非常危险的。
  • 混合系统表现稳健: 即使故事的顺序被打乱,ClaMPAPP 仍能正常工作。因为“计算器”只看数字,所以单词的顺序并不重要。
  • 安全至上: 在急诊室中,最重要的目标是不要漏掉生病的孩子。ClaMPAPP 漏掉阑尾炎病例的情况比单独使用“说书人”要少得多。与其冒着错过病重患者的风险,它宁愿更频繁地发出警报(这可能意味着会对健康的孩子进行更多检查)。

核心结论
该论文认为,我们不应将人工智能视为“神谕”(一个给出最终答案的、充满魔力的全知之声),而应将其视为“接口”(一个整理信息的得力助手)。

通过让 AI 处理语言,让数学处理决策,ClaMPAPP 创建了一个比单纯要求 AI “猜测”诊断更安全、更可靠且更易于信任的系统。作者专门针对德国医院中出现腹痛症状的儿童进行了测试,发现这种“翻译员 + 计算器”的方法比使用一个试图包揽一切的智能 AI 要有效得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →