← 最新论文
📄 medicine

Can Multimodal Large Language Models Replace Expert Assessment in Preclinical Endodontic Education? A Cross-Sectional Agreement Study

本研究表明,目前的跨模态大语言模型系统性地高估了临床前牙髓准备的质量,且在涉及安全关键型判断方面缺乏专家级牙髓病学家的可靠性,这表明它们不适合作为人类评估在牙科教育中的替代方案。

原作者: Assist. Prof. Dr. SANA MAHROOS AL-SHAMMARI, Assist. Prof. Dr. MELİSA USLU, Assoc. Prof. Dr. IŞIL KAYA BÜYÜKBAYRAM, Research Assist. HAKKI TALHA YILDIZ, Ph.D Candidate. SAMER MAHROOS MKHAILEF Al-Shamma
发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Assist. Prof. Dr. SANA MAHROOS AL-SHAMMARI, Assist. Prof. Dr. MELİSA USLU, Assoc. Prof. Dr. IŞIL KAYA BÜYÜKBAYRAM, Research Assist. HAKKI TALHA YILDIZ, Ph.D Candidate. SAMER MAHROOS MKHAILEF Al-Shammari, Ph.D Candidate. HOURA SADAT SAIED BONEKDAR, Assist. Prof. Dr. SÜHA ALPAY

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:多模态大语言模型在临床前牙髓学评估中的应用

问题陈述
将人工智能(AI)整合进牙科教育为自动化反馈和规模化评估提供了潜力。然而,一个关键的差距在于:是否可以验证多模态大语言模型(MLLM)能否可靠地取代专家人类判断,从而在具有高风险、安全至上的临床前评估中发挥作用。具体而言,目前尚不清楚 MLLM 是否能够准确评估牙髓学开髓准备过程中所需的细微运动技能和安全判断,因为这些过程中的错误可能导致患者受损。本研究旨在检验如下虚无假设:在这些操作的评估中,专家牙髓病学家与 AI 模型评估之间不存在显著差异。

研究方法

  • 研究设计: 本研究为一项单中心、横断面、比较一致性研究,于 2025–2026 学年开展于伊斯坦布尔艾登大学(Istanbul Aydın University)。
  • 参与者与标本: 25 名三年级本科牙科学生在标准化的 3D 打印牙齿上进行了开髓准备。这产生了 200 个标本,涵盖八个牙种组(上颌和下颌中切牙、犬齿、前磨牙和磨牙)。
  • 数据采集: 每个标本使用标准化的四图像数据集进行评估:合面、颊侧、舌/腭侧照片以及一张根尖 X 线片。
  • 评估组:
    • 专家组: 三位资深牙髓病学家使用盲法、基于五项标准的分析性量表(0–10 分制)对所有标本进行独立评分。标准包括:(1)轮廓形态,(2)位置与中心化,(3)范围与保守性,(4)直线通路,以及(5)医源性损伤与安全性。若检测到关键错误(如穿孔),则适用惩罚规则,将得分上限限制在 5/10 分。
    • AI 组: 测试了四种配置的最前沿 MLLM:ChatGPT-5.2(标准模式与推理模式)以及 Gemini 3(标准模式与推理模式)。模型被提示扮演专家牙髓病学家,处理四张图像并输出结构化的 JSON 分数。
  • 统计分析: 使用组内相关系数(ICC)评估评分者间信度。使用单因素方差分析(one-way ANOVA)结合 Tukey 事后检验来分析组间差异。使用 eta 平方(η2\eta^2)计算效应量。

主要结果

  • 专家信度: 专家评分者在所有测量指标中均表现出极佳的评分者间信度(ICC 范围:0.916–0.981),建立了稳健的金标准。
  • AI 与专家的差异: 拒绝了虚无假设。在大多数测量指标和牙种组中,专家评估与 AI 评估之间存在显著差异(p<0.001p < 0.001)。
    • 系统性高分倾向: 所有 AI 配置均一致地给出比专家更高的分数。
    • 安全性标准失效: 最关键的失败出现在“医源性损伤与安全性”这一标准上。虽然专家表现出高信度(ICC: 0.924)且其变异性反映了临床判断,但 AI 模型的分数集中在接近最高分处(≈1.87–2.00),且标准差接近于零。该标准的 AI ICC 范围在 0.165 到 0.572 之间,表明一致性较差至中等。
    • 模型表现: Gemini 3 和 Gemini 3/R 表现出与专家评分最大的偏差(在某些组别中超过专家平均值达 4.5 分)。ChatGPT-5.2 和 ChatGPT-5.2/R 虽然更接近专家水平,但仍缺乏专家级的精准度。
    • 推理模式: “推理模式”(思维链)并未一致地优于“标准模式”,这表明增加计算复杂度并不一定能转化为更好的临床评分。
    • 牙种差异: 上前磨牙组是 AI 在特定维度测量(轮廓形态、范围、直线通路)上接近专家一致性的唯一类别。相反,复杂的形态(如下犬齿和下前磨牙)导致了最大的评分偏差。
  • 内部一致性: 虽然 AI 模型在重复运行中表现出合理的内部一致性(例如 Gemini 3/R 具有高一致性),但这种一致性并不与准确性相关。一个模型可以具有高度的内部一致性,却在系统性上偏离专家判断。

核心贡献

  • 对局限性的实证验证: 本研究提供了实证证据,表明目前的 MLLM 尚不适合作为临床前牙髓学中专家评估的独立替代工具,尤其是在涉及安全关键型判断时。
  • 识别安全关键型失效: 研究强调了一个危险的特定局限性,即 AI 模型无法区分安全与不安全的准备过程,无论实际是否存在医源性损伤,都会默认给出高安全性评分。
  • 区分一致性与准确性: 研究表明,AI 模型内部的高一致性并不等同于准确性或与人类专业知识的一致性,这警示了不要将一致性指标作为临床教育中有效性的替代指标。
  • 模式对比: 研究挑战了“推理模式”或思维链处理过程必然会提高其在视觉落地临床任务中表现的假设。

意义与主张
论文结论认为,尽管 AI 模型在评估客观维度参数(如简单牙种的轮廓形态)方面展现出潜力,但目前它们缺乏进行高风险能力评估所需的可靠性,特别是在涉及患者安全方面。作者认为,无法准确评估“医源性损伤与安全性”使得这些工具不适合取代临床前教育中的专家判断。

作者提出了一种人机混合框架作为最务实的路径。在这种模式下,AI 可以通过提供关于低风险、可量化指标的即时初步反馈来支持教学,而专家的人类评估仍是针对安全关键型判断和复杂临床推理的核心标准。研究强调,在任何 AI 工具被用于临床能力评估之前,必须进行严格的、基于准则层面的验证——特别是针对安全指标的验证。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →