Can Multimodal Large Language Models Replace Expert Assessment in Preclinical Endodontic Education? A Cross-Sectional Agreement Study
Cette étude démontre que les modèles de langage multimodaux actuels surestiment systématiquement la qualité des préparations endodontiques précliniques et manquent de la fiabilité des endodontistes experts, particulièrement en ce qui concerne les jugements critiques pour la sécurité, indiquant qu'ils ne sont pas adaptés pour remplacer l'évaluation humaine dans l'enseignement dentaire.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Résumé technique : Modèles de langage de grande taille multimodaux dans l'évaluation endodontique préclinique
Problématique
L'intégration de l'intelligence artificielle (IA) dans l'enseignement dentaire offre un potentiel pour un feedback automatisé et une évaluation évolutive. Cependant, une lacune critique subsiste quant à la validation de la capacité des modèles de langage de grande taille multimodaux (MLLM) à remplacer de manière fiable le jugement expert humain dans les évaluations précliniques à enjeux élevés et critiques pour la sécurité. Plus précisément, il n'est pas clair si les MLLM actuels peuvent évaluer avec précision les compétences psychomotrices nuancées et les jugements de sécurité requis dans les préparations de cavités d'accès endodontiques, où les erreurs peuvent entraîner des dommages pour le patient. L'étude traite l'hypothèse nulle selon laquelle il n'existe aucune différence significative entre les évaluations des endodontistes experts et les évaluations des modèles d'IA de ces procédures.
Méthodologie
- Conception de l'étude : Une étude comparative transversale monocentrique menée à l'Université Aydın d'Istanbul au cours de l'année académique 2025–2026.
- Participants et spécimens : 25 étudiants de troisième année de chirurgie dentaire ont réalisé des préparations de cavités d'accès sur des dents imprimées en 3D standardisées. Cela a produit 200 spécimens répartis en huit groupes de types de dents (incisives centrales maxillaires et mandibulaires, canines, prémolaires et molaires).
- Acquisition des données : Chaque spécimen a été évalué à l'aide d'un ensemble de quatre images standardisées : photographies occlusale, buccale, linguale/palatale, et une radiographie périapicale.
- Groupes d'évaluation :
- Groupe Expert : Trois endodontistes expérimentés ont évalué indépendamment tous les spécimens à l'aide d'une grille analytique à cinq critères (échelle de 0 à 10) en aveugle. Les critères étaient : (1) forme de l'ouverture, (2) localisation et centrage, (3) étendue et conservation, (4) accès en ligne droite, et (5) dommages iatrogènes et sécurité. Une règle de pénalité plafonnait les scores à 5/10 si des erreurs critiques (ex. : perforation) étaient détectées.
- Groupes IA : Quatre configurations de MLLM de pointe ont été testées : ChatGPT-5.2 (modes Standard et Raisonnement) et Gemini 3 (modes Standard et Raisonnement). Les modèles ont été incités à agir comme des endodontistes experts, à traiter les quatre images et à produire des scores JSON structurés.
- Analyse statistique : La fiabilité inter-juges a été évaluée à l'aide des coefficients de corrélation intraclasse (CCI). Les différences de groupe ont été analysées par ANOVA à un facteur avec test post-hoc de Tukey. Les tailles d'effet ont été calculées comme l'eta carré ().
Résultats clés
- Fiabilité des experts : Les évaluateurs experts ont démontré une excellente fiabilité inter-juges pour toutes les mesures (plage de CCI : 0,916–0,981), établissant ainsi un étalon de référence robuste.
- Écart IA vs Expert : L'hypothèse nulle a été rejetée. Des différences significatives () ont été observées entre les évaluations des experts et de l'IA pour la plupart des mesures et des groupes de dents.
- Surévaluation systématique : Toutes les configurations d'IA ont systématiquement attribué des scores plus élevés que les experts.
- Échec du critère de sécurité : Le plus grave échec concernait le critère « Dommages iatrogènes et sécurité ». Alors que les experts montraient une haute fiabilité (CCI : 0,924) et une variabilité reflétant le jugement clinique, les modèles d'IA se regroupaient près des scores maximaux (≈1,87–2,00) avec des écarts-types proches de zéro. Les CCI de l'IA pour ce critère variaient de 0,165 à 0,572, indiquant une concordance faible à modérée.
- Performance des modèles : Gemini 3 et Gemini 3/R ont montré la plus grande divergence par rapport aux scores des experts (dépassant les moyennes des experts de plus de 4,5 points dans certains groupes). ChatGPT-5.2 et ChatGPT-5.2/R étaient plus proches de l'alignement, mais manquaient encore de la précision de l'expert.
- Mode de raisonnement : Le « Mode de raisonnement » (chaîne de pensée) n'a pas systématiquement surpassé le « Mode Standard », suggérant qu'une complexité computationnelle accrue ne se traduit pas par une meilleure notation clinique.
- Variabilité du type de dent : Le groupe des prémolaires supérieures est la seule catégorie où la performance de l'IA s'est approchée de l'accord des experts sur des mesures dimensionnelles spécifiques (Forme de l'ouverture, Étendue, Accès en ligne droite). À l'inverse, les morphologies complexes comme les canines inférieures et les prémolaires inférieures ont généré les plus grands écarts de scores.
- Cohérence interne : Bien que les modèles d'IA aient montré une cohérence interne raisonnable lors de passages répétés (ex. : Gemini 3/R présentait une haute cohérence), celle-ci ne corrélait pas avec l'exactitude. Un modèle peut être cohérent en interne tout en divergeant systématiquement du jugement de l'expert.
Contributions principales
- Validation empirique des limites : L'étude fournit une preuve empirique que les MLLM actuels ne sont pas adaptés pour remplacer de manière autonome l'évaluation experte en endodontie préclinique, particulièrement pour les jugements critiques liés à la sécurité.
- Identification de l'échec critique de sécurité : Elle met en évidence une limitation spécifique et dangereuse où les modèles d'IA ne parviennent pas à distinguer les préparations sûres des préparations non sûres, par défaut vers des scores de sécurité élevés, quel que soit le dommage iatrogène réel.
- Distinction entre cohérence et exactitude : La recherche démontre qu'une haute cohérence interne au sein d'un modèle d'IA n'équivaut pas à l'exactitude ou à l'alignement avec l'expertise humaine, mettant en garde contre l'utilisation des mesures de cohérence comme substitut de la validité.
- Comparaison des modes : Elle remet en question l'hypothèse selon laquelle le « Mode de raisonnement » ou le traitement par chaîne de pensée améliore intrinsèquement la performance dans les tâches cliniques fondées sur le visuel.
Signification et affirmations
L'article conclut que, bien que les modèles d'IA soient prometteurs pour évaluer des paramètres dimensionnels objectifs (tels que la forme de l'ouverture dans des types de dents plus simples), ils manquent actuellement de la fiabilité requise pour l'évaluation des compétences à enjeux élevés, notamment concernant la sécurité du patient. Les auteurs soutiennent que l'incapacité à évaluer avec précision les « Dommages iatrogènes et la sécurité » rend ces outils inappropriés pour remplacer le jugement expert en éducation préclinique.
Les auteurs proposent un cadre hybride humain-IA comme voie la plus pragmatique pour l'avenir. Dans ce modèle, l'IA pourrait soutenir l'enseignement en fournissant un feedback préliminaire immédiat sur des mesures quantifiables à moindre enjeu, tandis que l'évaluation humaine experte demeure la norme essentielle pour les jugements critiques de sécurité et le raisonnement clinique complexe. L'étude souligne qu'avant toute adoption d'un outil d'IA pour l'évaluation des compétences cliniques, une validation rigoureuse, par critère — spécifiquement sur les mesures de sécurité — est obligatoire.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.