← Derniers articles
📄 other

Performance of Large Language Model on Real-World Patient Histories for Imaging Appropriateness.

Cette étude démontre que ChatGPT atteint un accord modéré avec les radiologues dans la classification de l'opportunité des IRM de la colonne lombaire selon les critères de l'ACR, sa fiabilité décisionnelle augmentant de manière significative lorsque la qualité de son raisonnement est jugée élevée.

Auteurs originaux : Muhammad Faisal Iqbal, Hasnain Wajeeh Saqib, Ahsen Farooq, Muhammad Talha, Muhammad Nadeem Kashmiri, Raja Adnan Ashraf, Saadullah Khalid, Muhammad Talal Ibrahim, Rayyan Nabi, Rehan Ahmed Khan

Publié 2026-07-27
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Muhammad Faisal Iqbal, Hasnain Wajeeh Saqib, Ahsen Farooq, Muhammad Talha, Muhammad Nadeem Kashmiri, Raja Adnan Ashraf, Saadullah Khalid, Muhammad Talal Ibrahim, Rayyan Nabi, Rehan Ahmed Khan

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Résumé technique : Performance d'un grand modèle de langage sur des historiques de patients réels pour l'adéquation de l'imagerie

Énoncé du problème
La lombalgie (LBP) est une plainte musculosquelettique mondiale prévalente, entraînant des demandes fréquentes d'imagerie par résonance magnétique (IRM) de la colonne lombo-sacrée. Des revues systématiques indiquent qu'environ 29 à 34 % de ces demandes d'imagerie sont inappropriées, manquant souvent de « signes d'alerte » tels que l'infection, la malignité ou le traumatisme. Les IRM inutiles augmentent les coûts de santé, l'anxiété des patients et le risque de surdiagnostic. Bien que des outils d'aide à la décision clinique et des directives existent, leur mise en œuvre dans le monde réel est entravée par des défis d'intégration au flux de travail et la fatigue liée aux alertes. Bien que les grands modèles de langage (LLM) soient apparus comme une alternative évolutive pour réduire l'utilisation inutile, les études antérieures se sont largement appuyées sur des scénarios cliniques hypothétiques plutôt que sur des historiques de patients réels, ont utilisé des standards de référence basés sur un seul radiologue, et se sont concentrées sur des versions de modèles plus anciennes (par exemple, GPT-4) sans évaluer systématiquement le lien entre la qualité du raisonnement et la fiabilité de la décision.

Méthodologie
Cette étude transversale a évalué la précision diagnostique de GPT-5.2 pour classer l'adéquation des IRM lombo-sacrales en utilisant des historiques de patients réels et les critères de l'American College of Radiology (ACR).

  • Collecte de données : Les données ont été collectées rétrospectivement auprès de 160 patients adultes (âge moyen 48 ± 15 ans ; 58 % d'hommes) ayant subi une IRM lombo-sacrée entre septembre et novembre 2025. Les patients présentant un historique insuffisant, une chirurgie spinale antérieure, une suspicion d'infection ou un traumatisme aigu ont été exclus. Un questionnaire structuré, validé par cinq spécialistes, a été utilisé pour recueillir les historiques cliniques pré-imagerie.
  • Prompting du modèle : Les historiques des patients ont été injectés dans GPT-5.2 via des prompts structurés attribuant au modèle un rôle de radiologue et exigeant qu'il classifie les indications d'IRM comme « Généralement appropriées » (GA), « Peuvent être appropriées » (PA), « Généralement non appropriées » (GNA) ou « Informations cliniques insuffisantes » (ICI) selon les directives de l'ACR, incluant un raisonnement explicite.
  • Standard de référence : Deux radiologues indépendants (ayant 5 et 10 ans d'expérience) ont servi de standard de référence.
    • Phase 1 : Les radiologues ont évalué l'adéquation en utilisant les mêmes prompts fournis au LLM, en aveugle de la production du modèle.
    • Phase 2 : Les radiologues ont évalué l'exactitude des recommandations du LLM et la qualité de son raisonnement clinique à l'aide d'une échelle de Likert en 5 points (1–5), en aveugle l'un de l'autre.
  • Analyse statistique : L'accord a été mesuré à l'aide du kappa de Cohen pondéré (κw\kappa_w) et du test d'asymétrie de Bowker. Pour l'analyse binaire, GA et PA ont été regroupés comme « Appropriés », et GNA comme « Inappropriés ». Les mesures de performance comprenaient la Sensibilité, la Spécificité, la VPP, la VPN et l'Aire Sous la Courbe (AUC). Des analyses de sous-groupes ont été menées en fonction de la qualité du raisonnement évaluée par le radiologue (Élevée : \ge4 vs Faible : <4).

Résultats clés

  • Accord : GPT-5.2 a démontré un accord modéré avec les deux radiologues (κw=0,58\kappa_w = 0,58 vs Radiologue 1 ; κw=0,50\kappa_w = 0,50 vs Radiologue 2). Ce niveau d'accord est comparable à l'accord inter-radiologues (κw=0,575\kappa_w = 0,575).
  • Classification binaire : Le modèle a montré une sensibilité élevée (~85 % contre les deux radiologues) mais une spécificité variable (92,9 % vs Radiologue 1 ; 61,7 % vs Radiologue 2). La Valeur Prédictive Négative (VPN) était modérée (57,8 % vs R1 ; 64,4 % vs R2), indiquant une tendance vers une utilisation de l'IRM conservatrice (restrictive).
  • Pouvoir discriminant : L'analyse ROC a montré une discrimination bonne à excellente contre le Radiologue 1 (AUC 0,891) et moyenne à bonne contre le Radiologue 2 (AUC 0,751).
  • Corrélation de la qualité du raisonnement : Une découverte critique a été la forte association entre la qualité du raisonnement et la fiabilité de la décision. Lorsque les radiologues ont jugé le raisonnement du modèle comme élevé (\ge4), l'accord exact sur l'adéquation était élevé (83,3 % vs R1 ; 90,4 % vs R2), et la discordance opposée (le type d'erreur le plus dangereux) était faible (2,3–4,7 %). Inversement, lorsque le raisonnement était jugé faible (<4), l'accord exact est tombé à 0–7,1 %, et la discordance opposée a bondi à 71,4–92,8 %.
  • Évaluation par les experts : Les radiologues ont jugé la qualité de la production du modèle très positivement, avec des scores de Likert médians de 5 (maximum) pour l'adéquation et le raisonnement.

Signification et affirmations
Les auteurs affirment que GPT-5.2 se situe dans la plage de la variabilité inter-radiologues pour classer l'adéquation des IRM lombo-sacrées en utilisant des historiques de patients réels. L'étude souligne que la qualité du raisonnement du modèle est un prédicteur robuste de la fiabilité de sa décision. Plus précisément, un raisonnement de haute qualité est corrélé à une forte concordance avec le jugement expert, tandis qu'un raisonnement de faible qualité est corrélé à une discordance significative.

L'article postule que les LLM comme GPT-5.2 ont le potentiel de servir d'outils de support de pré-criblage pour réduire les demandes d'imagerie inutiles. Cependant, les auteurs soulignent que ce potentiel est conditionné par la qualité du raisonnement du modèle, suggérant un flux de travail hybride où les productions à faible raisonnement sont escaladées pour un examen expert. L'étude conclut que bien que le modèle soit prometteur, une intégration clinique sûre nécessite une surveillance humaine continue, une validation multicentrique prospective et l'établissement de standards de référence consensuels pour traiter la variabilité inter-observateurs dans les cas ambigus.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →