← Derniers articles
📄 urology

Evaluation of Large Language Models for Post-Cystectomy Sexual Health Counseling in Women: A Pilot Study

Cette étude pilote a évalué trois modèles de langage de grande taille pour la génération de conseils de santé sexuelle après une cystectomie, concluant que ChatGPT produisait les réponses les plus conformes aux directives alors que tous les modèles généraient un contenu présentant une complexité de lecture excessive, l'adhérence étant fortement influencée par la structure du prompt.

Auteurs originaux : Shafau, F., Dave, A. A., Omole, I., Guzman, T., Rehman, N., Enemchukwu, E., Bresler, L.

Publié 2026-07-08
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Shafau, F., Dave, A. A., Omole, I., Guzman, T., Rehman, N., Enemchukwu, E., Bresler, L.

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète

Imaginez que vous ayez trois différents « bibliothécaires numériques » (ChatGPT, Gemini et Perplexity) et que vous leur demandiez de rédiger un guide pour les femmes qui vont subir une chirurgie majeure de la vessie appelée cystectomie. Plus précisément, vous voulez qu'ils expliquent ce qui arrivera à leur santé sexuelle et à leurs relations après l'opération.

Cette étude est comme un bulletin de notes pour ces bibliothécaires. Les chercheurs voulaient voir deux choses :

  1. Ont-ils suivi le manuel ? (Ont-ils inclus tous les conseils importants que les médecins sont censés donner ?)
  2. Le langage était-il trop difficile à comprendre ? (Ont-ils écrit comme un professeur ou comme un voisin amical ?)

Voici ce qu'ils ont trouvé, présenté simplement :

1. Le test du « Manuel » (Adhésion aux directives)

Les chercheurs ont donné aux bibliothécaires une liste de contrôle basée sur des directives médicales officielles. Ils leur ont demandé de répondre à six questions différentes sur la vie après la chirurgie.

  • Le gagnant : ChatGPT a été le meilleur élève. Il a suivi le plus étroitement le manuel, atteignant environ 77 % des points requis.
  • Les dauphins : Gemini et Perplexity ont obtenu des scores bien inférieurs, n'atteignant que 50 % et 46 % des points, respectivement. Ils ont manqué beaucoup de conseils clés.
  • L'astuce de la « question simple » : Les chercheurs ont remarqué quelque chose d'intéressant. Lorsqu'ils interrogeaient les bibliothécaires en utilisant un langage simple et quotidien (comme un patient le ferait), les réponses étaient meilleures et respectaient plus souvent les règles. Lorsqu'ils utilisaient un jargon médical complexe (comme un médecin le ferait), les bibliothécaires devenaient en fait moins bons pour suivre les règles. C'est comme si les bibliothécaires étaient confus par les mots sophistiqués et en oubliaient les bases.

2. Le test du « Niveau de lecture » (Lisibilité)

Même si les bibliothécaires avaient raison sur les faits, cela n'a aucune importance si le patient ne peut pas lire la réponse. Les chercheurs ont vérifié la difficulté de compréhension du texte.

  • Le problème : Les trois bibliothécaires ont écrit dans un langage trop difficile. Ils écrivaient à un niveau adapté aux diplômés universitaires ou même aux personnes possédant des diplômes avancés.
  • La réalité : La plupart des gens lisent à un niveau de 6e année (fin de primaire). Si vous remettez un dépliant de niveau 12e ou 16e année (niveau universitaire) à un patient qui est déjà stressé par une chirurgie cancéreuse, il se peut qu'il ne comprenne pas du tout.
  • La comparaison : Perplexity a produit la prose la plus difficile, de niveau « études supérieures ». Gemini était légèrement plus facile, mais restait trop complexe. ChatGPT était le plus facile à lire des trois, mais même lui était encore trop difficile pour la personne moyenne.

3. La découverte de « L'idée centrale »

Les chercheurs ont utilisé un outil mathématique spécial (appelé Analyse en Composantes Principales) pour examiner les différentes façons de mesurer la « difficulté ». Ils ont découvert que tous les tests de difficulté mesuraient en fait exactement la même chose. C'est comme avoir cinq règles différentes qui disent toutes que la table mesure 1,80 mètre ; ce ne sont pas cinq mesures différentes, ce sont juste cinq façons de dire la même chose. Cela a confirmé que le texte était systématiquement trop complexe sur toute la ligne.

Le mot de la fin

Considérez ces outils d'IA comme des assistants très compétents mais légèrement maladroits.

  • ChatGPT est l'assistant le plus fiable pour se souvenir des règles importantes, mais même lui s'exprime dans une langue trop sophistiquée pour être facilement digérée par un patient.
  • Gemini et Perplexity sont moins fiables concernant les règles et utilisent un langage encore plus compliqué.
  • Le prompt compte : Si vous posez ces questions à ces assistants en anglais simple et courant, ils font en réalité un meilleur travail pour suivre les règles que si vous essayez de sonner comme un médecin.

À retenir : Bien que ces outils d'IA puissent être utiles, ils produisent actuellement des informations trop complexes pour que les patients puissent les comprendre et varient considérablement dans la quantité de conseils médicaux importants qu'ils incluent. Ils ne sont pas prêts à remplacer la conversation d'un médecin, surtout pour des sujets sensibles comme la santé sexuelle après un cancer.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →