Assessing the Quality, Safety, and Readability of Large Language Model Responses from ChatGPT and Gemini for Knee Osteoarthritis Patient Education
Dans une évaluation comparative de l'éducation des patients atteints d'arthrose du genou, ChatGPT a démontré une précision et une exhaustivité supérieures selon l'évaluation des cliniciens par rapport à Gemini, bien que les deux modèles aient produit un contenu dont les niveaux de lisibilité dépassent les normes recommandées et nécessitent une révision professionnelle avant toute utilisation clinique.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous avez mal au genou et que vous voulez savoir comment le soigner. Au lieu d'appeler un médecin, vous posez la question à deux différents bibliothécaires robots super intelligents : ChatGPT et Gemini. Vous leur posez 36 questions différentes sur votre douleur au genou, allant de « Quels exercices aident ? » à « Puis-je prendre ce médicament Unani spécifique ? »
Cette étude est comme un bulletin de notes comparant la capacité de ces deux bibliothécaires robots à répondre à ces questions. Voici ce que les chercheurs ont trouvé, expliqué simplement :
La mise en place : Un test de dégustation à l'aveugle
Les chercheurs n'ont pas seulement interrogé les robots ; ils ont fait en sorte que cinq médecins spécialisés en genou (ayant pratiqué pendant plus de 10 ans) évaluent les réponses. Les médecins ne savaient pas quel robot avait écrit quelle réponse — ils étaient « les yeux bandés » vis-à-vis de la marque. Ils ont évalué les réponses selon cinq critères :
- Précision : Le fait est-il vrai ?
- Complétude : Ont-ils raconté toute l'histoire, ou seulement une partie ?
- Clarté : Est-ce facile à comprendre ?
- Sécurité : Ont-ils donné des conseils qui pourraient vous blesser ?
- Fiabilité : Ont-ils l'air dignes de confiance ?
Ils ont également vérifié le « niveau de lecture », comme pour vérifier si un livre est écrit pour un élève de 6ème ou pour un professeur d'université.
Les résultats : Qui a gagné ?
1. Le score du « Vérificateur de faits » (Précision et Complétude)
- Le vainqueur : ChatGPT.
- L'analogie : Imaginez que vous préparez un gâteau. Si vous demandez une recette, Gemini vous a donné une recette qui était globalement correcte mais qui oubliait quelques ingrédients clés (comme oublier de mentionner qu'il faut des œufs). ChatGPT vous a donné une recette qui était non seulement correcte, mais qui incluait toutes les étapes et les avertissements.
- Les données : Les médecins ont donné des scores plus élevés à ChatGPT pour sa précision et sa complétude. Cette différence était assez marquée pour ne pas être le fruit du hasard.
2. Le score « Sécurité et Confiance »
- Le résultat : C'était une égalité.
- L'analogie : Les deux robots étaient également prudents pour ne pas vous dire de faire quelque chose de dangereux (comme arrêter votre traitement sans demander l'avis d'un médecin). Aucun des deux n'était significativement plus sûr ou plus fiable que l'autre.
3. Le score du « Niveau de lecture »
- Le vainqueur : Gemini (par une faible marge).
- L'analogie : Pensez au niveau de lecture comme à la hauteur d'une clôture. Les deux robots ont construit des clôtures trop hautes pour que la personne moyenne puisse les sauter facilement. Cependant, la clôture de Gemini était légèrement plus basse (plus facile à sauter) que celle de ChatGPT.
- Le bémol : Même si Gemini était « plus simple », les deux robots écrivaient à un niveau trop difficile pour la plupart des patients. Ils écrivaient comme des étudiants à l'université, alors que les conseils de santé devraient être écrits pour un niveau de 6ème ou de 4ème.
Le problème du « Facteur Humain »
Voici la partie délicate de l'étude : les cinq médecins évaluant les réponses n'étaient pas toujours d'accord entre eux.
- L'analogie : Imaginez cinq juges lors d'un concours de talents. Si un juge donne une note de 4/5 et un autre de 2/5 à un chanteur, il est difficile de savoir qui a raison.
- Ce que cela signifie : Les médecins ont eu du mal à s'accorder sur la façon dont les réponses étaient « claires » ou « sûres ». Cependant, lorsqu'ils ont examiné la moyenne des cinq médecins, la différence entre ChatGPT et Gemini concernant la précision était encore assez nette pour être perçue.
La particularité de la « Unani »
L'étude comprenait des questions sur la médecine Unani (un système de guérison traditionnel populaire en Asie du Sud) et des habitudes culturelles comme la prière au sol. Les chercheurs voulaient voir si les robots comprenaient ces contextes culturels spécifiques. Bien que l'étude ait examiné ces questions, la conclusion principale portait sur la qualité globale des réponses, et non sur un classement spécifique de la manière dont ils traitaient la médecine Unani.
L'essentiel à retenir
Si vous êtes un patient souffrant de douleurs au genou et que vous demandez de l'aide à ces robots :
- ChatGPT a tendance à vous donner des informations plus complètes et précises, comme une encyclopédie détaillée.
- Gemini est légèrement plus facile à lire, mais de peu.
- Tous deux écrivent à un niveau qui peut être trop complexe pour qu'une personne moyenne puisse le comprendre facilement.
L'avertissement final : Les chercheurs affirment que même si ChatGPT a mieux réussi, aucun des deux robots ne devrait être utilisé sans qu'un médecin humain n'ait vérifié le travail au préalable. Vous ne devez pas considérer la réponse du robot comme la parole finale ; un vrai médecin doit la réviser pour s'assurer qu'elle est sûre et adaptée à vous.
En bref : ChatGPT était le meilleur « manuel scolaire », mais les deux ont besoin d'un enseignant (un médecin) pour expliquer les leçons à l'élève (le patient).
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.