Performance of Large Language Models in Providing Patient-Oriented Information on Gingival Recession: A Comparative Study
Cette étude comparative a révélé que, bien que ChatGPT, Google Gemini et Claude fournissent des informations destinées aux patients sur la récession gingivale de manière aussi précise et complète, les évaluateurs experts ont préféré Gemini et Claude malgré les temps de réponse plus rapides et la plus grande concision de ChatGPT.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Les patients se tournent de plus en plus vers l'intelligence artificielle pour comprendre leur santé, interrogeant les agents conversationnels pour obtenir des conseils sur tout, du simple rhume aux conditions dentaires complexes. Ces outils, connus sous le nom de modèles de langage étendus, sont conçus pour converser en langage naturel, offrant des réponses directes plutôt qu'une liste de liens de recherche. L'une de ces pathologies, la récession gingivale, survient lorsque le tissu gingival qui entoure les dents se rétracte, exposant la racine de la dent. Cette exposition peut entraîner une sensibilité, une carie et des préoccupations esthétiques, incitant de nombreuses personnes à chercher des informations en ligne avant de consulter un dentiste. Bien que ces assistants numériques promettent de combler le fossé entre les patients et le savoir médical, des questions subsistent pour savoir s'ils fournissent des informations fiables, complètes et sûres, en particulier pour des problèmes dentaires spécifiques où la précision est cruciale.
Une étude récente a entrepris de tester la capacité de trois systèmes d'intelligence artificielle de pointe à traiter des questions sur la récession gingivale. Les chercheurs se sont concentrés sur ChatGPT, Google Gemini et Claude, posant à chacun les vingt mêmes questions qu'un patient typique pourrait poser. Ces interrogations couvraient les causes de la pathologie, les options de traitement, les risques et ce à quoi il faut s'attendre après une chirurgie. Pour garantir une évaluation équitable des réponses, cinq spécialistes certifiés en santé gingivale ont examiné chaque réponse sans savoir quel programme informatique l'avait générée. Les experts ont évalué les réponses en fonction de leur exactitude factuelle, de l'exhaustivité de l'information et de la manière dont les modèles se classaient les uns par rapport aux autres en termes de qualité globale. Ils ont également mesuré le temps nécessaire à chaque système pour rédiger sa réponse et ont compté le nombre de mots utilisés.
Les résultats ont montré que les trois modèles d'intelligence artificielle ont performé de manière remarquable en ce qui concerne les faits fondamentaux. Il n'y avait aucune différence significative dans l'exactitude ou l'exhaustivité des informations fournies par ChatGPT, Gemini ou Claude. Chaque système a réussi à générer des réponses que les experts ont jugées cliniquement acceptables, la plupart des réponses obtenant des notes élevées pour leur exactitude. Cependant, les modèles différaient de manière notable dans leur façon de délivrer cette information. ChatGPT était le plus rapide, produisant ses réponses en moins de six secondes en moyenne, tandis que Claude mettait près de quinze secondes. ChatGPT rédigeait également les réponses les plus concises, avec une moyenne d'environ 232 mots par réponse. En revanche, Gemini produisait les réponses les plus longues, avec une moyenne de 438 mots, et Claude se situait entre les deux.
Malgré une qualité de faits similaire, les experts humains avaient une préférence claire pour la présentation de l'information. Lorsqu'on leur a demandé de classer les réponses de la meilleure à la moins bonne, Gemini et Claude ont été choisis comme étant la meilleure réponse plus souvent que ChatGPT. Les experts ont sélectionné Gemini et Claude comme étant la meilleure réponse dans 38 % des cas, alors que ChatGPT n'a été classé premier que dans 24 % des évaluations. Cela suggère que, bien que ChatGPT soit plus rapide et plus bref, les deux autres modèles proposaient un style d'explication que les spécialistes jugeaient plus approfondi ou mieux organisé. L'étude a également révélé que les trois modèles étaient particulièrement performants pour répondre aux questions concernant les soins postopératoires et les instructions de suivi, probablement parce que ces sujets reposent sur des directives standardisées. Ils étaient légèrement moins cohérents lorsqu'il s'agissait de discuter du diagnostic spécifique ou de l'aptitude au traitement, ce qui nécessite un jugement plus personnalisé.
En conclusion, l'étude affirme que ces outils d'intelligence artificielle deviennent suffisamment fiables pour servir de compléments utiles à l'éducation des patients. Ils peuvent fournir des informations précises et détaillées sur la récession gingivale qui sont conformes aux normes professionnelles. Toutefois, les chercheurs soulignent que ces outils doivent soutenir, et non remplacer, une consultation avec un professionnel de la dentition. La meilleure approche semble consister à utiliser ces systèmes rapides et instructifs pour obtenir une compréhension générale d'une pathologie, tout en s'appuyant sur un expert humain pour interpréter ces informations dans le contexte des besoins de santé spécifiques d'un individu.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.