GPT-4o and DeepSeek-V3 responses to common migraine questions: a cross-sectional comparative study of accuracy, completeness, empathy, readability and safety
Cette étude transversale comparative a révélé que, bien que GPT-4o et DeepSeek-V3 aient tous deux fourni des informations généralement précises et sûres sur la migraine, DeepSeek-V3 a obtenu des scores significativement plus élevés en termes d'exhaustivité et de lisibilité, bien qu'aucun des deux modèles ne soit uniformément supérieur en matière d'empathie ou de sécurité.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Des millions de personnes vivent avec la migraine, une affection qui va bien au-delà d'un simple mal de tête pour causer un handicap important et perturber la vie quotidienne. Comme les symptômes d'une migraine peuvent parfois ressembler à ceux d'un accident vasculaire cérébral ou d'autres pathologies cérébrales graves, les patients se tournent souvent vers Internet pour obtenir des réponses. Ces dernières années, un nouveau type de programme informatique connu sous le nom de modèle de langage étendu est devenu une source populaire pour cette information. Ces systèmes peuvent lire de vastes quantités de texte et générer des réponses d'apparence humaine à presque n'importe quelle question, offrant des explications immédiates sur le diagnostic, les déclencheurs et les traitements. Cependant, parce que ces programmes ne sont pas des médecins, il existe une réelle inquiétude quant au fait qu'ils puissent fournir des conseils incomplets, ignorer des signes d'alerte dangereux ou offrir un réconfort alors qu'une personne nécessite en réalité des soins médicaux urgents.
Pour comprendre l'efficacité de ces outils numériques dans un contexte médical à enjeux élevés, des chercheurs ont mené une comparaison directe entre deux des systèmes les plus avancés disponibles : GPT-4o et DeepSeek-V3. L'étude s'est concentrée spécifiquement sur les questions courantes que les gens posent à propos de la migraine. Les chercheurs ont recueilli cent questions distinctes provenant de sources réelles, notamment des tendances de recherche en ligne et des discussions sur des forums publics où les patients partagent leurs expériences. Ces questions couvraient un large éventail de sujets, allant de la nature des symptômes d'avertissement et des déclencheurs liés au mode de vie à la sécurité des médicaments et aux résultats à long terme. Pour garantir que l'évaluation soit équitable et impartiale, deux neurologues ont examiné les réponses générées par chaque modèle sans savoir quel programme informatique les avait produites. Ils ont évalué les réponses en fonction de l'exactitude des faits médicaux, de l'exhaustivité de l'information, de la capacité du ton à être empathique et compatissant, et surtout, de la sécurité des conseils pour le patient.
Les résultats ont montré que les deux programmes informatiques fournissaient généralement des informations précises et sûres, reconnaissant avec succès la nécessité d'une aide médicale professionnelle lorsque des signes d'alerte graves étaient mentionnés. Cependant, un système, DeepSeek-V3, a systématiquement surpassé l'autre dans des domaines spécifiques. Il a fourni des réponses plus complètes, garantissant que les patients reçoivent non seulement les faits de base, mais aussi le contexte nécessaire concernant les alternatives et les incertitudes. De plus, le texte généré par DeepSeek-V3 était nettement plus facile à lire et à comprendre, utilisant des structures de phrases plus simples et un langage plus clair. Bien que les deux modèles aient montré des niveaux d'empathie similaires dans leur ton, et que les deux aient été assez sûrs pour être considérés comme des outils utiles, la différence en termes de complétude et de lisibilité était claire et statistiquement significative.
Dans un test spécifique impliquant vingt-cinq questions décrivant des symptômes de « drapeaux rouges » dangereux, tels qu'un mal de tête soudain et le pire de toute une vie ou de nouveaux problèmes neurologiques, les deux modèles ont bien performé en identifiant correctement la nécessité de soins urgents. Pourtant, même dans ces scénarios critiques, le système qui produisait le texte le plus clair et le plus lisible maintenait son avantage. Les chercheurs ont conclu que, bien que ces outils d'intelligence artificielle deviennent des alliés puissants pour l'éducation des patients, ils ne devraient jamais remplacer l'évaluation d'un médecin. Au lieu de cela, ils sont mieux utilisés pour aider les gens à comprendre des concepts généraux et à reconnaître quand ils doivent chercher une aide professionnelle, à condition que leurs réponses soient examinées avec soin. L'étude souligne qu'à mesure que ces technologies évoluent, leur capacité à communiquer des idées médicales complexes de manière simple et complète est tout aussi importante que l'exactitude des faits qu'elles présentent.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.