← Nieuwste papers
📄 medicine

GPT-4o and DeepSeek-V3 responses to common migraine questions: a cross-sectional comparative study of accuracy, completeness, empathy, readability and safety

Deze cross-sectionele vergelijkende studie vond dat hoewel zowel GPT-4o als DeepSeek-V3 over het algemeen nauwkeurige en veilige informatie over migraine boden, DeepSeek-V3 significant hogere scores behaalde op volledigheid en leesbaarheid, hoewel geen van beide modellen uniform superieur was in empathie of veiligheid.

Oorspronkelijke auteurs: Ahmet Burak Elbeyli, Hasan Hüseyin Kır

Gepubliceerd 2026-08-19
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ahmet Burak Elbeyli, Hasan Hüseyin Kır

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Miljoenen mensen leven met migraine, een aandoening die veel verder gaat dan een eenvoudige hoofdpijn en zorgt voor aanzienlijke beperkingen en verstoringen van het dagelijks leven. Omdat de symptomen van een migraine soms kunnen lijken op die van een beroerte of andere ernstige hersenaandoeningen, wenden patiënten zich vaak tot het internet voor antwoorden. In recente jaren is een nieuw type computerprogramma, bekend als een groot taalmodel, een populaire bron voor deze informatie geworden. Deze systemen kunnen enorme hoeveelheden tekst lezen en mensachtige antwoorden genereren op bijna elke vraag, waarbij ze directe uitleg bieden over diagnose, triggers en behandelingen. Omdat deze programma's echter geen artsen zijn, bestaat er een reële zorg dat ze onvolledig advies kunnen geven, gevaarlijke waarschuwingssignalen kunnen missen of geruststelling kunnen bieden wanneer iemand eigenlijk dringende medische zorg nodig heeft.

Om te begrijpen hoe goed deze digitale hulpmiddelen presteren in een medische omgeving met hoge inzet, hebben onderzoekers een directe vergelijking uitgevoerd tussen twee van de meest geavanceerde beschikbare systemen: GPT-4o en DeepSeek-V3. De studie richtte zich specifiek op de veelgestelde vragen die mensen stellen over migraine. De onderzoekers verzamelden honderd verschillende vragen uit bronnen uit de echte wereld, waaronder online zoektrends en discussies op publieke fora waar patiënten hun ervaringen delen. Deze vragen bestreken een breed scala aan onderwerpen, van de aard van waarschuwingssymptomen en levensstijltriggers tot medicijnveiligheid en langetermijnresultaten. Om de evaluatie eerlijk en onbevooroordeeld te laten verlopen, beoordeelden twee neurologen de door elk model gegenereerde antwoorden zonder te weten welk computerprogramma de antwoorden had geproduceerd. Zij beoordeelden de reacties op basis van hoe accuraat de medische feiten waren, hoe compleet de informatie was, of de toon empathisch en ondersteunend was en, het belangrijkste, of het advies veilig was voor een patiënt om op te volgen.

De resultaten toonden aan dat beide computerprogramma's over het algemeen accurate en veilige informatie boden, waarbij ze succesvol de noodzaak van professionele medische hulp erkenden wanneer er ernstige waarschuwingssignalen werden genoemd. Echter, één systeem, DeepSeek-V3, presteerde consequent beter dan het andere systeem op specifieke gebieden. Het bood completere antwoorden, waardoor patiënten niet alleen de basisfeiten ontvingen, maar ook de noodzakelijke context over alternatieven en onzekerheden. Bovendien was de door DeepSeek-V3 gegenereerde tekst aanzienlijk gemakkelijker te lezen en te begrijpen, door het gebruik van eenvoudigere zinsstructuren en helderdere taal. Hoewel beide modellen een vergelijkbaar niveau van empathie in hun toon vertoonden, en beide veilig genoeg waren om als nuttige hulpmiddelen te worden beschouwd, was het verschil in volledigheid en leesbaarheid duidelijk en statistisch significant.

In een specifieke test met twintig vijf vragen die gevaarlijke "red flag"-symptomen beschreven, zoals een plotselinge, ergste ooit ervaren hoofdpijn of nieuwe neurologische problemen, presteerden beide modellen goed door correct de noodzaak van dringende zorg te identificeren. Toch behield het systeem dat de duidelijkere, meer leesbare tekst produceerde zelfs in deze kritieke scenario's zijn voordeel. De onderzoekers concludeerden dat hoewel deze kunstmatige intelligentietools krachtige bondgenoten worden voor patiënteneducatie, ze nooit een beoordeling door een arts mogen vervangen. In plaats daarvan zijn ze het best te gebruiken om mensen te helpen algemene concepten te begrijpen en te herkennen wanneer zij professionele hulp nodig hebben, mits hun antwoorden met zorg worden beoordeeld. De studie benadrukt dat naarmate deze technologieën evolueren, hun vermogen om complexe medische ideeën eenvoudig en volledig te communiceren even belangrijk is als de nauwkeurigheid van de gepresenteerde feiten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →