Quality of physicians responses using a conversational artificial intelligence system: a randomized vignette experiment in Latin America
In einem randomisierten Vignettenerperiment mit Ärzten in Lateinamerika verbesserte ein evidenzverifizierbares konversationelles KI-System die zusammengesetzte Validität klinischer Antworten im Vergleich zu üblichen Suchpraktiken signifikant, wenngleich die Ergebnisse aufgrund der freiwilligen Stichprobe als explorativ betrachtet werden.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
In den geschäftigen Kliniken Lateinamerikas steht ein Arzt oft vor einem Moment stiller Ungewissheit: Ein Patient präsentiert sich mit einem komplexen Satz von Symptomen, und der richtige Behandlungspfad ist nicht sofort offensichtlich. Jahrzehntelang bestand die Lösung darin, innezuhalten und nach Antworten zu suchen, indem man in Lehrbüchern blätterte oder Abfragen in eine digitale Datenbank tippte. Dieser Prozess beruht auf der Fähigkeit des Arztes, riesige Mengen medizinischer Informationen schnell zu finden, zu lesen und zu interpretieren. Heute ist ein neues Werkzeug in diese Landschaft eingetreten: konversationelle künstliche Intelligenz. Diese Systeme, die auf massiven Sammlungen menschlichen Wissens aufgebaut sind, können einen Dialog führen, Fragen beantworten und komplexe Themen in Sekundenschnelle zusammenfassen. Das Versprechen ist, dass ein solches Werkzeug als Partner am Krankenbett fungieren kann, um Ärzten dabei zu helfen, Evidenz schneller und genauer abzurufen. Die meisten Tests dieser Systeme wurden jedoch in kontrollierten, statischen Umgebungen durchgeführt, weit entfernt von der Realität eines belebten Krankenhauses in einem einkommensschwachen oder - mittleren Land. Die entscheidende Frage bleibt, ob diese digitalen Assistenten die Qualität der Versorgung tatsächlich verbessern, wenn sie von echten Ärzten in realen Situationen eingesetzt werden, oder ob sie lediglich ausgeklügelte Chatbots sind, die zwar selbstbewusst klingen, aber wenig praktischen Nutzen bieten.
Um die Antwort zu finden, entwarfen Forscher in Lateinamerika einen direkten Vergleich unter Einbeziehung von zweihundert zwei Ärzten. Sie kreierten ein Szenario, in dem die Ärzte gebeten wurden, vier simulierte Patientenfälle zu lösen, von denen jeder Antworten auf vier offene Fragen erforderte. Die Ärzte wurden zufällig in zwei Gruppen aufgeteilt. Eine Gruppe nutzte ihre üblichen Methoden zur Informationsbeschaffung, indem sie wie gewohnt in Standardressourcen suchte. Die andere Gruppe nutzte ein spezifisches konversationelles System, das darauf ausgelegt war, Antworten zu liefern, die auf medizinische Belege zurückgeführt werden konnten. Um Fairness zu gewährleisten, bewerteten zwei unabhängige Spezialisten, die nicht wussten, welche Methode welcher Arzt verwendet hatte, jede Antwort. Sie bewerteten die Antworten basierend auf sechs verschiedenen Qualitätsdimensionen und erstellten so einen zusammengesetzten Score, der die allgemeine Validität des gegebenen medizinischen Rats widerspiegelte.
Die Ergebnisse zeigten einen klaren Unterschied zwischen den beiden Ansätzen. Die Ärzte, die das konversationelle System nutzten, lieferten Antworten, die im Durchschnitt valider waren als jene, die sich auf ihre üblichen Suchpraktiken verließen. Die Werte für die unterstützte Gruppe waren höher, mit einem Median von 2,83 im Vergleich zu 2,46 für die Gruppe mit der üblichen Praxis. Als die Forscher Faktoren wie die akademischen Grade der Ärzte berücksichtigten, deuteten die Daten darauf hin, dass ein Arzt, der das System nutzt, signifikant wahrscheinlicher eine Antwort lieferte, die einem hohen Standard der Validität entsprach. Dieser Vorteil hielt bei den meisten der spezifischen Kriterien stand, die für die Bewertung verwendet wurden, insbesondere dort, wo sich die Expertenrichter am stärksten einig waren. Die Studie enthüllte jedoch auch eine Nuance: Wenn man rein die Genauigkeit der Fakten betrachtete, erreichte der Unterschied zwischen den beiden Gruppen kein Niveau statistischer Signifikanz. Dies führte die Forscher dazu, das breitere, zusammengesetzte Maß der Validität als primäres Ergebnis festzulegen – eine Entscheidung, die dadurch verstärkt wurde, dass ein externer Evaluator die Analyse der reinen Genauigkeit wiederholte und dieselbe fehlende Differenz feststellte.
Über die Qualität der Antworten hinaus untersuchte die Studie, wie die Ärzte den Prozess empfanden und wie lange er dauerte. Die Ärzte, die das System nutzten, berichteten von einer hohen Zufriedenheit und fanden das Werkzeug akzeptabel und einfach zu bedienen. Interessanterweise zeigten die Zeit, die für den Abschluss der Aufgaben benötigt wurde, und die Anzahl der von den Ärzten gemelerten Suchvorgänge keinen klaren Unterschied zwischen den beiden Gruppen, obwohl die Forscher anmerkten, dass fehlende Daten diesen spezifischen Vergleich schwierig zu interpretieren machten. Die Studie schließt mit einem wichtigen Hinweis auf ihren Umfang: Die Teilnehmer waren Freiwillige, die sich entschieden hatten, die Übung zu absolvieren, was bedeutet, dass die Ergebnisse explorativer Natur sind und kein definitiver Beweis dafür sind, wie das Werkzeug für jeden Arzt in jeder Situation funktioniert. Obwohl das System nicht wie ein Zauberstab wirkte, der jedes Problem sofort löste, legt die Evidenz nahe, dass es, wenn es von praktizierenden Ärzten in dieser Region genutzt wird, dazu beitragen kann, die Qualität der medizinischen Informationen zu erhöhen, die sie ihren Patienten zur Verfügung stellen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.