Collecting health narratives at scale: A multi-study evaluation of speech-to-text in health surveys
Diese Multi-Studien-Evaluierung zeigt, dass die Spracherkennungstechnologie zwar in großem Umfang die Länge und den Inhalt von Patientengesundheitsnarrativen erheblich bereichern kann, ihre Einführung jedoch je nach Bevölkerungsgruppe stark variiert und maßgeblich von kontextuellen Faktoren wie Datenschutz, Interface-Design und individuellen Präferenzen abhängt.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
Menschen tragen oft Geschichten über ihre Gesundheit in sich, die Zahlen und Checklisten einfach nicht erfassen können. Während Ärzte und Forscher auf standardisierte Fragen zurückgreifen, um Symptome und Beschwerden zu verfolgen, können diese starren Formate die Textur der gelebten Erfahrung eines Menschen verpassen. Die Nuance, wie ein Patient seinen Schmerz beschreibt, die unerwarteten Details, die er über seine täglichen Kämpfe teilt, und die einzigartige Art und Weise, wie er seine Symptome mit seinem Leben verknüpft, existieren in offenen Erzählungen. Dennoch war das Sammeln dieser Narrative aus großen Gruppen von Menschen historisch gesehen ein langsamer, teurer Prozess, der in der Regel erforderte, dass ein Forscher sich mit jeder Person einzeln zusammensetzt und sie interviewt. Diese Einschränkung hinterlässt eine Lücke in unserem Verständnis der Bevölkerungsgesundheit, da die detailliertesten Berichte oft ungesammelt bleiben, weil sie zu schwierig in großem Maßstab zu erfassen sind.
Ein Team von Forschern setzte sich zum Ziel zu prüfen, ob moderne Technologie diese Lücke schließen könnte, indem sie Sprach-zu-Text-Werkzeuge in Online-Umfragen verwendet. Sie wollten wissen, ob Menschen bereit wären, ihre Antworten in ein Mikrofon zu sprechen, anstatt sie zu tippen, und ob dies tatsächlich zu reicheren, detaillierteren Geschichten führen würde. Um dies zu testen, luden sie Teilnehmer aus vier sehr unterschiedlichen Gruppen ein: Menschen, die mit einer Post-COVID-19-Erkrankung leben, gesunde Erwachsene, Sexarbeiter/innen und ältere Erwachsene. In jeder dieser Umfragen gaben die Forscher den Menschen eine Wahlmöglichkeit. Sie konnten offene Fragen entweder durch Tippen auf einer Tastatur beantworten oder eine Sprach-zu-Text-Funktion nutzen, um ihre Antworten laut auszusprechen, wobei der Computer diese dann in geschriebene Wörter transkribierte.
Die Ergebnisse zeigten, dass das Sprechen die Art der Antworten auf messbare Weise veränderte. Wenn Menschen sich für das Sprechen entschieden, waren ihre Antworten signifikant länger. In zwei der Studien enthielten die gesprochenen Antworten hunderte Charaktere mehr als die getippten, wobei eine Gruppe im Durchschnitt einen Zuwachs von fast neunhundert Zeichen pro Antwort verzeichnete. Die gesprochenen Wörter enthielten auch mehr einzigartige Inhaltswörter – jene spezifischen Substantive und Verben, die den Kern einer Geschichte tragen –, was darauf hindeutet, dass das Sprechen es den Menschen ermöglichte, mehr distinkte Ideen zu teilen. Die gesprochenen Antworten waren jedoch nicht perfekt poliert; sie enthielten einen höheren Anteil an Füllwörtern und wiesen im Vergleich zu den getippten Antworten eine etwas geringere Vielfalt an Wortarten auf. Dies deutet darauf hin, dass das Sprechen zwar mehr Volumen und spezifische Details freisetzte, aber auch den natürlichen, uneditierten Fluss eines Gesprächs einführte.
Die Akzeptanz der Technologie war jedoch nicht über alle Gruppen hinweg einheitlich. Die Rate, mit der Menschen sich entschieden, zu sprechen statt zu tippen, variierte drastisch und reichte von weniger als einem Prozent in einigen Gruppen bis zu achtzig Prozent in anderen. Diese große Kluft deutet darauf hin, dass die Entscheidung zu sprechen tief persönlich ist und stark von der jeweiligen Situation beeinflusst wird. Teilnehmer, die das Werkzeug nutzten, lobten es im Allgemeinen für seinen Komfort und die gebotene Spontaneität und merkten an, dass es sich einfacher anfühlte, einfach zu reden, als zu tippen. Dennoch zögerten viele andere aufgrund von Bedenken hinsichtlich der Privatsphäre, der Peinlichkeit, in öffentlichen Räumen laut zu sprechen, oder schlichtweg aufgrund der Präferenz für die Kontrolle, die sie beim Tippen empfanden.
Die Studie kommt zu dem Schluss, dass Sprach-zu-Text ein lebensfähiges Werkzeug zur Erfassung reichhaltigerer Gesundheitsnarrative aus großen Bevölkerungsgruppen ist, aber keine Einheitslösung darstellt. Die Technologie funktioniert am besten, wenn die Implementierung sorgfältig auf die spezifische Gruppe, die untersucht wird, und das Umfeld, in dem sie antworten, zugeschnitten ist. Für einige öffnet das Sprechen eine Tür, um mehr von ihrer Geschichte zu teilen; für andere bleiben die Barrieren von Kontext und Komfort zu hoch. Der Weg nach vorn liegt darin, diese Unterschiede zu verstehen und Umfragen zu gestalten, die den einzigartigen Bedürfnissen und Vorlieben der Menschen respektieren, die ihre Gesundheitserfahrungen teilen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.