LLMs for Survey Text Analysis – A Performance Comparison Between Humans and GPT-5 on Inductive Content Analysis
Diese Studie zeigt, dass GPT-5.4 die menschliche Leistung bei der induktiven Inhaltsanalyse von Umfragedaten annähern kann, indem es Übereinstimmungsgrade bei der Kodierung und Themengenerierung erreicht, die mit der menschlichen internen Konsistenz vergleichbar sind, wodurch dessen Potenzial als skalierbares Unterstützungswerkzeug für die qualitative Forschung validiert wird.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Qualitative Forschung ist die Kunst, Worte sinnvoll zu deuten. Wenn Wissenschaftler, Soziologen oder politische Entscheidungsträger die Gedanken, Gefühle und Erfahrungen von Menschen verstehen wollen, stellen sie oft offene Fragen. Anstatt ein Kästchen anzukreuzen, schreibt eine Person einen Absatz über ihr Leben, ihre Kämpfe oder ihre Hoffnungen. Um tausende dieser Absätze in nützliches Wissen zu verwandeln, müssen Forscher jeden einzelnen lesen, die sich wiederholenden Ideen finden und sie in Kategorien gruppieren. Dieser Prozess, bekannt als Inhaltsanalyse, ist das Rückgrat des Verständnisses menschlichen Verhaltens, aber er ist unglaublich langsam und anspruchsvoll. Jahrzehntelang war der einzige Weg hierfür der menschliche Geist, der Zeile für Zeile las. Nun ist ein neues Werkzeug in den Raum getreten: Large Language Models. Dies sind Systeme der künstlichen Intelligenz, die auf riesigen Mengen an Text trainiert wurden und in der Lage sind, Sprache zu lesen, zu verstehen und zusammenzufassen. Die große Frage für die wissenschaftliche Gemeinschaft ist nicht nur, ob diese Maschinen lesen können, sondern ob sie wie ein menschlicher Forscher denken können, wenn die Aufgabe darin besteht, verborgene Muster zu finden, ohne dass ein vorgefertigtes Regelwerk existiert.
Ein Team von Forschern aus verschiedenen europäischen Universitäten setzte sich zum Ziel, diese Frage mit einem direkten Vergleich zu beantworten. Sie nahmen einen realen Datensatz aus einer Umfrage unter 2.800 Doktoranden in ganz Europa, wobei 10 % der Antworten zufällig ausgewählt wurden, um als Datengrundlage für die Studie zu dienen. Aus dieser Stichprobe wurden insgesamt 903 Antworten zu sechs spezifischen offenen Fragen eingehend analysiert. Auf der einen Seite des Experiments lasen fünf menschliche Forscher diese Antworten und führten eine sogenannte induktive Inhaltsanalyse durch. Das bedeutet, dass sie nicht mit einer Liste von Kategorien begannen, in die sie die Antworten hineinzwängen konnten. Stattdessen lasen sie den Text, identifizierten die Kernideen, erstellten ihre eigenen Etiketten für diese Ideen und gruppierten diese Etiketten dann in breitere Themen. Es ist ein kreativer und interpretativer Prozess, der auf menschlichem Urteilsvermögen beruht, um zu entscheiden, was wichtig ist. Auf der anderen Seite des Experiments nutzten die Forscher ein hochentwickeltes Sprachmodell, um exakt dieselbe Aufgabe an demselben Text durchzuführen. Die Maschine erhielt dieselben Anweisungen, die Antworten zu lesen, die Hauptideen zu finden und sie in Themen zu gruppieren – und das, ohne vorab zu erfahren, wonach sie suchen sollte.
Die Forscher verglichen dann die beiden Ergebnissätze, um zu sehen, wie eng die Maschine mit den Menschen übereinstimmte. Sie suchten nicht nach einer perfekten Übereinstimmung, denn selbst verschiedene menschliche Experten sind sich oft uneinig darüber, wie ein bestimmter Satz zu etikettieren ist. Stattdessen maßen sie die allgemeine Übereinstimmung der Gruppen. Die Ergebnisse zeigten ein moderates Maß an Übereinstimmung. Wenn man sich die spezifischen Etiketten ansah, die die Forscher und die Maschine für den Text erstellt hatten, stimmten sie in 61 Prozent der Fälle überein. Beim Blick auf die breiteren Themen, die sie aus diesen Etiketten aufbauten, lag die Übereinstimmung mit 54 Prozent etwas niedriger. Um dies einzuordnen: Die Forscher prüften auch, wie sehr die fünf menschlichen Experten untereinander übereinstimmten. Die Menschen stimmten in Bezug auf die Etiketten und Themen zu 68 Prozent überein. Das bedeutet, dass die Lücke zwischen dem Menschen und der Maschine nicht groß war; die Maschine arbeitete fast so konsistent wie ein menschlicher Experte mit einem anderen menschlichen Experten zusammen.
Die Geschichte verläuft jedoch nicht einheitlich über alle Themen hinweg. Die Übereinstimmung zwischen den Menschen und der Maschine variierte erheblich, je nachdem, worüber die Studierenden schrieben. Bei Fragen zu finanziellen Situationen hatte die Maschine größere Schwierigkeiten und zeigte eine geringere Übereinstimmung mit den menschlichen Forschern. Bei Fragen zu persönlichen Erfahrungen oder allgemeinem Feedback war die Übereinstimmung viel stärker. Die Studie legt nahe, dass die Zuverlässigkeit der Maschine stark von der Art der Daten und der Klarheit des Textes abhängt. Wenn der Text mehrdeutig war oder die interne Logik der eigenen Gruppierung der Maschine wackelig war, sank die Übereinstimmung mit den Menschen. Die Forscher fanden heraus, dass immer dann, wenn die Maschine in sich selbst inkonsistent war, sie auch gegenüber den Menschen inkonsistent war, und dasselbe galt für das menschliche Team. Dies deutet darauf hin, dass die Schwierigkeit des spezifischen Themas eine entscheidende Rolle dabei spielt, wie gut das Werkzeug funktioniert.
Die menschlichen Kodierer, die an der Studie teilnahmen, wurden auch nach ihren Eindrücken zur Arbeit der Maschine gefragt. Sie berichteten, dass die Kategorisierungen der Maschine ihr eigenes Denken widerspiegelten und dass sie dem Werkzeug vertrauen würden, um zukünftige Daten zu analysen. Die Forscher kamen zu dem Schluss, dass diese Systeme der künstlichen Intelligenz noch nicht bereit sind, das menschliche Urteilsvermögen vollständig zu ersetzen, insbesondere bei der komplexen, hochgradigen Arbeit des Theoriebildungsprozesses. Die Ergebnisse legen jedoch nahe, dass diese Werkzeuge sehr effektiv darin sind, die frühen, arbeitsintensiven Phasen der Textsortierung zu bewältigen. Sie können die schwere Arbeit übernehmen, tausende von Antworten zu lesen und die ersten Muster zu finden, sodass menschliche Forscher sich auf die tiefere Interpretation und Validierung dieser Muster konzentrieren können. Die Studie behauptet nicht, dass die Maschine perfekt ist oder dass sie das Problem der Textanalyse gelöst hat, aber sie legt nahe, dass sie ein leistungsstarker, skalierbarer Partner für Forscher ist, die große Mengen menschlicher Geschichten sinnvoll deuten müssen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.