← Derniers articles
💻 computer science

LLMs for Survey Text Analysis – A Performance Comparison Between Humans and GPT-5 on Inductive Content Analysis

Cette étude démontre que GPT-5.4 peut approcher la performance humaine dans l'analyse de contenu inductive de données d'enquête, atteignant des niveaux d'accord pour le codage et la génération de thèmes comparables à la cohérence interne humaine, validant ainsi son potentiel en tant qu'outil de soutien évolutif pour la recherche qualitative.

Auteurs originaux : Leonardo Bergmann, Renata Gheorghiu, Ana Gvritishvili, Alex Mican, Chris Stewart, Topias Tolonen-Weckström

Publié 2026-09-16
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Leonardo Bergmann, Renata Gheorghiu, Ana Gvritishvili, Alex Mican, Chris Stewart, Topias Tolonen-Weckström

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La recherche qualitative est l'art de donner un sens aux mots. Lorsque les scientifiques, les sociologues ou les décideurs politiques ont besoin de comprendre les pensées, les sentiments et les expériences des individus, ils posent souvent des questions ouvertes. Au lieu de cocher une case, une personne écrit un paragraphe sur sa vie, ses luttes ou ses espoirs. Pour transformer des milliers de ces paragraphes en connaissances utiles, les chercheurs doivent lire chacun d'entre eux, identifier les idées récurrentes et les regrouper en catégories. Ce processus, appelé analyse de contenu, est le pilier de la compréhension du comportement humain, mais il est incroyablement lent et exigeant. Pendant des décennies, la seule façon d'y parvenir était par l'esprit humain, en lisant ligne par ligne. Aujourd'hui, un nouvel outil est entré dans la pièce : les modèles de langage de grande taille. Il s'agit de systèmes d'intelligence artificielle entraînés sur de vastes quantités de texte qui peuvent lire, comprendre et résumer le langage. La grande question pour la communauté scientifique n'est pas seulement de savoir si ces machines savent lire, mais si elles peuvent penser comme un chercheur humain lorsque la tâche exige de trouver des motifs cachés sans un manuel de règles préétablies.

Une équipe de chercheurs issus d'universités européennes s'est donné pour mission de répondre à cette question par une comparaison directe. Ils ont utilisé un ensemble de données réelles provenant d'une enquête menée auprès de 2 800 doctorants à travers l'Europe, où 10 % des réponses ont été tirées au sort pour servir de base de données à l'étude. À partir de cet échantillon, un total de 903 réponses à six questions spécifiques ouvertes ont été analysées en profondeur. D'un côté de l'expérience, cinq chercheurs humains ont lu ces réponses et ont effectué ce qu'on appelle une analyse de contenu inductive. Cela signifie qu'ils n'ont pas commencé avec une liste de catégories dans laquelle forcer les réponses. Au lieu de cela, ils ont lu le texte, identifié les idées centrales, créé leurs propres étiquettes pour ces idées, puis ont regroupé ces étiquettes en thèmes plus larges. C'est un processus créatif et interprétatif, qui repose sur le jugement humain pour décider de ce qui est important. De l'autre côté, les chercheurs ont utilisé un modèle de langage sophistiqué pour effectuer exactement la même tâche sur le même texte. La machine a reçu les mêmes instructions : lire les réponses, trouver les idées principales et les regrouper en thèmes, le tout sans qu'on lui dise à l'avance ce qu'elle devait chercher.

Les chercheurs ont ensuite comparé les deux ensembles de résultats pour voir à quel point la machine correspondait aux humains. Ils ne cherchaient pas une correspondance parfaite, car même différents experts humains divergent souvent sur la manière de nommer une phrase spécifique. Au lieu de cela, ils ont mesuré l'alignement global des groupes. Les résultats ont montré un niveau d'accord modéré. En examinant les étiquettes spécifiques que les chercheurs et la machine avaient créées pour le texte, ils étaient d'accord 61 % du temps. En examinant les thèmes plus larges construits à partir de ces étiquettes, l'accord était légèrement inférieur, à 54 %. Pour mettre cela en perspective, les chercheurs ont également vérifié dans quelle mesure les cinq experts humains étaient d'accord entre eux. Les humains étaient d'accord entre eux environ 68 % du temps sur les étiquettes et les thèmes. Cela signifie que l'écart entre l'humain et la machine n'était pas énorme ; la machine performait presque aussi de manière constante qu'un expert humain avec un autre expert humain.

Cependant, l'histoire n'est pas uniforme selon les sujets. L'accord entre les humains et la machine variait considérablement selon ce que les étudiants écrivaient. Pour les questions concernant les situations financières, la machine a davantage peiné, montrant un alignement plus faible avec les chercheurs humains. Pour les questions concernant les expériences personnelles ou les commentaires généraux, l'alignement était beaucoup plus fort. L'étude suggère que la fiabilité de la machine dépend fortement de la nature des données et de la clarté du texte. Lorsque le texte était ambigu ou que la logique interne du propre regroupement de la machine était fragile, l'accord avec les humains chutait. Les chercheurs ont constaté que chaque fois que la machine était incohérente avec elle-même, elle l'était aussi avec les humains, et la même chose était vraie pour l'équipe humaine. Cela indique que la difficulté du sujet spécifique joue un rôle majeur dans l'efficacité de l'outil.

Les codeurs humains qui ont participé à l'étude ont également été interrogés sur leurs impressions concernant le travail de la machine. Ils ont rapporté que les catégorisations de la machine reflétaient leur propre pensée et qu'ils feraient confiance à l'outil pour aider à analyser des données futures. Les chercheurs ont conclu que ces systèmes d'intelligence artificielle ne sont pas prêts à remplacer entièrement le jugement humain, surtout pour le travail complexe et de haut niveau consistant à construire des théories. Cependant, les conclusions suggèrent que ces outils sont très efficaces pour gérer les étapes initiales et laborieuses du tri de textes. Ils peuvent effectuer le travail de force consistant à lire des milliers de réponses et à trouver les motifs initiaux, permettant ainsi aux chercheurs humains de se concentrer sur l'interprétation plus profonde et la validation de ces motifs. L'étude ne prétend pas que la machine est parfaite ou qu'elle a résolu le problème de l'analyse de texte, mais elle suggère qu'elle est un partenaire puissant et évolutif pour les chercheurs qui doivent donner un sens à de grands volumes d'histoires humaines.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →