A large-scale corpus of religious radio broadcast transcripts from webstream recordings in the United States
Cet article présente un corpus à grande échelle de plus de 700 000 segments de programmes radiophoniques religieux en langue anglaise, transcrits et diarisés, datant de juillet 2025, collectés à partir de 785 flux web représentant plus de 2 000 stations américaines, afin de faciliter la recherche sur le contenu des médias religieux, le discours socio-politique et le traitement de la parole.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez les ondes comme une immense bibliothèque invisible où des milliers de stations de radio crient constamment des histoires, des chansons et des sermons dans le vide. Pendant des décades, les scientifiques qui étudient la façon dont les gens communiquent ont pu lire les livres des sections « Actualités » et « Émissions de débat » de cette bibliothèque, mais la section « Religion » est restée un mystère. Pourquoi ? Parce que, bien que des millions de personnes écoutent la radio confessionnelle chaque jour, personne n'avait jamais construit un index géant et interrogeable de ce qui était réellement dit. C'est comme essayer de comprendre la culture d'une ville entière en regardant seulement quelques panneaux de signalisation, plutôt qu'en lisant les véritables conversations qui ont lieu dans les cafés. Pour résoudre cela, les chercheurs avaient besoin d'un moyen de transformer des heures de parasites radio flous en un texte clair et organisé, puis d'utiliser des programmes informatiques intelligents pour comprendre de quoi parlaient réellement ces textes. C'est le défi de l'« analyse au niveau du contenu » : passer du simple fait de savoir qu'une station existe à la compréhension exacte de ce qu'elle dit, de la manière dont elle le dit et de qui le dit.
Entrez le Religious Radio Corpus, une nouvelle carte au trésor numérique massive créée par une équipe du Pew Research Center. Considérez ce projet comme un bibliothécaire robotique surpuissant et automatisé qui a passé un mois entier (juillet 2025) à écouter 785 flux radio en direct différents à travers les États-Unis. Au lieu de simplement enregistrer l'audio, cette équipe de robots a capturé des segments sonores de 15 minutes toutes les 15 minutes, 24 heures sur 24. À la fin de leur tâche, ils avaient rassemblé plus de 700 000 enregistrements — plus de 172 000 heures d'audio brut ! Mais la véritable magie s'est produite ensuite : l'équipe a utilisé une IA avancée pour transformer tout cet audio en texte, en identifiant qui parlait et quand. Ils ont même utilisé un cerveau informatique super intelligent (un grand modèle de langage) pour lire ces transcriptions et les étiqueter avec des catégories telles que « Sermon », « Interaction avec l'auditeur » ou « Politique ».
Le résultat est un ensemble de données contenant plus de 60 millions de lignes de texte, organisées en trois couches nettes : une liste des flux radio, un journal de chaque enregistrement et les paroles réellement prononcées. Ce n'est pas seulement un tas de données ; c'est un outil qui permet aux chercheurs de répondre enfin à de grandes questions. Par exemple, ils peuvent désormais voir comment la radio religieuse change du Sud vers l'Ouest, ou à quelle fréquence les politiciens sont mentionnés dans les sermons par rapport à la fréquence à laquelle ils parlent de conseils familiaux. L'équipe a vérifié son travail avec soin, constatant que leur transcription informatique était étonnamment précise — ne faisant qu'environ 5 erreurs pour 100 mots, ce qui est proche de la manière dont deux humains différents se mettraient d'accord s'ils transcrivaient tous deux la même cassette. Bien que l'ordinateur ait parfois eu du mal avec les appels téléphoniques bruyants ou la musique de fond, l'image globale est claire et fiable.
Cet article ne dit pas seulement « nous avons des données » ; il prouve que nous pouvons désormais étudier la radiodiffusion religieuse à une échelle jamais vue auparavant. Il écarte l'idée que nous devions nous appuyer sur de petites enquêtes ou deviner ce qui passe sur les ondes. Au lieu de cela, il offre un registre complet et interrogeable de ce qui est réellement diffusé. Les auteurs sont convaincus que ces données sont assez solides pour aider les chercheurs à comprendre l'« église électronique » en tant que phénomène national, plutôt que de simplement regarder une station à la fois. Que vous soyez un étudiant de la religion, un politologue ou un expert en informatique essayant d'apprendre aux machines à comprendre la parole humaine, ce corpus ouvre la porte à une toute nouvelle façon d'écouter le monde.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.