A large-scale corpus of religious radio broadcast transcripts from webstream recordings in the United States
Dit artikel introduceert een grootschalige corpus van meer dan 700.000 getranscribeerde en gediariseerde Engelstalige religieuze radiofragmenten uit juli 2025, verzameld van 785 webstreams die meer dan 2.000 Amerikaanse stations vertegenwoordigen, om onderzoek naar religieuze mediacontent, sociaal-politiek discours en spraakverwerking te faciliteren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je de ether voor als een gigantische, onzichtbare bibliotheek waar duizenden radiostations constant verhalen, liedjes en preken de leegte in schreeuwen. Decennialang hebben wetenschappers die bestuderen hoe mensen communiceren de boeken in de secties "Nieuws" en "Talkshow" van deze bibliotheek kunnen lezen, maar de "Religieuze" sectie is een mysterie gebleven. Waarom? Omdat hoewel miljoenen mensen dagelijks naar religieuze radio luisteren, nog nooit iemand een enorme, doorzoekbare index heeft gebouwd van wat er daadwerkelijk werd gezegd. Het is alsof je probeert de cultuur van een hele stad te begrijpen door alleen naar een paar straatnaamborden te kijken, in plaats van de werkelijke gesprekken te lezen die in de cafés plaatsvinden. Om dit op te lossen, hadden onderzoekers een manier nodig om urenlang wazige radiostatische ruis om te zetten in heldere, georganiseerde tekst, en vervolgens slimme computerprogramma's te gebruiken om te ontdekken waar die teksten daadwerkelijk over gingen. Dit is de uitdaging van "content-level analysis": van alleen weten dat een station bestaat naar begrijpen wat het precies zegt, hoe het het zegt en wie het zegt.
Maak kennis met de Religious Radio Corpus, een enorme nieuwe digitale schatkaart gemaakt door een team van het Pew Research Center. Beschouw dit project als een superkrachtige, geautomatiseerde robotbibliothecaris die een hele maand lang (juli 2025) naar 785 verschillende live radiostreams door heel de Verenigde Staten heeft geluisterd. In plaats van alleen het geluid op te nemen, legde dit robotteam elke 15 minuten fragmenten van 15 minuten geluid vast, 24 uur per dag. Tegen de tijd dat ze klaar waren, hadden ze meer dan 700.000 opnames verzameld – meer dan 172.000 uur aan ruwe audio! Maar de echte magie gebeurde daarna: het team gebruikte geavanceerde AI om al dat audio om te zetten in tekst, waarbij ze identificeerden wie er sprak en wanneer. Ze gebruikten zelfs een superintelligent computerbrein (een Large Language Model) om die transcripties te lezen en ze te labelen met categorieën zoals "Preek", "Interactie met Luisteraar" of "Politiek".
Het resultaat is een dataset die bestaat uit meer dan 6-miljoen regels tekst, georganiseerd in drie nette lagen: een lijst van de radiostreams, een logboek van elke opname en de daadwerkelijk gesproken woorden. Dit is niet zomaar een stapel data; het is een instrument waarmee onderzoekers eindelijk grote vragen kunnen beantwoorden. Zo kunnen ze nu zien hoe religieuze radio verandert van het Zuiden naar het Westen, of hoe vaak politici worden genoemd in preken versus hoe vaak ze praten over gezinsadvies. Het team heeft hun werk zorgvuldig gecontroleerd en ontdekt dat hun computertranscriptie verrassend nauwkeurig was – met slechts ongeveer 5 fouten per 100 woorden, wat dicht in de buurt komt van hoe goed twee verschillende mensen het met elkaar eens zouden zijn als ze beiden dezelfde tape zouden transcriberen. Ho hoewel de computer soms moeite had met rumoerige telefoongesprekken of achtergrondmuziek, is het algemene beeld duidelijk en betrouwbaar.
Dit artikel zegt niet alleen "we hebben data"; het bewijst dat we religieuze uitzendingen nu kunnen bestuderen op een schaal die voorheen nooit mogelijk was. Het weerlegt het idee dat we moeten vertrouwen op kleine enquêtes of moeten gissen naar wat er op de ether wordt uitgezonden. In plaats daarvan biedt het een volledig, doorzoekbaar verslag van wat er daadwerkelijk wordt uitgezonden. De auteurs zijn er zeker van dat deze data solide genoeg is om geleerden te helpen de "elektronische kerk" te begrijpen als een nationaal fenomeen, in plaats van slechts naar één station tegelijk te kijken. Of je nu een student religie bent, een politiek wetenschapper of een computerdeskundige die machines probeert te leren hoe ze menselijke spraak begrijpen, deze corpus opent de deur naar een totaal nieuwe manier van luisteren naar de wereld.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.