A large-scale corpus of religious radio broadcast transcripts from webstream recordings in the United States
Questo articolo introduce un corpus su larga scala di oltre 700.000 segmenti di trasmissioni radiofoniche religiose in lingua inglese, trascritti e con diarizzazione, risalenti a luglio 2025, raccolti da 785 webstream che rappresentano più di 2.000 stazioni statunitensi, per facilitare la ricerca sui contenuti dei media religiosi, il discorso socio-politico e l'elaborazione del linguaggio.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immaginate le onde radio come una gigantesca biblioteca invisibile dove migliaia di stazioni radiofoniche urlano costantemente storie, canzoni e sermoni nel vuoto. Per decenni, gli scienziati che studiano il modo in cui le persone comunicano sono stati in grado di leggere i libri nelle sezioni "Notizie" e "Talk Show" di questa biblioteca, ma la sezione "Religiosa" è rimasta un mistero. Perché? Perché mentre milioni di persone sintonizzano la radio su programmi basati sulla fede ogni giorno, nessuno aveva mai costruito un indice gigante e ricercabile di ciò che veniva effettivamente detto. È come cercare di comprendere la cultura di un'intera città guardando solo pochi cartelli stradali, invece di leggere le conversazioni reali che avvengono nei caffè. Per risolvere questo problema, i ricercatori avevano bisogno di un modo per trasformare ore di audio confuso e statico in testo chiaro e organizzato, e poi usare programmi informatici intelligenti per capire di cosa parlassero realmente quei testi. Questa è la sfida dell' "analisi a livello di contenuto": passare dal semplice sapere che una stazione esiste al capire esattamente cosa dice, come lo dice e chi lo dice.
Entra in scena il Religious Radio Corpus, una nuova e massiccia mappa digitale del tesoro creata da un team del Pew Research Center. Pensate a questo progetto come a un bibliotecario robotico, super-potenziato e automatizzato, che ha passato un intero mese (luglio 2025) ascoltando 785 diversi flussi radiofonici in diretta in tutti gli Stati Uniti. Invece di limitarsi a registrare l'audio, questo team di robot ha catturato frammenti di suono di 15 minuti ogni 15 minuti, 24 ore su 24. Quando hanno finito, avevano raccolto oltre 700.000 registrazioni — più di 172.000 ore di audio grezzo! Ma la vera magia è avvenuta dopo: il team ha utilizzato l'IA avanzata per trasformare tutto quell'audio in testo, identificando chi parlava e quando. Hanno persino usato un cervello informatico super-intelligente (un Large Language Model) per leggere quelle trascrizioni e apporre etichette come "Sermone", "Interazione con l'ascoltatore" o "Politica".
Il risultato è un dataset contenente oltre 60 milioni di righe di testo, organizzate in tre livelli ordinati: un elenco dei flussi radiofonici, un registro di ogni registrazione e le parole effettivamente pronunciate. Questo non è solo un mucchio di dati; è uno strumento che permette ai ricercatori di rispondere finalmente a grandi domande. Ad esempio, ora possono vedere come la radio religiosa cambi dal Sud all'Ovest, o quanto spesso i politici vengono menzionati nei sermoni rispetto a quanto spesso si parli di consigli per la famiglia. Il team ha controllato attentamente il proprio lavoro, scoprendo che la loro trascrizione computerizzata era sorprendentemente accurata — commettendo solo circa 5 errori ogni 100 parole, un valore vicino a quanto due diversi esseri umani concorderebbero se entrambi trascrivessero lo stesso nastro. Sebbene il computer abbia talvolta faticato con chiamate telefoniche rumorose o musica di sottofondo, il quadro generale è chiaro e affidabile.
Questo articolo non dice solo "abbiamo dei dati"; dimostra che possiamo ora studiare la radiodiffusione religiosa su una scala mai stata possibile prima d'ora. Esclude l'idea che dobbiamo affidarci a piccoli sondaggi o indovinare cosa passa sulle onde radio. Invece, offre un registro completo e ricercabile di ciò che viene effettivamente trasmesso. Gli autori sono fiduciosi che questi dati siano abbastanza solidi da aiutare gli studiosi a comprendere la "chiesa elettronica" come un fenomeno nazionale, piuttosto che limitarsi a guardare una stazione alla volta. Che siate studenti di religione, politologi o esperti informatici che cercano di insegnare alle macchine come comprendere il linguaggio umano, questo corpus apre la porta a un modo completamente nuovo di ascoltare il mondo.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.