← Últimos artículos
💬 NLP

A large-scale corpus of religious radio broadcast transcripts from webstream recordings in the United States

Este artículo presenta un corpus a gran escala de más de 700.000 segmentos de transmisiones radiales religiosas en inglés, transcritos y con diarización, de julio de 2025, recolectados de 785 transmisiones web que representan a más de 2.000 estaciones de EE. UU., para facilitar la investigación sobre el contenido de los medios religiosos, el discurso sociopolítico y el procesamiento del habla.

Autores originales: Samuel Bestvater, Athena Chapekis, Skyler Seets, Anna Lieb, Sono Shah, Aaron Smith

Publicado 2026-07-30
📖 4 min de lectura☕ Lectura para el café

Autores originales: Samuel Bestvater, Athena Chapekis, Skyler Seets, Anna Lieb, Sono Shah, Aaron Smith

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina las ondas de radio como una biblioteca gigante e invisible donde miles de estaciones de radio gritan constantemente historias, canciones y sermones al vacío. Durante décadas, los científicos que estudian cómo se comunica la gente han podido leer los libros en las secciones de "Noticias" y "Programas de debate" de esta biblioteca, pero la sección "Religiosa" ha sido un misterio. ¿Por qué? Porque aunque millones de personas sintonizan la radio basada en la fe todos los días, nadie había construido jamás un índice gigante y de búsqueda para saber qué se estaba diciendo realmente. Es como intentar comprender la cultura de toda una ciudad mirando solo unos pocos letreros de calles, en lugar de leer las conversaciones reales que ocurren en los cafés. Para resolver esto, los investigadores necesitaban una forma de convertir horas de estática de radio difusa en texto claro y organizado, y luego usar programas informáticos inteligentes para determinar de qué trataban realmente esos textos. Este es el desafío del "análisis a nivel de contenido": pasar de simplemente saber que una estación existe a comprender exactamente qué dice, cómo lo dice y quién lo dice.

Entra el Corpus de Radio Religiosa, un nuevo y masivo mapa del tesoro digital creado por un equipo del Pew Research Center. Piensa en este proyecto como un bibliotecario robótico automatizado y superpotente que pasó un mes entero (julio de 2025) escuchando 785 transmisiones de radio en vivo diferentes en todo Estados Unidos. En lugar de solo grabar el audio, este equipo de robots capturó fragmentos de sonido de 15 minutos cada 15 minutos, las 24 horas del día. Para cuando terminaron, habían reunido más de 700,000 grabaciones, ¡más de 172,000 horas de audio bruto! Pero la verdadera magia ocurrió después: el equipo utilizó IA avanzada para convertir todo ese audio en texto, identificando quién estaba hablando y cuándo. Incluso utilizaron un cerebro informático superinteligente (un Modelo de Lenguaje Extenso) para leer esas transcripciones y etiquetarlas con etiquetas como "Sermón", "Interacción con el oyente" o "Política".

El resultado es un conjunto de datos que contiene más de 60 millones de líneas de texto, organizadas en tres capas ordenadas: una lista de las transmisiones de radio, un registro de cada grabación y las palabras habladas. Esto no es solo una pila de datos; es una herramienta que permite a los investigadores responder finalmente grandes preguntas. Por ejemplo, ahora pueden ver cómo cambia la radio religiosa del Sur al Oeste, o con qué frecuencia se mencionan a los políticos en los sermones frente a con qué frecuencia se habla de consejos familiares. El equipo verificó su trabajo cuidadosamente, encontrando que su transcripción computarizada fue sorprendentemente precisa, cometiendo aproximadamente 5 errores por cada 100 palabras, lo cual es cercano a lo bien que dos humanos distintos estarían de acuerdo si ambos transcribieran la misma cinta. Aunque la computadora a veces tuvo dificultades con llamadas telefónicas ruidosas o música de fondo, el panorama general es claro y confiable.

Este artículo no solo dice "tenemos datos"; demuestra que ahora podemos estudiar la radiodifusión religiosa a una escala nunca antes posible. Desestima la idea de que tenemos que depender de pequeñas encuestas o adivinar qué hay en las ondas de radio. En su lugar, ofrece un registro completo y de búsqueda de lo que realmente se está transmitiendo. Los autores están seguros de que estos datos son lo suficientemente sólidos como para ayudar a los académicos a comprender la "iglesia electrónica" como un fenómeno nacional, en lugar de mirar solo una estación a la vez. Ya seas un estudiante de religión, un politólogo o un experto en computación tratando de enseñar a las máquinas cómo entender el habla humana, este corpus abre la puerta a una forma completamente nueva de escuchar al mundo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →