A large-scale corpus of religious radio broadcast transcripts from webstream recordings in the United States
本文介绍了一个包含超过 700,000 段 2025 年 7 月份英语宗教广播节目片段的大规模语料库,这些片段经过转录和说话人日志处理,收集自代表 2,000 多个美国电台的 785 个网络流媒体,旨在促进对宗教媒体内容、社会政治话语及语音处理的研究。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,电波就像一座巨大的、无形的图书馆,成千上万个广播电台正不断地向虚空之中呐喊着故事、歌曲和布道。几十年来,研究人类如何进行交流的科学家们一直能够阅读这座图书馆中“新闻”和“谈话节目”部分的书籍,但“宗教”部分却始终是一个谜。为什么呢?因为尽管每天都有数百万人收听基于信仰的广播,但从未有人建立过一个巨大的、可搜索的索引来记录究竟在说什么。这就像是试图通过只看几块街头指示牌,而不是通过阅读咖啡馆里实际发生的对话,来理解一整座城市的文化。为了解决这个问题,研究人员需要一种方法,将数小时模糊的无线电静电声转化为清晰、有序的文本,然后利用智能计算机程序来弄清楚这些文本到底在讨论什么。这就是“内容级分析”的挑战:从仅仅知道一个电台的存在,转向理解它究竟说了什么、怎么说的以及谁在说。
于是,**宗教广播语料库(Religious Radio Corpus)**诞生了——这是皮尤研究中心(Pew Research Center)的一个团队创建的一个庞大的全新数字宝藏地图。可以将这个项目想象成一个超级强大的、自动化的机器人图书管理员,它花了整整一个月的时间(2025年7月),倾听了全美785个不同的实时广播流。这个机器人团队不仅仅是录制音频,它们每隔15分钟捕捉一段15分钟长度的声音片段,全天24小时不间断。当它们完成任务时,已经收集了超过70万条录音——超过17.2万小时的原始音频!但真正的魔法发生在下一步:团队利用先进的人工智能将所有音频转化为文本,并识别出谁在说话以及何时在说话。他们甚至使用了一个超级聪明的计算机大脑(大语言模型)来阅读这些转录文本,并用诸如“布道”、“听众互动”或“政治”之类的标签进行标记。
其结果是一个包含超过6000万行文本的数据集,被组织成三个整齐的层级:一份广播流列表,一份每次录音的日志,以及实际的说话内容。这不仅仅是一堆数据;它是一个工具,让研究人员终于能够回答重大问题。例如,他们现在可以观察宗教广播如何从南部变化到西部,或者政治人物在布道中被提及的频率与他们在家庭建议中被提及的频率相比如何。团队仔细检查了他们的工作,发现他们的计算机转录准确率惊人地高——每100个单词大约只出现5个错误,这与两个不同的人类在转录同一段磁带时的达成一致程度非常接近。虽然计算机有时会在处理嘈_噪的电话通话或背景音乐时遇到困难,但整体图景是清晰且可靠的。
这篇论文不仅仅是在说“我们拥有数据”;它证明了我们现在可以以前所未有的规模来研究宗教广播。它排除了我们必须依赖小型调查或猜测电波上内容的观点。相反,它提供了一个完整的、可搜索的记录,展示了实际正在广播的内容。作者们确信,这些数据足够坚实,能够帮助学者们将“电子教会”作为一个全国性的现象来理解,而不仅仅是观察单个电台。无论你是宗教研究者、政治学家,还是试图教机器如何理解人类语言的计算机专家,这个语料库都开启了一扇通往以全新方式聆听世界的大门。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。