Towards an LLM-based method for quantifying the sexual content in song lyrics
本文介绍了一种基于大语言模型的可复现方法,用于量化歌曲歌词中的主题内容,并将其应用于包含 1,259 首雷鬼顿(reggaeton)曲目的语料库,以分析不同艺人、不同时期以及针对 Spotify 显性标签(explicit flags)的性显性程度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,音乐的世界就像一座巨大的、嘈杂的图书馆,每一首歌都是一本书。长期以来,当人们想要了解一种被称为“雷鬼顿”(Reggaeton)的特定流派的书籍内容时,必须亲手一本本地阅读并做笔记。这就像是通过站在街角观察路过的车辆来统计城市里有多少辆红色的车一样。这既缓慢又累人,而且在感到疲倦之前,你只能观察到很少量的车辆。这个研究领域被称为“内容分析法”(content analysis),它是科学家试图将情感和主题(如爱、愤怒或派对)转化为实际数字以便进行比较的方法。大家一直都在问的一个大问题是:“雷鬼顿真的全是关于性的吗,还是那只是个传闻?”为了回答这个问题,我们需要一种方法来衡量歌词,而不需要手动阅读每一首。这就是一种新型助手进场的地方:一个被称为“大语言模型”(LLM)的超级聪明的人造大脑。你可以把 LLM 想象成一个读过图书馆里几乎所有书籍的机器人,它能瞬间告诉你:“这个故事有很多浪漫色彩,”或者“这个故事充满了暴力,”并给出一个从零到十的分数。
这篇论文就像是一个使用那个机器人大脑来衡量雷鬼顿歌词“辛辣度”的食谱。作者伊格纳西奥·斯蒂科(Ignacio Sticco)构建了一种方法,将来自 12 位知名艺术家的 1,259 首歌曲输入到计算机中。他并没有仅仅询问“这首歌是否低俗?”,而是教计算机去寻找歌曲中的九种不同“风味”,比如“派对氛围”、“伤感爱情”、“街头犯罪”,以及两种特定类型的“性话题”:一种是暗示性的(suggestive),另一种是直白的(explicit)。机器人首先在了一组由人类已经评分过的歌曲上进行了训练,因此它学会了给出与人类相同的分数。一旦机器人准备就绪,它就对整个音乐库进行了评分,创建了一个巨大的数据表格,展示了每首曲目中各种主题出现的精确程度。
结果有些令人惊讶,也绝对不像你只听广播时所预期的那样。首先,研究发现虽然雷鬼顿确实充满了性主题,但“暗示性”的内容实际上是“直白性”内容的两倍。这就像是发现大多数派对歌曲讨论的是关于一个疯狂夜晚的“念头”,而不是在用极其露骨的细节来描述那个疯狂的夜晚。其次,艺术家们并不都是一样的。有些艺术家,比如 Plan B,就像是一颗辛辣的辣椒,在直接性内容上的得分非常高。而另一些艺术家,比如 Camilo,则更像是一种甜点,歌词几乎完全是关于浪漫爱情的,几乎没有任何性话题。这项研究表明,将所有雷鬼顿艺术家视为一个整体是错误的;他们之间的差异,就像重金属乐队与爵士三重奏之间的差异一样大。
论文还观察了事物随时间的变化,从 2002 年到 2025 年。与“雷鬼顿在各方面都变得越来越狂野”的观点相反,研究发现“街头犯罪”这一主题正在消退,而“浪漫情感”这一主题正在增强。然而,“直接露骨”的性内容在过去二十年里翻了一番。这意味着该流派不仅仅是在变得更具暗示性,它在语言上也变得更加直接,但同时也变得更具情感色彩,且不再仅仅关乎犯罪。
最后,作者将计算机的工作结果与 Spotify 自有的“显性内容”(Explicit)标签(你在歌曲旁边看到的那个小小的“E”)进行了对比。计算机发现 Spotify 遗漏了大量的显性内容。在计算机识别出的每四首含有显性性内容的歌曲中,Spotify 只标记了一首。这就像是一个保安只检查大型、响亮的武器,却漏掉了那些较小、较锋利的刀具。这表明,目前流媒体服务用来标记音乐的方式过于粗糙,无法捕捉到这些歌曲中所发现的特定类型的性内容。
简而言之,这篇论文并不仅仅是在说“雷鬼顿很性感”。它利用一种聪明的计算机方法证明了,雷鬼顿是一个由浪漫、派对和直接性话题组成的复杂混合体,并且在过去的 20 年里发生了特定的变化。它还表明,我们目前用于标记音乐的工具(如 Spotify 的标签)在捕捉研究人员和听众可能感兴趣的具体细节方面表现并不理想。作者分享了代码和数据,邀请任何人都可以使用这种机器人大脑方法来研究其他音乐流派甚至不同的语言,将阅读歌词这种缓慢的艺术转变为一种快速的、可衡量的科学。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。