← 최신 논문
🔬 physics

Towards an LLM-based method for quantifying the sexual content in song lyrics

이 논문은 노래 가사의 주제적 내용을 정량화하기 위한 재현 가능한 거대 언어 모델 기반 방법을 소개하며, 이를 1,259곡의 레게톤 트랙 코퍼스에 적용하여 아티스트, 시간, 그리고 스포티파이의 익스플리시트(explicit) 플래그를 대상으로 성적 노골성을 분석한다.

원저자: Ignacio M. Sticco

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ignacio M. Sticco

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

음악의 세계를 모든 노래가 책인 거대하고 시끌벅적한 도서관이라고 상상해 보세요. 오랫동안 사람들은 레게톤(Reggaeton)이라는 특정 장르의 책 안에 무엇이 들어있는지 알고 싶을 때, 책을 하나하나 직접 읽으며 손으로 노트를 작성해야 했습니다. 이것은 도시의 길가에 서서 지나가는 차들을 보며 빨간색 자동차가 몇 대인지 세는 것과 같습니다. 느리고, 지치며, 피곤해지기 전에 아주 적은 수의 자동차만 볼 수 있을 뿐이죠. 이 연구 분야를 "내용 분석(content analysis)"이라고 부르며, 이는 과학자들이 사랑, 분노, 파티와 같은 감정이나 주제를 어떻게 실제 숫자로 바꾸어 비교할 수 있는지 연구하는 방법입니다. 모두가 던져온 큰 질문은 이것입니다: "레게톤은 정말 성적인 내용뿐인가, 아니가 아니면 그저 소문일 뿐인가?" 이를 답하기 위해 우리는 모든 가사를 일일이 수동으로 읽지 않고도 가사를 측정할 방법이 필요합니다. 바로 여기서 새로운 종류의 조력자가 등장합니다. 거대 언어 모델(LLM)이라는 이름의 초스마트한 컴퓨터 뇌입니다. LL음을 거의 모든 책을 읽은 로봇이라고 생각하면 쉽습니다. 이 로봇은 즉각적으로 "이 이야기는 로맨스가 많다"라거나 "이것은 폭력으로 가득 차 있다"라고 말하며, 0점에서 10점 사이의 점수를 매길 수 있습니다.

이 논문은 그 로봇 뇌를 사용하여 레게톤 가사의 "매운맛(spiciness)"을 측정하는 레시피와 같습니다. 저자인 이그나시오 스티코(Ignacio Sticto)는 12명의 유명 아티스트로부터 나온 1,259곡의 노래를 컴퓨터에 입력하는 방법을 만들었습니다. 단순히 "이 노래는 저속한가?"라고 묻는 대신, 컴퓨터는 "파티 분위기", "슬픈 사랑", "거리의 범죄", 그리고 두 가지 특정한 종류의 "성적 대화"(암시적인 것과 직접적인 것)를 포함한 9가지 서로 다른 노래의 '맛'을 찾도록 학습되었습니다. 로봇은 먼저 인간이 이미 점수를 매긴 작은 규모의 노래 집단 위에서 훈련되었고, 이를 통해 인간이 주는 것과 동일한 점수를 줄 수 있도록 배웠습니다. 로봇이 준비되자, 로봇은 전체 노래 도서관의 등급을 매겼고, 각 트랙에 각 주제가 얼마나 나타나는지를 보여주는 방대한 데이터 스프레드시트를 만들어냈습니다.

결과는 다소 놀라우며, 여러분이 단순히 라디오를 들었을 때 예상할 법한 내용이 아닙니다. 첫째, 이 연구는 레게톤이 확실히 성적인 주제를 담고 있지만, "직설적인" 종류보다는 "암시적인" 종류가 실제로 두 배 더 흔하다는 것을 발견했습니다. 이는 대부분의 파티 노래들이 격렬한 밤의 밤을 그래픽하게 묘사하기보다는, 그저 거친 밤의 '아이디어'에 관한 것임을 발견한 것과 같습니다. 둘째, 아티스트들은 모두 같지 않습니다. 어떤 아티스트들, 예를 들어 플랜 B(Plan B)는 매우 높은 점수를 받는 매운 고추와 같습니다. 반면 카밀로(Camilo) 같은 이들은 거의 전적으로 로맨틱한 사랑에 관한 가사를 담고 있으며 성적인 대화는 거의 없는 달콤한 디저트와 같습니다. 이 연구는 모든 레게톤 아티스트를 하나의 그룹으로 취급하는 것이 실수임을 보여줍니다. 그들은 헤비메탈 밴드와 재즈 트리오만큼이나 서로 다릅니다.

논문은 또한 2002년부터 2025년까지 시간이 흐름에 따라 어떻게 변화했는지도 살펴보았습니다. 장르가 모든 면에서 점점 더 "거칠어지고" 있다는 생각과는 반대로, 연구 결과 "거리의 범죄" 테마는 실제로 사라지고 있는 반면, "로맨틱한 감정" 테마는 점점 더 강해지고 있다는 것을 발견했습니다. 그러나 "직접적으로 노골적인" 성적 콘텐츠는 지난 20년 동안 두 배로 늘어났습니다. 이는 장르가 단순히 암시적으로 변하는 것이 아니라, 언어가 더 직접적으로 변하고 있으며, 동시에 범죄보다는 더 감정적으로 변하고 있음을 의미합니다.

마지막으로, 저자는 컴퓨터의 작업 내용을 스포티파이(Spotify) 자체의 "Explicit(노골적임)" 라벨(노래 옆에 붙는 작은 'E')과 대조하여 확인했습니다. 컴퓨터는 스포티파이가 노골적인 콘텐츠의 상당 부분을 놓치고 있다는 것을 발견했습니다. 컴퓨터가 성적인 가사가 있다고 식별한 노래 4곡 중 4곡당 단 1곡만이 스포티파이에 의해 표시되었습니다. 이는 마치 보안 요원이 크고 시끄러운 무기만 체크하고 작은 칼은 놓치는 것과 같습니다. 이는 현재 스트리밍 서비스가 음악을 분류하는 방식이 이 노래들에서 발견되는 특정한 종류의 성적 콘텐츠를 잡아내기에는 너무 투박한 도구라는 것을 시사합니다.

요약하자면, 이 논문은 단순히 "레게톤은 섹시하다"라고 말하는 것이 아닙니다. 이 논문은 똑똑한 컴퓨터 방식을 사용하여 레게톤이 로맨스, 파티, 그리고 직접적인 성적 대화의 복잡한 혼합물이며, 지난 20년 동안 구체적인 방식으로 변화해 왔음을 증명합니다. 또한, 저자는 코드와 데이터를 공유하여 다른 음악 장르나 심지어 다른 언어를 연구하는 데 이 동일한 로봇 뇌 방식을 사용할 수 있도록 초대하며, 가사를 읽는 느린 예술을 빠르고 측정 가능한 과학으로 바꾸어 놓았습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →