← 최신 논문
💬 NLP

Challenger at MultiPRIDE: Is It Hate Speech or Reclaimed?

본 논문은 밀집 의미 임베딩(dense semantic embeddings), Cleanlab 기반의 레이블 노이즈 필터링, 그리고 MLP 분류기를 결합하여 극심한 클래스 불균형에도 불구하고 견고한 성능을 달성함으로써 혐오 표현과 재전유된 언어(reclaimed language)를 구분하는 MultiPride Shared Task를 위한 계산 효율적이고 해석 가능한 접근 방식을 제시한다.

원저자: Hadi Bayrami Asl Tekanlou, Mahdi Bakhtiyarzadeh, Jafar Razmara

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hadi Bayrami Asl Tekanlou, Mahdi Bakhtiyarzadeh, Jafar Razmara

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 거대하고 시끌벅적한 광장이라고 상상해 보세요. 이 광장에서 사람들은 때때로 타인에게 상처를 주기 위한 말을 내뱉기도 합니다. 이것이 바로 **혐오 표현(hate speech)**입니다. 하지만 반전이 있습니다. 공격을 받은 당사자들이 그 똑같은 상처 주는 단어들을 다시 가져와서, 자기들 사이에서 서로의 결속력을 보여주고 강함을 드러내는 데 사용하기도 합니다. 이것을 **재탈환된 언어(reclaimed language)**라고 부릅니다.

이것은 마치 가족의 별명과 같습니다. 만약 낯선 사람이 당신의 가족을 우스꽝스러운 이름으로 부른다면 그것은 모욕입니다. 하지만 가족들이 그 똑같은 우스꽝스러운 이름을 사용하며 함께 웃는다면, 그것은 사랑의 표시가 됩니다. 문제는 컴퓨터가 낯선 사람이 내뱉는 욕설과 가족이 사용하는 별명 사이의 차이를 이해하는 데 매우 서투르다는 점입니다. 컴퓨터는 종종 혼동하여 가족들이 무례하게 행동하고 있다고 오해하곤 합니다.

이 논문은 타브리즈 대학교(University of Tabriz)의 한 팀이 MultiPRIDE라는 경연 대회를 위해 이 특정한 혼란을 해결할 "똑똑한 탐정"을 어떻게 만들었는지 설명합니다. 그들이 수행한 과정을 다음과 같이 간단한 단계로 나누어 정리했습니다.

1. 문제점: "오보(False Alarm)"

이 팀은 컴퓨터가 자주 "오보"를 낸다는 점에 주목했습니다. 컴퓨터는 특정 단어(예: 비속어)를 보면, 설령 그것이 LGBTQ+ 커뮤니티 내에서 서로를 지지하기 위해 사용되는 것이라 할지라도 즉각적으로 혐오 표현으로 분류해 버립니다. 이는 사람들이 자유롭게 자신을 표현하는 것을 방해합니다. 목표는 컴퓨터에게 "나쁜 놈"이 비속어를 사용하는 것과 "좋은 사람"이 그 단어를 재탈환하여 사용하는 것의 차이를 가르치는 것이었습니다.

2. 해결책: 3단계 정제 과정

팀은 고성능 필터처럼 작동하는 시스템을 구축했습니다. 단순히 텍스트를 읽는 대신, 그들은 세 단계의 과정을 사용했습니다.

  • 1단계: 청소부 (데이터 정제 및 증강)
    먼저, 그들은 지저분한 텍스트를 깨끗하게 청소했습니다. URL, 사용자 이름, 이모지(컴퓨터를 혼란스럽게 할 수 있는 요소들)는 쓸어버렸지만, 중요한 의미를 담고 있는 해시태그는 남겨두었습니다.

    • 비유: 여러분이 지저분한 방을 공부하려고 한다고 상상해 보세요. 쓰레기(URL)는 버리지만, 이야기를 들려주는 책(해시태그)은 남겨두는 것과 같습니다.
    • 반전: 그들은 또한 '재탈환된' 언어(소수 클래스)의 사례가 충분하지 않다는 점을 발견했습니다. 그래서 그들은 "번역 기계"(구글 번역)를 사용하여 이 희귀한 사례들을 다른 언어(프랑스어나 독일어 등)로 번역한 다음 다시 영어로 번역했습니다. 이를 통해 새로운 가짜 사례들을 만들어내어 컴퓨터가 더 잘 학습할 수 있도록 도왔는데, 이는 마치 요리사가 연습을 더 많이 할 수 있도록 희귀한 레시피의 복사본을 추가로 만드는 것과 같습니다.
  • 2단계: 번역가 (임베딩)
    그들은 문장을 "밀집된 지도(dense maps)"로 변환하기 위해 intfloat/e5-large-v2라는 강력한 도구를 사용했습니다.

    • 비유: 단순히 "사랑해"라는 단어를 보는 대신, 컴퓨터는 전체 문장을 복잡한 좌표 세트로 변환합니다. 이 지도는 문장의 사전적 정의가 아닌, 문장의 느낌맥락을 포착합니다. 이를 통해 컴퓨터는 "사랑해"라는 말이 부모님이 말할 때와 낯선 사람이 기괴한 방식으로 말할 때의 차이를 이해할 수 있게 됩니다.
  • 3단계: 품질 관리 (레이블 정제)
    때때로 데이터 자체에 오류(잘못된 레이블)가 있을 수 있습니다. 팀은 Cleanlab이라는 도구를 사용하여 품질 검사관 역할을 수행했습니다.

    • 비유: 선생님이 시험을 채점한다고 상상해 보세요. 만약 선생님은 학생의 답이 틀렸다고 생각하는데 정답지가 맞다고 되어 있다면, 선생님은 다시 한번 확인합니다. 만약 선생님이 정답지가 틀렸다고 확신한다면, 나중에 학생들이 혼란을 겪지 않도록 그 특정 문제를 시험에서 제외합니다. 이 단계는 훈련 데이터에서 "노이즈"가 있거나 혼란을 주는 사례들을 제거했습니다.

3. 최종 두뇌 (분류기)

모든 정제와 번역을 마친 후, 그들은 데이터를 **다층 퍼셉트론(Multi-layer Perceptron, MLP)**이라는 단순하지만 효과적인 "두뇌"에 입력했습니다.

  • 비유: 이것은 가볍고 빠르게 달리는 로봇을 생각하면 됩니다. 이 로봇은 생각하기 위해 슈퍼컴퓨터가 필요하지 않습니다. 단지 2단계에서 만든 깨끗하고 고품질인 지도만 있으면 "이것이 혐오 표현인가, 아니면 재탈환된 언어인가?"라는 빠른 결정을 내릴 수 있습니다.

4. 결과: 성과는 어떠했는가?

팀은 영어, 이탈리아어, 스페인어로 된 트윗을 대상으로 시스템을 테스트했습니다.

  • 좋은 소식: 그들의 시스템은 "깨끗한" 혐오 표현(레이블 0)을 찾아내는 데 매우 뛰어났습니다. 이는 명백한 모욕을 잡아내는 완벽한 탐정과 같았습니다.
  • 과제: 그들은 특히 영어에서 "재탈환된" 언어(레이블 1)를 다루는 데 조금 더 어려움을 겪었습니다. 이는 애초에 데이터 내에 재탈환된 언어의 사례가 훨씬 적었기 때문입니다(이를 "클래스 불균형" 문제라고 합니다).
  • 판결: 이러한 불균형에도 불구하고, 그들의 시스템은 전반적으로 좋은 성능을 보였습니다. 그들은 거대하고 비싼 슈퍼컴퓨터 없이도 이 문제를 해결할 수 있다는 것을 보여주었습니다. 잘 정제된 고품질의 데이터와 스마트한 시스템이 있다면 충분히 훌륭한 역할을 할 수 있습니다.

요약

이 논문은 컴퓨터가 친근한 재탈환 언어를 혐오로 잘못 분류하는 것을 막기 위해 다음과 같은 과정이 필요하다고 주장합니다:

  1. 데이터를 주의 깊게 정제할 것.
  2. 스마트한 번역을 사용하여 희귀한 사례를 더 많이 생성할 것.
  3. 데이터의 오류를 이중으로 확인할 것.
  4. 최종 판단을 위해 단순하고 빠른 모델을 사용할 것.

그들은 이러한 "경량화된" 접근 방식이 다양한 언어에서 잘 작동한다는 것을 입증했으며, 엄청난 양의 컴퓨팅 파워 없이도 온라인상의 까다로운 뉘앙스를 다룰 수 있는 실질적인 방법을 제시했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →