Decoding Islamophobic Discourse: Using LLMs to Identify Tropes and Semi-Coded Hate Speech
본 논문은 대규모 언어 모델과 주제 모델링을 활용하여 극단주의 플랫폼의 대규모 데이터를 분석함으로써, 대규모 언어 모델이 반이슬람적 은유적 모욕을 효과적으로 식별할 수 있음을 입증하고, 이러한 혐오 표현이 다양한 정치적 운동 전반에 걸쳐 광범위하게 존재하며 종종 다른 형태의 혐오 표현보다 더 높은 유해성 점수를 받는다는 사실을 규명합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷을 거대하고 시끄러운 광장으로 상상해 보세요. 최근 몇 년간 이 광장에 있는 한 무리의 사람들이 무슬림들에게 모욕을 퍼붓기 시작했지만, 그들은 새로운 교활한 수법을 터득했습니다. 노골적인 비하 표현을 외치는 대신 '비밀 암호 단어'를 사용하고 있는 것입니다.
이 논문은 현대의 인공지능 (특히 대규모 언어 모델, LLM) 이 이 암호를 해독하고 증오가 확산되기 전에 막아낼 수 있는지 파악하려는 탐정 팀과 같습니다.
다음은 그들의 수사를 단순한 비유를 통해 설명한 내용입니다:
1. 문제: 증오의 '위장'
과거의 증오 표현은 '내가 너를 싫어해'라고 적힌 밝은 빨간색 셔츠를 입은 사람과 같았습니다. 쉽게 찾아낼 수 있었죠.
이제 증오를 퍼붓는 이들은 위장을 입고 있습니다. 그들은 무해해 보이거나 일반적인 이름처럼 들리는 단어들을 사용하지만, 극단주의 포럼 (4Chan 이나 Gab 등) 의 맥락에서는 끔찍한 의미를 지닙니다.
- 'Mudslime' 수법: 'Muslim(무슬림)'이라는 단어에서 'M'을 'Mud(진흙)'로 바꾸고 'slime(미끄러운 점액)'을 추가하는 것입니다. 이는 역겨우면서도 인간성을 말살하는 소리처럼 들리지만, 문맥 없이 그 단어만 읽어보면 이상하게 지어낸 이름처럼 보입니다.
- 'Abdul' 함정: 'Abdul'은 흔하고 정상적인 무슬림 이름입니다. 하지만 이러한 플랫폼에서 증오를 퍼붓는 이들은 마치 특정 집단을 조롱하기 위해 일반적인 이름을 사용하는 것처럼, 'Abdul'을 일반적인 모욕으로 사용합니다.
- 'Muzrat' 혼동: 이는 데이트 앱인 'Muzz'와 'Rat(쥐)'를 섞은 말장난입니다. 무슬림들을 해충처럼 보이게 하도록 고안되었지만, 자동 필터를 피하려는 방식으로 작성되었습니다.
연구자들은 이러한 용어들을 '어휘 외 (Out-of-Vocabulary, OOV)' 또는 '반암호화 (semi-coded)' 용어라고 부릅니다. 이는 양의 옷을 입은 늑대의 디지털 버전과 같습니다.
2. 수사: 인공지능이 위장을 꿰뚫어 볼 수 있는가?
연구자들은 매우 똑똑한 인공지능 (GPT-4) 에게 이러한 게시물을 읽게 하고 "이것이 증오 표현인가?"라고 판단하도록 요청했습니다.
- 좋은 소식: 인공지능은 '양의 옷을 입은 늑대'를 찾아내는 데 놀라울 정도로 능숙합니다. 연구자들이mudslime, pislam, muzrat와 같은 단어가 포함된 게시물을 인공지능에게 입력했을 때, 인공지능은 대부분의 경우 이를 증오 표현으로 정확히 식별했습니다. 단어들이 기묘하거나 중립적으로 보일지라도, 그 의도가 악의적임을 이해한 것입니다.
- 나쁜 소식: 인공지능은 때때로 맥락에 혼란을 겪습니다. 만약 게시물이 다른 증오적인 단어 없이 'Abdul'이라는 이름만 사용한다면, 인공지능은 "아, 그냥 이름이군"이라고 생각하며 증오를 놓칠 수 있습니다. 확신을 갖기 위해서는 더 많은 단서가 필요합니다.
3. 독성 테스트: 증오는 얼마나 '유독한가'?
연구자들은 무슬림에 대한 증오 표현과 유대인에 대한 증오 표현 (반유대주의) 을 비교했습니다. 그들은 '독성계'처럼 작동하는 Google Perspective API라는 도구를 사용했습니다.
- 결과: 계기는 무슬림에 대한 증오 표현이 유대인에 대한 증오 표현보다 훨씬 더 유독하다 (더 무례하고, 공격적이며, 모욕적이다) 고 나타냈습니다.
- 비유: 반유대주의가 날카로운 칼이라면, 이 연구에서 나타난 무슬림에 대한 증오 표현은 중공망치와 같았습니다. 더 무겁고, 시끄럽고, 언어적으로 더 폭력적이었습니다.
4. '고정관념 (Trope)' 퍼즐: 인공지능이 이야기를 이해할 수 있는가?
증오 표현은 종종 오래되고 재활용된 이야기나 '고정관념 (stereotypes)'에 의존합니다. 연구자들은 인공지능에게 증오 표현을 다섯 가지 특정 범주로 분류하도록 요청했습니다:
- 인종차별: 피부색이나 민족을 근거로 사람을 공격하는 것.
- 이민: 무슬림들이 국가를 '훔쳐가고 있다'고 주장하는 것.
- 종교: 이슬람교를 신념 체계로 공격하는 것.
- 예언자: 무함마드 예언자를 모욕하는 것.
- 억압: 무슬림 여성들이 억압받거나 나쁘게 대우받고 있다고 주장하는 것.
- 결과: 인공지능은 예언자에 대한 모욕 (단어들이 매우 구체적이고 명확하기 때문) 과 종교에 대한 공격을 찾아내는 데 능수능란했습니다.
- 어려움: 인공지능은 인종차별, 이민, 억압을 구별하는 데 어려움을 겪었습니다. 종종 이들을 혼동했습니다. 이는 살인 무기를 쉽게 찾아낼 수 있지만, 범죄가 왜 일어났는지 또는 어떤 특정 동기가 사용되었는지 파악하는 데 어려움을 겪는 탐정과 같습니다.
5. 결론: 진행 중인 작업
이 논문은 인공지능이 이러한 '비밀 암호 단어'를 인식하는 데는 점점 나아지고 있지만, 아직 완벽하지는 않다고 결론 내립니다.
- 잘 작동하는 것: 인공지능은mudslime이 나쁜 단어임을 알아챕니다.
- 잘 작동하지 않는 것: 증오가 미묘하거나, 어떤 특정 고정관념이 사용되고 있는지 파악하려 할 때 인공지능은 더 깊은 의미를 놓치는 경우가 있습니다.
핵심 결론:
연구자들은 소셜 미디어 플랫폼들에게 다음과 같이 말합니다. "더 이상 노골적인 나쁜 단어만 찾아서는 안 됩니다. 이러한 새롭고 기이하며 암호화된 단어들을 이해하도록 인공지능을 가르쳐야 합니다. 그렇지 않으면 증오 표현은 계속 틈새를 통해 빠져나갈 것입니다." 또한, 이러한 증오가 매우 유독하기 때문에 온라인 광장을 안전하게 유지하기 위해 긴급한 주의가 필요하다고 제안합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.