← 최신 논문
💬 NLP

The Enforcement and Feasibility of Hate Speech Moderation on Twitter

이 논문은 트위터 (X) 의 혐오 발언 80% 가 5 개월 후에도 삭제되지 않는 것은 기술적 한계가 아니라 플랫폼의 자원 배분과 제도적 선택에 기인하며, 인간과 AI 가 협력하는 방식의 중재 시스템 도입이 경제적으로도 실현 가능함을 보여줍니다.

원저자: Manuel Tonneau, Dylan Thurgood, Diyi Liu, Niyati Malhotra, Victor Orozco-Olvera, Ralph Schroeder, Scott A. Hale, Manoel Horta Ribeiro, Paul Röttger, Samuel P. Fraiberger

게시일 2026-04-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Manuel Tonneau, Dylan Thurgood, Diyi Liu, Niyati Malhotra, Victor Orozco-Olvera, Ralph Schroeder, Scott A. Hale, Manoel Horta Ribeiro, Paul Röttger, Samuel P. Fraiberger

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 트위터 (현 X) 가 어떻게 '혐오 발언'을 처리하는지, 그리고 그 과정이 얼마나 효과적이고 실현 가능한지에 대한 거대한 조사를 담고 있습니다. 복잡한 통계와 기술 용어 대신, 거대한 도서관경비원의 비유를 들어 쉽게 설명해 드리겠습니다.

1. 연구의 배경: 거대한 도서관의 문제

전 세계 사람들이 매일 수억 개의 글을 트위터라는 거대한 도서관에 남깁니다. 그런데 이 도서관에는 때때로 다른 사람을 해치거나 모욕하는 '혐오 발언'이라는 독이 섞인 책들이 들어옵니다.

연구진들은 이 도서관이 실제로 독이 섞인 책을 얼마나 잘 찾아내서 치우는지, 그리고 치우는 것이 기술적으로나 경제적으로 가능한 일인지 확인하기 위해 **2022 년 9 월 하루 동안 전 세계에 올라온 모든 글 (약 3 억 7 천만 개)**을 스냅샷으로 찍어 분석했습니다. 마치 도서관 전체를 한 번에 훑어보는 것과 같습니다.

2. 첫 번째 발견: "치우지 않는 경비원들" (실제 집행 현황)

연구진들은 5 개월 후 다시 그 도서관을 방문하여, 혐오 발언으로 분류된 책들이 여전히 거치대에 놓여 있는지 확인했습니다. 결과는 놀라웠습니다.

  • 치워진 책은 20% 뿐: 혐오 발언으로 표시된 글 중 약 80% 는 여전히 그대로 남아있었습니다.
  • 위험한 글도 그대로: "누군가를 죽여라" 같은 매우 위험하고 폭력적인 글조차도, 평범한 말실수나 광고성 사기 글보다 더 자주 치워지지 않았습니다.
  • 인기 있는 글일수록 덜 치워짐: 재미있거나 많은 사람이 보는 (높은 참여도를 가진) 혐오 발언일수록 오히려 치워질 확률이 낮았습니다. 마치 인기 있는 악동은 도서관장이 눈감아 주는 것과 같습니다.
  • 지역별 편차: 영어권이나 미국에서는 어느 정도 치워졌지만, 아랍어권이나 나이지리아 등 다른 지역에서는 혐오 발언을 게시한 사람이 제재 (계정 정지) 를 받을 확률이 훨씬 낮았습니다.

결론: 트위터는 "우리는 혐오 발언을 막겠다"고 말하지만, 실제로는 가장 위험한 글이나 가장 많이 보는 글부터 치우지 않고, 다른 문제 (사기, 성인물 등) 를 더 열심히 처리하고 있었습니다.

3. 두 번째 발견: "자동 검색 로봇의 한계" (기술적 문제)

그렇다면 "아마도 로봇 (AI) 이 못 찾아서 그런가?"라고 생각할 수 있습니다. 연구진들은 최신 AI 모델들을 테스트해 보았습니다.

  • 로봇은 '분노'와 '혐오'를 구분 못 함: AI 는 욕설을 하거나 화난 말 (공격적이지는 않지만 거친 말) 을 '혐오 발언'으로 잘못 판단하는 경우가 매우 많았습니다. 마치 "화난 친구"와 "악한 범죄자"를 구별하지 못하고 모두 잡아가려다, 정직한 친구까지 잡아가는 꼴이었습니다.
  • 하지만 '순위'는 잘 매김: AI 가 정확한 '판단'은 못 해도, "이 글이 혐오 발언일 확률이 높은 순서대로" 나열하는 능력은 매우 뛰어났습니다. 즉, 로봇이 "이 책들을 먼저 확인해 보세요"라고 손가락질만 잘 하는 셈입니다.

4. 세 번째 발견: "인간과 로봇의 팀워크" (해결책과 비용)

이제 "그럼 인간 경비원들이 로봇이 손가락질한 책들을 하나하나 확인하면 되지 않나?"라는 질문이 나옵니다. 연구진들은 이를 시뮬레이션해 보았습니다.

  • 현재 인력은 부족함: 트위터가 현재 고용한 경비원 수로는 모든 혐오 발언을 다 치울 수 없습니다.
  • 하지만 '인기 있는' 것부터 치우면 가능함: 모든 책을 다 치우는 것은 불가능하지만, 사람들이 많이 보는 (참여도가 높은) 혐오 발언부터 로봇이 선별하고 인간이 처리한다면, 사용자가 혐오 발언을 보게 될 확률을 80% 이상 줄일 수 있습니다.
  • 비용은 벌금보다 싸다: 이렇게 시스템을 개선하는 데 드는 비용은 트위터의 연간 수익의 약 2.9% 정도입니다. 반면, 유럽이나 영국 정부가 "해로운 콘텐츠를 막지 않으면" 부과하는 벌금은 수익의 **6~10%**입니다.
    • 비유: "불법 담배를 팔다가 걸리면 10 억 원 벌금을 물지만, 담배 가게를 정리하는 데 드는 비용은 3 억 원이다"라고 생각하면, 정리하는 것이 훨씬 이득이라는 뜻입니다.

5. 최종 결론: 기술의 한계가 아니라 '선택'의 문제

이 연구의 핵심 메시지는 다음과 같습니다.

"온라인 혐오 발언이 사라지지 않는 이유는 기술이 부족해서가 아닙니다. 기술적으로 충분히 가능하고, 돈도 벌금보다 적게 듭니다. 문제는 플랫폼이 **인간 경비원과 로봇을 어떻게 배치할지, 그리고 어떤 글을 우선적으로 치울지 결정하는 '선택'**을 제대로 하지 않았다는 점입니다."

즉, 트위터는 혐오 발언을 막을 기술적 능력과 재정적 여유는 가지고 있었지만, 그것을 충분히 활용하지 않았던 것입니다. 이는 플랫폼이 이익을 우선시하거나, 표현의 자유를 핑계로 검열을 꺼리는 등 제도적인 선택의 결과임을 보여줍니다.

한 줄 요약:

"트위터는 독이 섞인 책을 치울 '로봇'과 '사람'을 충분히 쓸 수 있었지만, 가장 위험한 책부터 치우기보다 다른 일을 더 열심히 해서, 독이 섞인 책이 도서관에 그대로 남아있게 만들었습니다. 하지만 이걸 고치는 비용은 법이 부과하는 벌금보다 훨씬 쌉니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →