Vicarious Offense and Noise Audit of Offensive Speech Classifiers: Unifying Human and Machine Disagreement on What is Offensive
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대한 혼란 속에 빠진 스포츠 경기에서 심판을 맡고 있다고 상상해 보십시오. 관중들은 선수들에게 끊임없이 야유를 퍼붓고 있습니다. 당신의 임무는 어떤 발언이 "공격적"인지 판단하여 이를 차단하는 것입니다.
이 논문은 두 종류의 심판, 즉 로봇(컴퓨터 알고리즘)과 인간(서로 다른 정치적 견해를 가진 실제 사람들)에 대한 성적표와 같습니다. 연구자들은 특히 미국의 정치와 관련된 주제에 대해, 무엇이 모욕인지에 대해 이 심판들이 서로 의견이 일치하는지 알고 싶어 했습니다.
연구 결과는 다음과 같습니다. 이해를 돕기 위해 쉬운 비유를 사용했습니다.
1. 로봇 심판들은 규칙에 합의하지 못한다
연구진은 9개의 서로 다른 컴퓨터 프로그램("기계 중재자")을 사용하여 유튜브 뉴스 채널의 댓글 300만 개 이상을 테스트했습니다.
- 비유: 9명의 서로 다른 심판이 같은 플레이를 보고 있다고 상상해 보십시오. 한 명은 반칙이라며 휘슬을 불고, 다른 한 명은 반칙이 아니라고 말하며, 세 번째 심판은 "반칙이긴 한데, 파란색 신발을 신고 있을 때만 해당한다"라고 말합니다.
- 결과: 로봇들은 극도로 불일치했습니다. 어떤 댓글은 단 하나의 로봇에 의해서만 공격적인 것으로 분류되어 차단되었고, 나머지 8개의 로봇은 무시했습니다. 실제로 거의 절반의 댓글은 모든 로봇에 의해 무시된 반면, 아주 적은 수의 댓글만이 모든 로봇에 의해 공통적으로 차단되었습니다. 이는 '로봇의 진리'라는 단일한 기준이 존재하지 않음을 의미합니다.
2. 인간 심판들은 서로 다른 플레이북을 가지고 있다
연구진은 그다음 실제 인간(민주당원, 공화당원, 무당파)에게 동일한 댓글을 평가하도록 요청했습니다. 그들에게는 두 가지 질문이 주어졌습니다.
- 개인적 불쾌감: "이 댓글이 당신의 기분을 상하게 합니까?"
- 대리적 불쾌감: "이 댓글이 상대 진영 사람들의 기분을 상하게 할 것이라고 생각합니까?"
- 비유: A팀의 팬에게 "이 모욕이 당신을 아프게 합니까?"라고 묻고, 이어서 "B팀의 팬도 이 말에 상처받을 것이라고 생각합니까?"라고 묻는 것과 같습니다.
- 결과:
- 인간은 로봇보다 서로 더 잘 합의합니다: 민주당원, 공화당원, 무당파는 로봇보다 서로를 더 잘 이해했습니다.
- "공감의 격차": 하지만 인간은 다른 정치적 입장을 가진 사람이 무엇을 불쾌하게 느낄지 예측하는 데 매우 서툴렀습니다.
- 공화당원의 사각지대: 연구에 따르면 공화당원들은 민주당원이나 무당파가 무엇을 불쾌하게 여길지 예측하는 데 가장 서툴렀습니다. 반대로, 민주당원과 무당파 역시 공화당원이 무엇을 불쾌하게 느낄지 이해하는 데 어려움을 겪었습니다. 이는 마치 두 집단이 서로를 향해 소리를 지르고 있는데, 서로가 틀렸다고 확신하면서도 실제로는 완전히 다른 주파수로 소리를 지르고 있는 상황과 같습니다.
3. "대리적 불쾌감" 실험
이 논문은 **대리적 불쾌감(Vicarious Offense)**이라는 새로운 개념을 소개합니다.
- 개념: 보통 우리는 우리가 불쾌할 때만 신경을 씁니다. 하지만 이 연구는 "타인의 입장이 되어 그들이 불쾌해할지 예측할 수 있는가?"를 물었습니다.
- 결과: 연구진은 사람들이 이 부분에서 놀라울 정도로 능력이 부족하다는 것을 발견했습니다. 민주당원과 무당파가 공화당원을 화나게 할 것이라고 생각한 내용에 대해서는 의견이 일치했을지라도, 실제로 공화당원을 화나게 한 것이 무엇인지에 대해서는 자주 틀렸습니다. 그들은 모두 같은 댓글을 보고 있었지만, 서로 다른 것을 보고 있었습니다.
4. "민감한 주제"의 함정
연구진은 낙태나 총기 규제와 같은 뜨거운 쟁점들을 살펴보았습니다.
- 비유: 만약 경기가 일반적인 스포츠라면 심판들이 규칙에 합의할 수 있을 것입니다. 하지만 경기가 종교적이거나 매우 개인적인 주제에 관한 것이라면, 누가 휘슬을 잡고 있느냐에 따라 규칙이 바뀌는 것처럼 보입니다.
- 결과: 이러한 주제에서는 불일치가 더욱 심해졌습니다.
- 총기 문제에 대해서는 공화당원이 민주당원보다 공격적인 댓글에 대해 낮은 관용도를 보였습니다.
- 낙태 문제에 대해서는 민주당원이 공화당원보다 낮은 관용도를 보였습니다.
- 무당파는 일반적으로 가장 높은 관용도를 보였으며, 양 극단의 두 집단보다 더 많은 댓글을 그냥 넘어가 주었습니다.
5. "빅테크"의 딜레마
이 논문은 소셜 미디어 기업들이 직면한 혼란스러운 현실을 강조합니다.
- 로봇: 일관성이 없습니다. 어떤 날은 댓글을 삭제하지만, 다음 날 다른 로봇은 그 댓글을 그대로 둡니다.
- 인간: 정치적 편향을 가집니다. 민주당원은 공화당원이 괜찮다고 생각하는 댓글을 삭제할 수 있고, 그 반대의 경우도 마찬가지입니다.
- 결론: 무엇이 공격적인지에 대한 완벽한 "골드 스탠다드(표준)"는 존재하지 않습니다. 누구에게 묻느냐(로봇, 민주당원, 혹은 공화당원)에 따라 답이 완전히 달라집니다.
요약
이 논문은 불쾌함이란 보는 이의 눈에 달려 있다는 사실 때문에 온라인 발언을 규제하는 것이 매우 어렵다는 결론을 내립니다.
- 로봇은 일관성이 없으며 미묘한 차이를 놓치는 경우가 많습니다.
- 인간은 정치적 팀에 따른 편향을 가지고 있으며, "상대 팀"이 무엇을 아프게 느끼는지 예측하는 데 서툽니다.
- 결과: 우리는 무엇이 "공격적"인지에 대해 쉽게 합의할 수 없는 상황에 처해 있으며, 이는 온라인 정치 논쟁을 공정하게 중재하는 시스템을 구축하는 것을 매우 어렵게 만듭니다.
저자들은 최첨단 AI(ChatGPT)를 사용하여 상대방이 무엇을 불쾌하게 여길지 예측할 수 있는지 테스트했지만, AI 역시 인간과 마찬가지로 어려움을 겪었습니다. 이는 인간의 뇌와 컴퓨터 모두에게 매우 어려운 문제임을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.