← 최신 논문
💬 NLP

'Ghaib in Translation' aka Unseen Harm: Measuring Cross-Script Safety Inconsistency with 'Missed-in-Urdu' Scores in LLM Hate Speech Detection

이 논문은 대규모 언어 모델이 다양한 스크립트를 통한 우르두어 혐오 표현을 탐지할 때 상당한 안전성 불일치와 '우르두어 누락(Missed-in-Urdu)' 비율을 보인다는 점을 밝히며, 이는 지난 9년간의 주요 AI 안전 연구 회의록에서 우르두어가 완전히 부재함으로 인해 발생한 콘텐츠 중재 신뢰성의 결정적인 격차를 강조한다.

원저자: Fawzia Zehra (Fuzzy), Kara-Isitt, Sonal Khosla, Stephen Swift

게시일 2026-08-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Fawzia Zehra (Fuzzy), Kara-Isitt, Sonal Khosla, Stephen Swift

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷은 수십억 명의 사람들이 매초 자신의 생각, 농담, 불만을 공유하는 거대하고 소란스러운 시장입니다. 이 공간을 안전하게 유지하기 위해 기술 기업들은 디지털 문지기 역할을 하는 자동화된 시스템에 의존하며, 이 시스템은 실질적인 해를 끼치기 전에 혐오 표현과 위협을 식별하기 위해 게시물을 스캔합니다. 이러한 시스템은 방대한 양의 텍스트를 학습하여, 자신들이 가장 잘 아는 언어들 속에서 학대의 패턴을 인식하는 법을 배웁니다. 그러나 세상에는 수많은 언어가 존재하며, 이러한 디지털 문지기들이 이 언어들을 이해하는 능력은 평등하지 않습니다. 영어와 같은 일부 언어는 시스템이 학습하는 데이터에 잘 나타나 있는 반면, 다른 언어들은 종종 간과됩니다. 시스템이 특정 언어에서의 혐오 표현을 인식하지 못할 때, 이는 동일한 시스템이 다른 언어로 쓰였을 때는 그 해악을 성공적으로 차단함에도 불구하고, 해악이 검열되지 않은 채 퍼져나갈 수 있는 사각지대를 만듭니다. 이러한 격차는 단순한 기술적 결함이 아니라, 수백만 명의 언어 사용자를 취약하게 만드는 안전상의 실패입니다.

영국 브러넬 대학교와 독일 하소 플라트너 연구소의 연구진이 수행한 최근 연구는 이러한 사각지대 중 가장 중요한 것 중 하나인 우르두어(Urdu)를 조명합니다. 우르두어는 파키스탄, 인도, 그리고 영국과 미국 내의 대규모 커뮤니티에서 2억 4,600만 명의 화자가 사용하는 세계 10위의 언어입니다. 이 정도 규모와 온라인상에서 기록된 우르두어 커뮤니티의 높은 학대 발생량에도 불구하고, 연구진은 온라인 안전 연구 분야가 우르두어를 거의 완전히 무시해 왔다는 사실을 발견했습니다. 온라인 학대에 관한 9년간의 주요 학술 대회를 종합적으로 검토한 결과, 연구팀은 우르두어를 다룬 논문이 단 한 편도 없다는 것을 발견했습니다. 2022년의 한 주요 워크숍에서 해당 언어에 대한 더 많은 연구를 명시적으로 요청했음에도 불구하고, 이러한 부재는 매우 놀라운 일입니다. 연구진은 이러한 관심의 부족이 현재 사용 중인 안전 도구에 측정 가능한 결과를 초래하는지 확인하고자 했습니다.

이를 테스트하기 위해 연구팀은 오늘날 이용 가능한 가장 진보된 5개의 인공지능 모델을 조사했습니다. 그들은 이 모델들에 혐오 표현, 위협, 그리고 일반적인 대화가 포함된 대규모 텍스트 모음을 입력하되, 이를 다양한 방식으로 제시했습니다. 어떤 텍스트는 오른쪽에서 왼쪽으로 흐르는 나스탈리크(Nastaliq)라고 알려진 원래의 우르두어 스크립트로 작성되었습니다. 다른 텍스트는 소셜 미디어에서 흔히 쓰이는 방식인, 영어 알파벳을 사용하여 우르두어 단어를 표기하는 로만 우르두어(Roman Urdu)로 작성되었습니다. 또한 연구진은 동일한 메시지의 영어 번역본을 함께 제공했습니다. 서로 다른 형식의 메시지에 대해 모델이 어떻게 반응하는지 비교함으로써, 연구진은 안전 시스템이 실제로 내용을 이해하고 있는지, 아니면 단순히 글자의 형태에만 반응하고 있는지를 확인할 수 있었습니다.

결과는 우려스러운 불일치를 드러냈습니다. 모델들이 유해한 콘텐츠를 영어로 읽었을 때는 그것이 유해하다고 올바르게 식별했습니다. 그러나 정확히 동일한 메시지가 원래의 우르두어 스크립트로 제시되었을 때, 모델들은 종-종 그것을 위험한 것으로 분류하는 데 실패했습니다. 테스트된 다양한 모델 전체에 걸쳐 평균적으로, 약 18%의 유해한 메시지들이 스크립트에 따라 다르게 라벨링되었습니다. 더 쉽게 말하자면, 누군가 우르두어로 위협을 게시하면 시스템은 이를 일반적인 게시물로 통과시킬 수 있지만, 동일한 위협이 영어로 번역된다면 시스템은 즉시 이를 차단할 것이라는 의미입니다. 스크립트 때문에 유해한 콘텐츠가 빠져나가는 이 "우르두어 누락(missed-in-Urdu)" 비율은 사용된 특정 모델에 따라 약 2%에서 거의 10%까지 나타났습니다.

또한 연구는 모든 인공지능 모델이 이 문제에 똑같이 취약한 것은 아니라는 점을 강조했습니다. 흔히 프런티어 모델(frontier models)이라 불리는 가장 진보된 대규모 모델들은 더 높은 일관성을 보이며 오류가 적었습니다. 그러나 더 작은 오픈 소스 모델들은 훨씬 높은 실패율을 보였으며, 우르두어로 된 유해한 콘텐츠의 거의 3분의 1을 놓쳤습니다. 이는 이러한 시스템의 안전 기능이 균일하지 않으며, 일부 언어 사용자에게는 강력한 보호를 제공하는 반면 다른 이들은 노출된 상태로 남겨두는 등 불균등하게 분포되어 있음을 시사합니다. 연구진은 또한 가용 데이터의 구조적 격차를 지적했습니다. 즉, 사람들이 온라인에서 소통하는 방식인 우르두어와 영어가 혼합된 혐오 표현 전용 데이터셋이 존재하지 않는다는 것입니다. 이러한 특정한 유형의 데이터 없이는, 현대 소셜 미디어의 복잡하고 혼합된 언어 현실을 시스템이 얼마나 잘 처리하는지 완전히 테스트하는 것이 불가능합니다.

궁극적으로 이 연구는 현재의 안전 도구가 불균형한 방패를 제공하고 있음을 보여줍니다. 영어의 혐오 표현은 안정적으로 탐지하지만 우르두어의 동일한 발언을 인식하지 못하는 시스템은, 해당 언어를 사용하는 수백만 명의 사람들에게 진정으로 안전한 시스템이 아닙니다. 이번 연구 결과는 우르두어가 안전 연구에서 누락된 것이 단순한 학술적 간과가 아니라, 콘텐츠 중재에 있어 실제적이고 측정 가능한 결과를 초래한다는 점을 확인시켜 줍니다. 더 나은 데이터와 다양한 스크립트에 걸친 더 엄격한 테스트를 통해 이러한 격차를 메우지 않는 한, 세계 인구의 상당 부분은 자신들을 보호하기 위해 설계된 바로 그 시스템이 볼 수 없는 해악에 계속해서 취약한 상태로 남게 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →