Leveraging LLMs for Context-Aware Implicit Textual and Multimodal Hate Speech Detection
본 논문은 거대 언어 모델을 활용하여 보조적인 배경 맥락을 생성하고 이를 임베딩 결합을 통해 통합하는 것이 텍스트 및 멀티모달 설정 모두에서 암시적 혐오 표현 탐지 성능을 유의미하게 향상시키며, 제로 컨텍스트 베이스라인 및 기존의 엔티티 연결 방식보다 우수한 성능을 보임을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷은 인간 표현의 거대하고 소란스러운 시장이며, 가장 위험한 단어들은 종종 소리 높여 외치지 않는 것들이다. 컴퓨터가 명백한 비속어나 직접적인 위협을 포착하는 것은 비교적 쉬운 일이지만, 다른 종류의 독성은 눈에 띄지 않게 숨어 있다. 이것이 바로 암묵적 혐오 표현(implicit hate speech)이다. 이는 아이러니, 문화적 코드, 또는 공유된 세계관에 의존하여 자신의 논지를 전달하는 적대감이다. 그 자체로는 무해해 보이는 문장도 특정 사건, 역사적 참조, 또는 커뮤니티 내부의 농담이라는 렌즈를 통해 바라볼 때 치명적인 공격이 될 수 있다. 수년간 연구자들은 컴퓨터에게 이러한 숨겨진 의미를 보는 법을 가르치려 노력해 왔으나, 근본적인 문제에 직면했다. 기계는 인간이 당연하게 여기는 배경 지식이 부족하다는 점이다. 기계는 단어를 읽을 수는 있지만, 그 뒤에 숨겨진 이야기는 알지 못한다.
이를 해결하기 위해, 암스테르담 자유 대학교(Vrije Universiteit Amsterdam)의 연구팀은 컴퓨터 모델에게 튜터를 붙여주기로 했다. 그들은 에세이를 쓰거나 대화를 나눌 수 있는 강력한 인공지능 시스템인 거대 언어 모델(LLM)을 활용하여 구체적인 임무를 부여했다. AI가 무엇이 혐오스러운지를 판단하는 판사 역할을 하게 하는 대신, 사실 확인자(fact-checker)이자 역사가로서 역할을 수행하도록 한 것이다. 시스템이 분석하는 모든 소셜 미디어 게시물에 대해, AI는 짧은 배경 맥락 문단을 생성하도록 요청받았다. 만약 게시물이 모호한 정치 집단이나 유행하는 밈(meme)을 언급한다면, AI는 그들이 누구이며 무엇을 지지하는지를 설명함으로써 일반적인 컴퓨터 프로그램이 놓칠 수 있는 세계 지식의 공백을 메워주었다. 연구진은 이 새로운 정보를 탐지 시스템에 입력하는 네 가지 서로 다른 방식을 테스트하며, 단순히 사실을 게시물 옆에 붙여넣는 것만으로 충분한지, 아니면 컴퓨터가 진정한 의도를 이해하기 위해 게시물과 사실을 별도로 처리해야 하는지를 확인했다.
실험 결과는 명확하고 측정 가능했다. 연구진이 암묵적 혐오를 포함한 수천 개의 트윗 데이터셋을 대상으로 이 방법을 테스트했을 때, AI가 생성한 배경 맥락을 사용한 시스템은 원문 텍스트에만 의존하는 모델보다 훨씬 더 우수한 성능을 보였다. 가장 성공적인 접근 방식은 컴퓨터가 원래의 게시물에 대한 디지털 표현과 생성된 배경 이야기의 별도 표현을 각각 만든 다음, 이 두 가지 구별된 정보를 결합하는 특정 기술을 사용하는 것이었다. 이 방법은 맥락이 전혀 없는 시스템에 비해 혐오 콘텐츠를 정확하게 식별하는 능력을 최대 3%포인트 향상시켰다. 이러한 개선은 연구진이 동일한 논리를 다른 유형의 콘텐츠인 인터넷 밈에 적용했을 때 더욱 극적으로 나타났다. 밈은 이미지와 텍스트를 결합하며, 시각적 단서에 의존하는 경우가 많아 인간에게 암호화된 언어가 그러하듯 기계에게도 매우 혼란스러울 수 있다. 여성 혐오적 밈 데이터셋에서 맥락이 강화된 시스템은 정확도를 최대 6%포인트까지 높였다.
그러나 더 나은 탐지로 가는 길에는 함정도 존재했다. 연구진은 단순히 게시물에 더 많은 단어를 추가하는 것이 항상 도움이 되는 것은 아니라는 점을 발견했다. 실제로 그것은 컴퓨터를 혼란스럽게 만들기도 했다. AI가 이미 명백히 혐오스러운 게시물에 대해 길고 상세한 설명을 생성할 때, 추가된 정보가 때때로 원래의 메시지를 희석시켜 시스템이 혐오를 놓치게 만들기도 했다. 반대로, AI가 무해한 게시물에 대해 배경 이야기를 생성할 때, 때때로 존재하지 않는 혐오적 아이디어와의 연결 고리를 만들어내어 시스템이 죄 없는 콘텐츠를 위험한 것으로 잘못 분류하기도 했다. 이는 AI가 도움을 주려는 과정에서 중립적인 문구나 특정 집단에 대한 경고를 혐오에 대한 지지로 과잉 해석했기 때문에 발생했다. 이 연구는 배경 지식을 제공하는 것이 강력한 도구이지만, 매우 주의 깊게 다루어져야 함을 보여주었다. 가장 효과적인 방법은 게시물과 맥락을 하나의 텍스트 블록으로 병합하는 것이 아니라, 분석의 마지막 단계까지 별개로 유지하여 컴퓨터가 원래의 메시지를 새로운 정보에 의해 압도당하지 않으면서도 그 정보를 저울질할 수 있도록 하는 것이었다.
또한 이 연구는 해당 분야의 흔한 가정, 즉 가장 강력한 인공지능가 최종적인 판단을 내려야 한다는 가설에 도전했다. 연구진은 거대 언어 모델이 게시물을 읽고 그것이 혐오스러운지 직접 결정하는 분류기(classifier) 역할을 할 수 있는지 테스트했다. AI는 특히 시각적 밈에 대해 꽤 뛰어난 성능을 보였지만, AI를 배경 사실을 생성하는 용도로만 사용한 특화된 탐지 시스템보다 더 높은 성능을 내지는 못했다. 이는 현재로서는 협력 모델이 최선임을 시사한다. 즉, 거대 언어 모델을 관련 사실을 검색하는 동적인 라이브러리로 사용하고, 그 사실들을 바탕으로 최종 결정을 내리는 데는 더 단순하고 집중된 시스템을 사용하는 것이다. 이러한 모듈형 접근 방식은 시스템이 데이터셋 내의 혐오 표현 패턴을 학습하는 동시에, 암묵적 혐오를 이해하는 데 필요한 방대한 세계 지식에 접근할 수 있게 해준다.
궁극적으로 이 연구는 맥락이 혐오 표현 탐지에 있어 단순히 도움이 되는 부가 요소가 아니라, 필수 요소임을 입증한다. 배경 정보 생성을 분류 행위와 분리된 단계로 취급함으로써, 연구진은 더 정확하고 견고한 시스템을 구축했다. 그들은 숨겨진 혐오를 잡아내는 핵심이 단순히 단어를 읽는 것이 아니라, 그 단어들이 묘사하는 세계를 이해하는 데 있음을 보여주었다. 비록 이 시스템이 완벽하지 않으며 여전히 무해한 아이러니와 진정한 악의 사이의 미세한 경계에서 고군분투하고 있지만, 이 연구 결과는 미래를 향한 명확한 방향을 제시한다. 인공지능이 계속 진화함에 따라, 관련 맥락을 생성하고 통합하는 능력은 온라인 공간을 가장 교활한 형태의 인간 표현으로부터 보호하는 임무를 맡은 모든 시스템의 표준이 될 것이다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.