Detection and Safeguarding of Chinese Toxic Content from Users and LLMs: A Survey
본 논문은 중국 소셜 미디어상의 사용자 생성 유해 콘텐츠 탐지와 중국어 거대 언어 모델(LLM)의 LLM 생성 유해성 방어에 관한 연구를 체계적으로 검토하는 포괄적인 서베이를 제시하며, 이는 파편화된 진전 사항을 통합하고 향후 발전을 위한 핵심 과제를 식별하는 것을 목표로 한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷은 수십억 명의 사람들이 매일 생각, 농담, 이야기를 공유하는 거대하고 북적이는 공공 광장입니다. 하지만 어떤 붐비는 장소와 마찬가지로, 인터넷에도 어두운 면이 있습니다: 바로 독성 콘텐츠(toxic content)입니다. 여기에는 개인에게 상처를 주고 온라인 커뮤니티의 분위기를 해칠 수 있는 모욕, 혐오 표현, 괴롭힘, 그리고 미묘한 조롱 등이 포함됩니다. 수년간 연구자들은 이러한 유해한 언어를 포착하기 위한 도구들을 구축해 왔으며, 주로 규칙이 잘 정립되어 있는 영어를 중심으로 연구를 진행해 왔습니다. 그러나 중국어권은 독특한 과제를 안겨줍니다. 중국 온라인 문화에서 사람들은 흔열히 슬랭(속어), 동음이의어(소리는 같지만 글자는 다른 단어), 그리고 내부자들만 이해할 수 있는 문화적 참조를 통해 자신의 진의를 베일 뒤에 숨기곤 합니다. 어떤 문구는 컴퓨터에게는 무해해 보일 수 있지만, 인간 독자에게는 지독한 타격을 줄 수 있습니다. 나아가, 대규모 언어 모델(LLM)의 등장과 함께 새로운 차원의 복잡성이 나타났습니다. 이 강력한 인공지능 시스템들은 인간의 대화를 흉내 내는 텍스트를 생성할 수 있지만, 유해한 콘텐츠를 생성하도록 속임을 당하거나 악의적인 사용자들에 의해 대규모로 생성되는 데 이용될 수도 있습니다.
여러 중국 대학의 연구진은 현재 이 분야가 이러한 구체적인 과제들을 어떻게 다루고 있는지에 대해 종합적인 검토를 수행했습니다. 그들은 기존의 모든 연구, 데이터셋, 그리고 중국어의 독성 콘텐츠를 탐지하고 저지하는 것과 관련된 방법론을 심층적으로 조사하는 체계적 검토(systematic review)를 실시했습니다. 그들의 연구는 두 가지 주요 전선을 다룹니다: 첫째, 소셜 미디어에서 인간 사용자가 생성한 유해한 콘텐츠를 식별하는 방법이며, 둘째, 대규모 언어 모델이 유해한 콘텐츠를 생성하거나 그러한 콘텐츠를 생성하도록 조작되는 것을 방지하는 방법입니다. 연구진은 진전이 이루어지고 있음에도 불구하고, 이 분야가 여전히 파편화되어 있다는 점을 발견했습니다. 중국어에서 무엇을 독성이라고 정의할지에 대한 단일하고 통일된 기준이 없으며, 현재 사용 가능한 도구들은 온라인 슬랭의 역동적이고 진화하는 특성과 사람들이 적대감을 표현하는 미묘하고 암시적인 방식에 대응하는 데 종종 어려움을 겪습니다.
연구진은 먼저 데이터의 지형을 그려내는 것으로 시작했습니다. 컴퓨터에게 독성을 인식하도록 가르치기 위해서는 방대한 예시의 집합이 필요합니다. 그들은 연구자들이 웨이보(Weibo)나 지후(Zhihu)와 같은 주요 중국 플랫폼에서 데이터를 수집하여, 직접적인 모욕부터 더 복잡한 형태의 혐오 표현 및 비꼼(sarcasm)에 이르는 모든 것을 아우르는 데이터셋을 구축했음을 확인했습니다. 그러나 그들은 중요한 문제를 지적했습니다: 어떤 것을 독성으로 라벨링할지에 대한 기준이 종종 일관되지 않다는 점입니다. 어떤 연구에서는 특정 댓글을 무해한 농담으로 분류하는 반면, 다른 연구에서는 문화적 맥락이나 특정 대상 집단에 따라 동일한 댓글을 혐오적인 것으로 표시하기도 합니다. 이러한 합의의 부재는 서로 다른 도구들을 비교하거나 다양한 상황에서 신뢰할 수 있는 시스템을 구축하는 것을 어렵게 만듭니다. 또한 이번 검토는 텍스트를 위한 데이터셋은 많지만, 독성이 텍스트와 시각 자료의 결합 속에 숨어 있는 경우가 많기 때문에 이미지, 영상, 밈(meme)을 포함하는 자원에 대한 필요성이 커지고 있음을 강조했습니다.
기술적인 측면에서, 연구팀은 연구자들이 이러한 탐지 문제들을 해결하기 위해 어떤 노력을 기울이고 있는지 조사했습니다. 초기 방법들은 단순한 키워드 매칭에 의존했으나, 이는 사용자들이 동음이의어로 글자를 바꾸거나 필터를 우회하기 위해 인터넷 슬랭을 사용할 때 실패하게 됩니다. 이를 대응하기 위해, 최신 접근 방식들은 메시지의 더 깊은 의미와 문화적 맥락을 이해하려고 시도합니다. 일부 방법은 '지식 강화(knowledge enhancement)'를 사용하여 컴퓨터에 문화적 참조나 지역 슬랭에 대한 추가 정보를 입력함으로써 숨겨진 의도를 이해하도록 돕습니다. 다른 방식들은 '멀티모달(multimodal)' 기술을 사용하여, 시스템이 텍스트와 함께 제공된 이미지나 영상을 모두 살펴봄으로써 모욕의 전체 그림을 포착할 수 있게 합니다. 연구진은 또한 이러한 시스템들이 어떻게 학습되는지를 검토하며, 비꼼을 탐지하는 학습을 혐오 표현 탐지와 동시에 수행하는 것과 같은 '태스크 결합'이 모델을 더욱 견고하게 만드는 데 도움이 될 수 있다는 점에 주목했습니다. 그러나 그들은 이러한 많은 고급 방법들이 여전히 완전히 새로운 유형의 공격이나 급격하게 변하는 슬랭에 직면했을 때 어려움을 겪는다는 것을 발견했습니다.
검토의 두 번째 부분은 새로운 개척지인 대규모 언어 모델의 보호에 초점을 맞췄습니다. 이러한 AI 시스템들은 유용하도록 설계되었지만, 교묘하게 작성된 프롬프트에 의해 안전 규칙을 무시하고 독성 콘텐츠를 생성하도록 유도되는 '탈옥(jailbroken)'을 당할 수 있습니다. 연구진은 단순한 질문부터 AI의 방어력을 약화시키기 위해 설계된 복잡한 다회차 대화에 이르기까지, 사람들이 이러한 모델들을 테스트하는 다양한 방식들을 조사했습니다. 그들은 일부 모델들이 유해한 요청을 거부하는 능력이 향려졌음에도 불구하고 완벽하지 않다는 것을 발견했습니다. 주요 이슈 중 하나는 '과잉 민감성(over-sensitivity)'으로, AI가 특정 역사적 인물이나 문화적 주제에 대한 논의를 거부하는 것처럼 무해한 질문을 위험한 것으로 오인하여 답변을 거부하는 현상입니다. 또한 이번 검토는 이러한 모델들을 안전하게 훈련시키는 방법들이 종종 '블랙박스'와 같다는 점을 지적했습니다. 즉, 우리는 그것들이 어느 정도 작동한다는 것은 알지만, 왜 특정 사례에서 실패하는지, 혹은 다른 기능을 망가뜨리지 않고 어떻게 수정할 수 있는지에 대해서는 완전히 이해하지 못하고 있습니다.
저자들은 이 분야가 진전을 이루었지만, 여전히 상당한 장애물이 남아 있다고 결론지었습니다. 가장 시급한 과제는 중국 인터넷 문화의 역동적인 특성입니다. 탐지 도구가 특정 유형의 모욕을 포착하는 법을 배우자마자, 사용자들은 그것을 말하는 새로운 방식을 발명해 냅니다. 연구진은 향후 연구가 무엇을 독성으로 간주할지에 대한 더 일관된 표준을 만들고, 새로운 슬랭에 빠르게 학습하고 적응할 수 있는 시스템을 개발하며, 이러한 도구들이 특정 집단이나 방언을 부당하게 검열하지 않도록 공정성을 개선하는 데 집중해야 한다고 제안합니다. 또한 그들은 텍스트, 이미지, 영상 사이의 복잡한 상호작용을 이해하기 위한 더 나은 도구의 필요성을 강조합니다. 궁극적인 목표는 자유로운 표현을 억압하지 않으면서도 온라인 공간을 보호할 수 있는 시스템을 구축하는 것이며, 이는 기술과 그 기술이 봉사하는 인간 문화 모두에 대한 깊은 이해를 필요로 하는 균형 잡힌 작업입니다. 이 검토는 현재의 도구들이 어디에서 부족한지를 보여주고, 미래를 위한 더 탄력적이고 문화적으로 인지 능력이 높은 해결책을 향한 길을 제시하는 이정표 역할을 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.