← 최신 논문
🤖 AI

Obfuscation Rules for Detecting and Detoxifying Korean Toxicity

본 논문은 언어 기반의 은폐 패턴을 분류하고 표준 텍스트의 성능을 저해하지 않으면서 위장된 표현을 처리하도록 모델을 훈련시켜, 은폐된 유해 콘텐츠를 동시에 탐지하고 정화하도록 설계된 최초의 한국어 데이터셋이자 오픈 변환 프레임워크인 KOTOX 를 소개한다.

원저자: Yejin Lee, Su-Hyeon Kim, Hyundong Jin, Dayoung Kim, Yeonsoo Kim, Yo-Sub Han

게시일 2026-05-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yejin Lee, Su-Hyeon Kim, Hyundong Jin, Dayoung Kim, Yeonsoo Kim, Yo-Sub Han

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"한국어 독성 탐지 및 중화 규칙" 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 풀어냅니다.

문제: 독성의 "비밀 인사"

어떤 놀이터에서 괴롭히는 아이가 아이를 문제 삼게 하려고 mean한 말을 하려 한다고 상상해 보세요. 하지만 놀이터에는 "나쁜 말은 금지"라는 엄격한 규칙이 있습니다. 그래서 괴롭히는 아이는 말을 살짝 바꿔서 선생님에게 걸리지 않으려 합니다. "너는 바보야"라고 말하지 않고 "너는 st00p!d 야"나 "너는 s-t-u-p-i-d 야"라고 말할 수 있습니다.

디지털 세계에서는 이를 난독화 (obfuscation) 라고 합니다. 사람들은 자동 필터가 독성 (유해하거나 모욕적인) 콘텐츠를 감지하지 못하도록 의도적으로 철자를 틀리게 하거나, 기호로 글자를 바꾸거나 (예: a 대신 @), 단어를 재배열합니다.

이 논문은 큰 문제를 지적합니다: 나쁜 언어를 잡도록 설계된 대부분의 컴퓨터 프로그램은 "깨끗한" 텍스트로 훈련됩니다. 이들은 빨간 모자를 쓴 사람만 식별하는 방법을 아는 보안 요원들과 같습니다. 괴롭히는 아이가 빨간 줄무늬가 있는 파란 모자를 쓴다면, 보안 요원은 그들을 놓쳐버립니다. 이는 한국어에서 특히 까다로운데, 언어가 레고 블록처럼 조립식 (교착어) 이기 때문입니다. 의미는 변하지 않으면서 이러한 블록들을 쉽게 바꾸거나 추가하거나 재배열할 수 있어, 컴퓨터가 숨겨진 모욕을 찾아내기가 매우 어렵습니다.

해결책: KOTOX (훈련 체육관)

연세대학교 연구진들은 KOTOX이라는 새로운 도구를 개발했습니다. KOTOX 를 AI 모델들을 위한 전문 훈련 체육관이라고 생각하세요.

KOTOX 는 AI 에게 평범한 문장만 보여주는 것이 아니라, "짝을 지은" 운동을 제공합니다:

  1. 원본: 중립적인 문장과 독성 문장.
  2. 위장: 같은 문장들이지만 특정 방식으로 "난독화" (망가뜨림) 된 버전.

연구진들은 사람들이 나쁜 단어를 어떻게 숨기는지 단순히 추측한 것이 아니라, 인터넷의 실제 사례를 연구하여 한국어의 특성에 기반한 5 가지 구체적인 "위장" 카테고리를 만들었습니다:

  1. 음운론적 (소리 유사): 글자를 소리는 같지만 모양이 다르게 바꾸는 것 (예: 비슷한 소리를 내는 자음으로 교체). 비유: "cat"을 "kat"로 바꾸기.
  2. 상징론적 (모양 유사): 비슷한 모양의 기호로 문자를 바꾸는 것 (예: E 대신 숫자 3 사용, 또는 다른 문자 체계의 문자 사용). 비유: "Hate" 대신 "H@te"라고 쓰기.
  3. 전사 (언어 간 혼합): 소리가 같은 다른 언어 (영어나 한자 등) 의 문자를 섞어 쓰는 것. 비유: 한국어 단어 대신 "공부 (Gongbu)"라고 쓰기.
  4. 통사론적 (구조 왜곡): 띄어쓰기나 음절 순서를 망가뜨리는 것. 비유: "stupid" 대신 "st up id"라고 쓰기.
  5. 화용론적 (이모지 산만하게 하기): 컴퓨터의 주의를 분산시키기 위해 이모지나 이상한 기호를 추가하는 것. 비유: 필터를 혼란스럽게 하기 위해 나쁜 단어 옆에 하트 이모지 를 추가하기.

어떻게 만들었는가

팀은 기존 한국어 문장 데이터셋 (좋은 문장과 나쁜 문장 포함) 으로 시작했습니다. 그들은 엄격한 편집자처럼 행동했습니다:

  • 나쁜 예시 (개인 이름이 포함된 문장이나 혼란스러운 문법 등) 를 제거했습니다.
  • 새로운 "위장 규칙"을 적용하여 수천 개의 새로운 쌍을 만들었습니다.
  • 그 결과, 모든 문장에 "깨끗한" 버전과 "위장된" 버전이 있는 방대한 데이터셋이 탄생했습니다.

결과: AI 훈련

연구진들은 여러 AI 모델에 이 새로운 체육관 (KOTOX) 을 테스트했습니다. 결과는 다음과 같습니다:

  • 훈련 전: AI 모델들은 위장된 독성 텍스트를 찾아내는 데 매우 형편없었습니다. 텍스트가 망가져 있으면 안전하다고 생각했습니다.
  • 훈련 후: KOTOX 로 훈련된 모델들은 두 가지 면에서 훨씬 나아졌습니다:
    1. 난독화 해제: 엉망으로 위장된 텍스트를 보고 원래 의미를 파악하기 위해 변경 사항을 "되돌릴" 수 있었습니다.
    2. 중화: 위장된 독성 텍스트를 받아 예절 바르고 안전한 버전으로 다시 쓸 수 있었습니다.

핵심 발견: 이 특정 "위장" 데이터로 훈련하는 것은 망가진 텍스트 처리에만 도움이 된 것이 아니라, 실제로 모델들이 일반적이고 깨끗한 독성 텍스트를 찾아내는 능력까지 향상시켰습니다. 이는 덤불에 숨은 사람을 찾아내도록 훈련받은 보안 요원이, 숨지 않더라도 의심스러운 행동을 하는 사람을 더 잘 찾아내게 되는 것과 같습니다.

왜 중요한가

이는 한국어 전용으로 만들어진 첫 번째 데이터셋입니다. 이는 독성 콘텐츠를 막기 위해 AI 에게 단순히 "나쁜 단어"를 인식하도록 가르치는 것만으로는 부족하다는 것을 보여줍니다. 우리는 AI 에게 "위장된 나쁜 단어"를 인식하도록 가르쳐야 합니다. 한국어 화자들이 독성을 숨기는 구체적인 방식을 이해함으로써, 단순한 철자 장난에 속지 않는 더 똑똑하고 견고한 필터를 구축할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →