GemDetox at TextDetox CLEF 2025: Enhancing a Massively Multilingual Model for Text Detoxification on Low-resource Languages
매개변수 효율적 미세 조정, 퓨샷 프롬프팅, 그리고 검색 증강 컨텍스트를 통해 강화된 12B 매개변수 Gemma-3 모델을 활용하는 GemDetox 시스템은 고자원 및 저자원 언어 모두에서 독성 텍스트를 중립적인 패러프레이즈로 효과적으로 재작성함으로써 CLEF 2025 TextDetox 챌린지에서 상위 순위를 차지했다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
소셜 미디어를 거대하고 북적이는 마을 광장이라고 상상해 보세요. 때때로 사람들은 모욕을 퍼붓거나, 혐오를 퍼뜨리거나, 다른 사람들이 불안함을 느끼게 만드는 상스러운 언어를 사용합니다. 코펜하겐 대학교의 "GemDetox" 팀은 사람들의 발언을 침묵시키지 않으면서도 이 광장을 정화할 수 있는 디지털 "치안 유지군"을 구축했습니다.
그들이 어떻게 했는지, 이해하기 쉽게 설명해 드립니다:
미션: 메시지를 지우지 않고도 깔끔하게 정리하기
과제는 독성이 있는 단어(예: 모욕이나 비속어)가 포함된 단일 문장을 가져와서, 원래의 의미는 유지하되 예의 바르고 중립적으로 들리도록 다시 쓰는 것이었습니다.
- 비유: 누군가 "너는 쓸모없는 바보야!"라고 소리친다고 가정해 봅시다. 목표는 문장을 통째로 삭제하는 것(이는 검열이 됩니다)이나 주제를 바꾸는 것이 아닙니다. 대신 시스템은 이를 "당신의 성과에 대해 불만족스럽습니다"라고 다시 씁니다. 분노는 사라졌지만, 불만 사항은 그대로 남아 있습니다.
두뇌: 기억력을 가진 초강력 번역가
팀은 처음부터 새로운 두뇌를 만들지 않았습니다. 그들은 Gemma-3(120억 개의 '뉴런' 또는 파라미터를 가진)라는 매우 스마트하고 기존에 존재하는 AI 모델을 사용했습니다. 이 모델은 영어, 스페인어부터 타타르어, 힌글리시(힌디어와 영어의 혼합)에 이르기까지 15개 언어를 유창하게 구사하는 다국어 능력자라고 생각하면 됩니다.
하지만 이 다국어 능력자에게는 특정한 직무를 배워야 했습니다: 바로 예의 바르게 행동하는 법입니다.
훈련: AI에게 부드럽게 말하는 법 가르치기
AI를 가르치기 위해 팀은 세 가지 다른 방법을 사용하여 특별한 훈련 매뉴얼을 만들었습니다.
- 인간 핸드북: 그들은 독성 문장을 친절한 문장으로 바꾸는 방법을 정확히 보여주는 인간이 작성한 3,600개의 실제 사례로 시작했습니다.
- 기계 번역기: 6개 언어에 대한 인간의 사례가 부족했기 때문에, 그들은 기계 번역기를 사용하여 이 3,600개의 사례를 누락된 언어로 변환했습니다. 이는 레시피 북을 복사하여 재료 목록을 새로운 언어로 번역하는 것과 같습니다.
- 연습 드릴: 그들은 AI 자체를 사용하여 추가 연습 문장을 생성했지만, 매우 엄격하게 필터링했습니다. 만약 AI의 재작성 결과가 원래의 모욕과 너무 유사하다면(예: 글자 하나만 바꾼 경우), 그 문장은 버렸습니다. 그들은 진정으로 다르면서도 여전히 같은 의미를 담고 있는 것들만 남겼습니다.
"생각하는" 기술:
팀은 AI에게 **Chain-of-Thought(사고의 사슬)**라고 불리는 특별한 사고 방식을 가르쳤습니다. 단순히 답을 추측하는 대신, AI는 말하기 전에 4단계 체크리스트를 따르도록 유도되었습니다:
- 나쁜 단어 식별하기.
- 문장이 실제로 무엇에 관한 것인지 이해하기.
- 좋은 단어를 사용하여 다시 쓰기.
- 새로운 문장이 무례하지 않은지 재확인하기.
결과: 대부분의 승리, 그러나 전부는 아님
경진대회에서 그들의 시스템을 테스트했을 때:
- 우승자: 그들의 시스템은 대부분의 언어, 특히 데이터가 풍부한 언어(영어, 독일어, 프랑스어 등)에서 1위를 차지했습니다.
- 고전: 시스템은 "저자원(low-resource)" 언어(아므하라어 또는 타타어와 같이 데이터가 적은 언어)에서 더 어려움을 겪었습니다. 이런 경우, AI는 때때로 횡설수설하거나 미묘한 모욕을 놓치기도 했습니다.
- 격차: 팀은 AI의 성능을 결정짓는 가장 큰 요인이 단순히 해당 언어를 위한 데이터가 얼마나 존재하는가라는 점을 발견했습니다. 학습 사례가 많은 언어의 경우 AI는 훌륭하게 작동했습니다. 반면 사례가 적으면 AI는 비틀거렸습니다.
현실적인 점검: 완벽하지는 않습니다
저자들은 결함에 대해 솔직하게 밝히고 있습니다:
- "판사"의 불일치: 그들은 매우 발전된 다른 AI에게 자신들의 작업에 점수를 매기게 했을 때(인간 판사 역할을 수행), 그들의 시스템이 1위에서 3위로 떨어졌습니다. 이는 그들의 시스템이 규칙을 따르는 데는 뛰어나지만, 진정으로 공격적인 것이 무엇인지에 대한 미묘한 "인간적인 느낌"을 놓칠 수 있음을 시사합니다.
- 문화적 사각지대: AI는 표준 언어를 중심으로 훈련되었기 때문에 슬랭(속어)이나 지역적 모욕을 놓치는 경우가 있었습니다. 예를 들어, 특정 아르헨티나 속어(가치 없는 사람을 뜻하는)를 훈련 데이터에 없다는 이유로 놓쳤습니다.
- 편향 문제: 그들이 사용한 기본 AI 모델은 우리가 볼 수 없는 방대한 인터넷 데이터를 바탕으로 훈련되었습니다. 이는 AI에 이미 내재된 편향이 있을 수 있으며, 팀이 이를 완전히 해결할 수 없었음을 의미합니다.
핵심 요약
GemDetox 팀은 15개 언어로 소셜 미디어의 독성 게시물을 자동으로 정화할 수 있는 강력한 도구를 구축했습니다. 이 도구는 학습할 데이터가 많고 AI에게 "단계별로 생각하도록" 가르칠 때 가장 잘 작동합니다. 비록 완벽하지는 않으며 여전히 복잡한 문화적 뉘앙리에 어려움을 겪고 있지만, 이는 표현의 자유를 억압하지 않으면서도 온라인 공간을 안전하게 유지하도록 관리자를 돕는 데 있어 중요한 진전입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.