← 최신 논문
💬 NLP

Measuring and Mitigating Toxicity in Large Language Models: A Comprehensive Replication Study

이 포괄적인 재현 연구는 DExperts 추론 시간 완화 기법을 평가하여 명시적 유해성에는 거의 완벽한 안전성을 달성하지만 암시적 혐오 발언에는 취약하며 10 배의 치명적인 지연 시간 패널티를 초래함으로써 실제 세계 AI 안전 배포를 위한 견고성과 효율성의 결정적 격차를 드러낸다고 밝혔습니다.

원저자: Mokshit Surana, Archit Rathod, Akshaj Satishkumar

게시일 2026-05-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mokshit Surana, Archit Rathod, Akshaj Satishkumar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 'GPT-2'라는 이름의 매우 재능 있지만 훈련받지 않은 작가가 있다고 가정해 봅시다. 이 작가는 인터넷상의 거의 모든 것을 읽어 왔습니다. 인터넷에는 아름다운 이야기와 동시에 끔찍하고 증오에 찬 분노의 글이 모두 포함되어 있기 때문에, 이 작가는 실수로 두 가지 모두처럼 말하도록 학습하게 되었습니다. 때로는 "남자들이 시작해서..."와 같이 해롭지 않은 질문을 하면, 여러분이 원하지 않았음에도 불구하고 폭력적이거나 증오에 찬 내용으로 문장을 마무리할 수 있습니다. 이를 '독성 퇴화 (toxic degeneration)'라고 합니다.

제공된 논문은 특정 '가드레일' 시스템인 DExperts를 테스트하여 이 작가가 무례하게 되는 것을 막을 수 있는지, 그리고 동시에 작가가 로봇 같거나 멍청하게 들리게 하지 않는지 확인하기로 결정한 안전 검사관 팀과 같습니다.

다음은 그들의 조사를 간단한 부분으로 나눈 이야기입니다:

1. 문제: 훈련받지 않은 작가

먼저, 팀은 훈련받지 않은 작가 (GPT-2) 에게 100 개의 문장을 완성하도록 요청했습니다.

  • 결과:100 회 중 96 회는 작가가 안전했습니다. 하지만 약 100 회 중 4 회는 작가가 독성 있는 무언가를 말했습니다.
  • 비유: 96% 의 시간에는 완벽하게 운전되지만, 가끔씩은 무작위로 벽으로 방향을 틀어 들어가는 자동차를 상상해 보세요. 고속도로를 운전하고 싶은 자동차에게는 그 4% 의 위험이 너무 큽니다.

2. 해결책: 'DExperts' 가드레일

팀은 DExperts라는 교묘한 트릭을 시도했습니다. 작가를 다시 훈련시키는 것 (수년 동안 학교로 보내는 것과 같은) 대신, 작가가 글을 쓰는 동안 두 명의 '편집자'를 옆에 배치했습니다:

  • 좋은 편집자 (전문가): 오직 친절하고 정중한 텍스트로만 훈련된 모델입니다. "이 단어는 무례하게 들립니다! 더 좋은 단어를 선택해 봅시다"라고 말합니다.
  • 나쁜 편집자 (반전문가): 오직 무례하고 독성 있는 텍스트로만 훈련된 모델입니다. "오, 그 단어는 증오하는 사람이 정확히 사용할 단어입니다! 사용하지 마세요!"라고 말합니다.

작가는 두 편집자의 말을 모두 듣습니다. 나쁜 편집자가 "안 돼!"라고 외치고 좋은 편집자가 "좋아!"라고 말하면, 작가는 단어를 안전한 것으로 변경합니다.

일반 테스트에서의 결과:
표준적이고 명백한 혐오 표현 (모욕적 언어나 위협 등) 으로 테스트했을 때, 이 시스템은 완벽하게 작동했습니다.

  • 안전 점수: 100%. 작가는 결코 독성 있는 말을 하지 않았습니다.
  • 단점: 느렸습니다.
    • 편집자 없이 작가는 문장을 완성하는 데 0.2 초가 걸렸습니다.
    • 편집자와 함께하면 2.0 초가 걸렸습니다.
    • 비유: 마치 초고속 레이싱 카를 가지고 있지만, 이동하기 전에 세 명의 사람과 지도를 확인하기 위해 모든 빨간불에서 멈춰야 하는 것과 같습니다. 안전하지만, 결코 경기를 이길 수는 없습니다.

3. 스트레스 테스트: '숨겨진' 혐오

팀은 현실 세계의 혐오 표현이 항상 명백한 것은 아니라는 것을 알고 있었습니다. 때로는 사람들은 정중하게 들리지만 실제로는 해로운 '암호화된 언어'나 미묘한 고정관념을 사용합니다. 그들은 DExperts 가 이러한 '숨겨진' 혐오를 포착할 수 있는지 확인하고 싶었습니다.

안전 필터를 속이도록 설계된 문장으로 가득 찬 ToxiGen이라는 특수 데이터 세트를 사용했습니다. 이 문장들은 나쁜 단어를 사용하지 않고, 특정 집단에 대해 나쁜 말을 하기 위해 '좋은' 단어를 사용합니다.

숨겨진 혐오에 대한 결과:
가드레일 시스템이 균열되기 시작했습니다.

  • 안전 점수: 100% 에서 **98.5%**로 떨어졌습니다.
  • 비유: 편집자들은 "너를 싫어해!"라고 외치는 남자를 찾아내는 데는 뛰어났지만, 칭찬처럼 들리는 미묘한 모욕을 속삭이는 남자는 놓쳤습니다. 시스템은 약 1.5% 의 숨겨진 혐오가 통과되도록 내버려 두었습니다.
  • '이중 벌칙': 작가가 이러한 까다로운 숨겨진 혐오 문장을 생성하려고 시도했을 때, 시스템은 더욱 느려졌고(3 초 이상 소요) 여전히 독성을 막지 못했습니다. 더 열심히 일했지만 더 나쁜 결과를 낳았습니다.

4. 주요 교훈

논문은 세 가지 주요 결론으로 마무리됩니다:

  1. 명백한 것에는 효과가 있습니다: DExperts 는 시끄럽고 명백한 혐오 표현을 막는 데 놀라울 정도로 뛰어납니다.
  2. 교활한 것에는 실패합니다: 숨으려고 하는 미묘하고 암호화된 혐오 표현에는 어려움을 겪습니다.
  3. 실시간 사용에는 너무 느립니다: 세 가지 다른 모델을 동시에 실행해야 하기 때문에 컴퓨터 속도를 10 배 느리게 만듭니다. 이는 즉각적인 답변을 기대하는 라이브 챗봇과 같은 용도로 사용하기 어렵게 만듭니다.

요약하자면: 팀은 소리지르는 괴롭힘을 막는 데 완벽한 안전 가드레일을 발견했지만, 속삭이는 괴롭힘에는 혼란을 겪으며, 전체 과정을 너무 느리게 만들어 일상적인 사용에 실용적이지 않을 수 있음을 발견했습니다. 그들은 앞으로 '속삭이는' 괴롭힘을 잡을 더 똑똑하고 빠른 방법이 필요하다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →