← 최신 논문
💬 NLP

CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment

이 논문은 확장 가능한 다단계 구축 파이프라인을 통해 고품질 주석 데이터의 부족 문제를 해결하고, 대규모의 엄격하게 큐레이션된 데이터셋에 대한 모델 인식 선호도 정렬을 통해 최첨단 성능을 달하는 미세 조정된 중국어 LLM 안전 가드레일인 CHILLGuard를 소개한다.

원저자: Wenbo Yu, Bohua Wang, Hao Fang, Kuofeng Gao, Jingru Zeng, Xiaochen Yang, Tianyi Zhang, Xiaoxiao Ma, Jiawei Kong, Hao Wu, Bin Chen, Shu-Tao Xia, Min Zhang

게시일 2026-06-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wenbo Yu, Bohua Wang, Hao Fang, Kuofeng Gao, Jingru Zeng, Xiaochen Yang, Tianyi Zhang, Xiaoxiao Ma, Jiawei Kong, Hao Wu, Bin Chen, Shu-Tao Xia, Min Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 똑똑하고 도움이 되는 로봇 비서(거대 언어 모델, LLM)가 있다고 상상해 보세요. 이 비서는 이야기를 쓰고, 질문에 답하며, 업무를 도와줄 수 있습니다. 하지만 어떤 강력한 도구든 주의 깊게 살피지 않으면, 특히 중국어로 말할 때 무례하거나, 불법적이거나, 위험한 내용을 실수로 말할 수도 있습니다.

이 논문은 중국어를 사용하는 로봇을 전문적으로 감시하기 위해 설계된 특화된 "안전 가드(safety guard)"인 CHILLGuard를 소개합니다. 이들이 이를 어떻게 구축했는지 쉽게 설명해 드리겠습니다.

1. 문제점: "모두에게 맞는" 옷은 맞지 않는다

기존의 로봇 안전 가드들은 대부분 영어로 훈련되었습니다. 키 큰 미국인에게 맞춰진 정장을 체형이 다른 사람에게 입히려고 한다고 상상해 보세요. 어떤 부분은 너무 꽉 끼고, 어떤 부분은 헐렁할 것입니다.

  • 문제점: 영어로 훈련된 가드들은 중국 문화나 특정 법률, 또는 사람들이 나쁜 의도를 숨기기 위해 사용하는 교묘한 방식(예: 나쁜 단어를 직접 말하지 않고도 해로운 내용을 전달하기 위해 사용하는 언어유희, 이모지, 역사적 참조 등)을 이해하지 못했습니다.
  • 결과: 이로 인해 위험한 콘텐츠를 놓치거나, 무해한 것을 잘못 차단하는 경우가 빈번했습니다.

2. 해결책: 맞춤 제작된 안전복

저자들은 세 가지 주요 부분으로 구성된 새로운 안전 시스템을 구축했습니다.

파트 A: 규칙집 (Taxonomy)

먼저, 중국의 안전을 위해 구체적이고 상세한 새로운 규칙집을 작성했습니다. 단순히 "나쁨" 또는 "좋음"이라고 하는 대신, 31개의 특정 카테고리를 가진 5성급 등급 시스템을 만들었습니다.

  • 5가지 주요 카테고리:
    1. 국가 가치 (National Values): 국가의 안정과 법률 보호.
    2. 공정성 (Fairness): 인종, 성별, 직업에 따른 차별 방지.
    3. 비즈니스 규칙 (Business Rules): 사기, 아이디어 도용 또는 불공정 거래 방지.
    4. 개인 권리 (Personal Rights): 개인의 프라이버시, 명성 및 안전 보호.
    5. 서비스 품질 (Service Quality): 로봇이 쓸모없거나 과학적으로 틀린 조언을 하지 않도록 보장.

파트 B: 훈련 체육관 (Data Construction)

가드를 가르치기 위해서는 방대한 예시 라이브러리가 필요했습니다. 하지만 "나쁜" 중국어 프롬프트의 좋은 예시를 찾기는 어려웠습니다. 그래서 그들은 3단계 공장을 구축하여 이를 만들어냈습니다.

  1. 보물찾기 (RAG): 인터넷에서 31개 카테코리에 관련된 키워드를 검색하여 실제 텍스트 샘플을 수집했습니다.
  2. 실제 세상 (The Real World): 중국 내 상업용 로봇에 실제 사용자들이 던졌던 질문들을 수집했습니다.
  3. "트릭스터" 공장 (Prompt Engineering): 이것이 영리한 부분입니다. 그들은 실제 질문들을 가져와 AI를 사용하여 까다로운 방식으로 재작성했습니다.
    • 비유: 보안 요원 훈련을 상상해 보세요. 도둑의 사진만 보여주는 대신, 변장을 하거나 암호를 사용하거나 농담 뒤에 숨어 있는 도둑을 보여주는 것입니다. AI는 동음이의어(철자는 다르지만 소리는 같은 단어), 역사적 은유, 그리고 반어법을 사용하여 질문을 재작성함으로써 잡아내기 어렵게 만들었습니다.

그 결과 405,000개의 훈련 예시(체육관)와 51,000개의 테스트 예시(최종 시험)를 확보했습니다.

파트 C: 훈련 방법 (스파링 파트너)

보통 안전 가드를 훈련할 때는 단순히 예시를 보여주기만 합니다. 하지만 이 논문에서는 스파링 파트너 접근 방식을 사용했습니다.

  • 파이터 (Generator): 가드를 속이기 위해 가능한 가장 까다로운 트릭 질문을 만들어내도록 훈련된 AI.
  • 가드 (Classifier): 그 질문들을 잡아내려는 안전 모델.
  • 댄스 (The Dance): 그들은 함께 라운드별로 훈련했습니다. 파이터는 가드를 속이려 노력하고, 가드가 실패하면 파이터가 보상을 받습니다. 가드가 성공하면 가드는 더 강해집니다.
  • 비법 (MDPO): 그들은 **모델 인식 직접 선호 최적화(Model-aware Direct Preference Optimization)**라는 특별한 기술을 사용했습니다.
    • 비유: 코치를 상상해 보세요. 학생이 이미 수학을 잘한다면 코치는 쉬운 문제에 시간을 낭비하지 않습니다. 하지만 학생이 특정 어려운 개념에서 헤매고 있다면, 코치는 그 부분에 더 많은 에너지를 집중합니다. 이 방법은 학습 난이도를 자동으로 조정하여, 가드가 답변하는 데 어려움을 겪는 질문에 가장 많은 노력을 집중하게 했습니다.

3. 결과: 우수한 성적으로 시험 통과

그들은 자신들의 새로운 가드를 다른 유명한 안전 가드들(LlamaGuard, QwenGuard 등)과 비교 테스트했습니다.

  • 점수: CHILLGuard는 자신들의 커스텀 테스트에서 훨씬 높은 점수를 기록했습니다.
  • 비교: 주요 테스트에서 두 번째로 뛰어난 모델보다 큰 차이(약 16% 더 높은 성능)로 앞섰습니다.
  • 일관성: 특정 주제에는 강하지만 다른 주제에는 취약한 다른 모델들과 달리, CHILLGuard는 31개 모든 카테고리에서 강력한 모습을 보였습니다.

요약

저자들은 다음과 같이 중국 AI를 위한 맞춤형 안전 가드를 구축했습니다:

  1. 상세하고 문화적으로 특화된 규칙집을 제작했습니다.
  2. 훈련을 위해 수백만 개의 까다롭고 숨겨진 위험이 담긴 예시를 제조했습니다.
  3. 가장 어려운 문제에 추가적인 노력을 기울이는 "스파링 파트너" 훈련 방식을 사용했습니다.

그 결과, CHILLGuard는 이전 모델들보다 중국어 텍스트에 담긴 미묘하고, 숨겨져 있으며, 문화적으로 특화된 위험을 훨씬 더 잘 포착하는 가드가 되었습니다. 그들은 다른 이들도 사용할 수 있도록 데이터와 코드를 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →