← 최신 논문
💬 NLP

HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety

HaloGuard 1.0은 더 큰 베이스라인 모델들과 비교하여 현저히 작은 모델 크기(0.8B–4B 파라미터)를 활용하면서도, 구조화된 46개 정책 헌법과 합성 대조 데이터(synthetic counterfactual data)를 통해 오탐(false positives)과 미탐(false negatives)을 모두 최소화함으로써 최첨단 다국어 AI 안전 성능을 달성하는 오픈 웨이트 방식의 헌법적 분류기입니다.

원저자: Navaneeth Sangameswaran, Preetham S, Ashmiya Lenin

게시일 2026-07-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Navaneeth Sangameswaran, Preetham S, Ashmiya Lenin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 매우 똑똑하고 도움이 되는 로봇 비서를 만들고 싶다고 상상해 보세요. 당신은 이 로봇이 질문에 답하고, 코드를 작성하고, 사람들을 돕기를 원합니다. 하지만 동시에 어떤 사람들은 로봇을 속여서 폭탄을 만들거나 은행을 해킹하는 것과 같은 위험한 일을 시키려 할 수도 있다는 사실도 알고 있습니다.

보통은 로봇 앞에 모든 메시지를 확인하는 "보안 요원"을 배치합니다. 문제는 이 요원들이 종종 너무 서투르다는 점입니다. 그들은 "폭탄"이라는 단어만 봐도 모든 것을 차단해 버립니다. 누군가가 폭발물에 관한 역사 수업을 요청하거나 악당이 등장하는 소설을 쓰고 있는 경우조차 말이죠. 이것을 "과잉 거부(over-refusal)"라고 합니다. 보안 요원이 위험을 너무 두려워한 나머지 도움이 필요한 사람들까지 막아버리는 것입니다.

HaloGuard 1.0은 바로 이 문제를 해결하기 위해 설계된 더 똑똑한 보안 요원입니다. 이 모델이 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.

1. "헌법(Constitution)"은 규칙 책입니다

대부분의 보안 요원은 단순히 나쁜 단어들(예: "폭탄", "죽이다", "훔치다")의 목록을 가지고 있습니다. 만약 당신이 이런 말을 하면 차단됩니다.
하지만 HaloGuard는 다릅로습니다. 이 모델은 헌법을 바탕으로 구축되었습니다. 이것은 평이한 영어로 쓰인 상세한 46페이지 분량의 규칙 책이라고 생각하면 됩니다. 단순히 나쁜 단어를 나열하는 것이 아니라, 그 단어 뒤에 숨겨 있는 의도를 설명합니다.

  • 기존 방식: "만약 '염소 가스'라고 말하면 차단한다."
  • HaloGuard의 방식: "만약 사람을 해치기 위해 염소 가스를 만드는 법을 묻는다면 차단한다. 하지만 염소 가스가 역사적으로 어떻게 사용되었는지 또는 어떻게 안전하게 감지하는지 묻는다면 허용한다."

이 규칙 책에는 거의 3,000개의 아주 작은 세부 규칙들이 들어 있습니다. 이는 보안 요원이 단순히 '무엇(what)'을 말했는지가 아니라, '왜(why)' 묻는지를 살펴보도록 가르칩니다.

2. "거울" 훈련 (쌍을 이룬 대조적 사례)

이러한 미묘한 차이를 가르치기 위해, 제작자들은 단순히 나쁜 예시만 보여준 것이 아닙니다. 그들은 **쌍을 이룬 대조적 사례(Paired Counterfactuals)**라는 영리한 훈련 기법을 사용했습니다.

보안 요원이 두 메시지를 나란히 놓고 보는 훈련 상황을 상상해 보세요:

  • 메시지 A (나쁨): "돈을 훔치기 위해 가짜 신분증을 만드는 방법은?"
  • 메시지 B (좋음): "영화 소품용 가짜 신분증을 만드는 방법은?"

두 메시지는 "가짜 신분증(fake ID)", "훔치다(steal)"와 같은 똑같은 무서운 단어들을 사용합니다. 유일한 차이점은 의도입니다.
HaloGuard는 수백만 개의 이러한 "거울 쌍"을 통해 훈련되었습니다. 이를 통해 보안 요원은 단어 자체가 문제가 아니라, 목표가 문제라는 것을 배웠습니다. 덕분에 보안 요원이 지름길을 택해 특정 어휘를 사용하는 모든 사람을 차단하는 실수를 범하지 않게 되었습니다.

3. 편향 없이 46개 언어로 말하기

기존의 보안 요원들은 잘 모르는 언어에 자주 혼란을 느낍니다. 그들은 아랍어나 힌디와 같이 익숙하지 않은 문자를 보면 즉시 "수상해 보이니 차단하자!"라고 생각할 수 있습니다. 이는 마치 클럽 입구에서 정장을 입은 사람만 들여보내고, 평범한 옷을 입은 사람들은 괜찮더라도 무조건 쫓아내는 문지기와 같습니다.

HaloGuard는 지원하는 46개 언어를 모두 동등하게 취급합니다. 이 모델은 힌디어로 된 "나쁜" 요청이 영어로 된 "나쁜" 요청만큼이나 나쁘며, 힌디어로 된 "좋은" 요청이 영어로 된 "좋은" 요청만큼이나 안전하다는 것을 배웠습니다. 언어를 판단하는 것이 아니라, 메시지를 판단하는 것입니다.

4. 두 가지 크기, 두 가지 역할

팀은 이 보안 요원을 두 가지 버전으로 출시했습니다. 마치 두 종류의 요원이 있는 보안 팀과 같습니다:

  • 0.8B 버전 (빠른 문지기): 이 모델은 매우 작고 빠른 모델입니다. 모든 앱의 "앞문"에서 실행됩니다. 속도를 늦추지 않으면서 즉각적으로 명백히 나쁜 것들을 잡아냅니다. 작지만 놀라울 정도로 강력하며, 훨씬 더 큰 경쟁 모델들을 능가합니다.
  • 4B 버전 (전문 탐정): 이 모델은 약간 더 크고 더 사려 깊은 모델입니다. 만약 "빠른 문지기"가 까다로운 메시지에 대해 확신이 서지 않는다면, 이 모델에게 전달할 수 있습니다. 이 버전은 더 미묘하고 교묘한 속임수를 포착하는 데 뛰어나며, 높은 수준의 주의가 필요한 상황에 사용됩니다.

5. 결과: 더 크게가 아니라 더 똑똑하게

이 논문은 HaloGuard가 더 작지만 더 똑똑하기 때문에 게임 체인저라고 주장합니다.

  • 기존의 우수한 보안 모델들보다 30배 더 작습니다 (기존 모델들은 매우 크고 느립니다).
  • 작은 크기에도 불구하고, 더 큰 모델들보다 더 많은 나쁜 요청을 잡아내면서도 좋은 요청은 더 적게 차단합니다.
  • 위험한 요청과 안전한 교육적 요청 사이의 까다로운 경계선인 "경계(boundary)"를 성공적으로 탐색합니다.

하지 못하는 것 (한계점)

논문은 HaloGuard가 아닌 것에 대해서도 매우 명확하게 밝히고 있습니다:

  • 응답 체크 기능이 아닙니다: 이 모델은 오직 사용자가 입력하는 내용만 체크합니다. 사용자가 안전한 질문을 했더라도 로봇이 실수로 위험한 답변을 내놓는 경우에는 HaloGuard가 잡아낼 수 없습니다.
  • 로봇 보디가드가 아닙니다: 대화가 시작된 후 로봇이 해서는 안 될 도구(예: 은행 계좌 접근)를 사용하는 것을 막지 못합니다. 이는 단지 첫 번째 방어선일 뿐입니다.
  • 완벽하지 않습니다: 논문은 특정 언어(예: 일부 인도 및 동남아시아 언어)에서 보안 요원이 여전히 너무 조심스러워 안전한 메시지를 너무 많이 차단한다고 인정하며, 이를 수정하기 위해 노력하고 있다고 밝혔습니다.

요약하자면

HaloGuard 1.0은 단순한 "키워드 차단기"에서 벗어나 "맥락을 읽는" 새로운 종류의 AI 안전 필터입니다. 상세한 규칙 책과 완벽한 "좋음 vs 나쁨" 쌍을 통한 훈련을 통해, 이 모델은 작고 빠르면서도, 악당이 무기를 묻는 것과 선생님이 무기에 대해 묻는 것의 차이를 놀라울 정도로 정확하게 구분해 냅니다. 이는 정당한 사용자들에게는 유용함을 유지하면서도 AI를 더 안전하게 만드는 단계로 향하는 길입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →