← 최신 논문
💬 NLP

Measuring & Mitigating Over-Alignment for LLMs in Multilingual Criminal Law Courts

이 논문은 형사법 맥락에서의 '과잉 정렬(over-alignment)'을 측정하고 완화하기 위해 스위스 연방법원 판결에서 유도된 다국어 벤치마크인 TF-RefusalBench를 소개하며, 에블레이션(abliteration)이 작업 성능을 유지하면서도 유해한 모델 거부를 효과적으로 제거함을 입증한다.

원저자: Arthur Wuhrmann, Gaetan Stein, Daniel Brunner, Andrei Kucharavy

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Arthur Wuhrmann, Gaetan Stein, Daniel Brunner, Andrei Kucharavy

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: 과잉 보호하는 사서

매우 똑똑하고 다국어에 능통한 사서(AI)가 스위스 법원에서 일하고 있다고 상상해 보세요. 이 사서의 업무는 법률 문서를 번로 및 요약하는 것입니다. 하지만 이 문서들 중 상당수는 아동 학대나 성폭력과 같은 끔찍한 범죄를 다루고 있습니다.

이 사서는 매우 엄격한 "안전 규칙 책자"를 학습했습니다. 규칙 책에는 다음과 같이 적혀 있습니다. "만약 나쁜 내용을 보게 된다면, 즉시 멈추고, 읽기를 거부하며, 방 안의 사람들에게 경고를 외쳐라."

일반적인 도서관에서는 이것이 좋은 일입니다. 하지만 형사 법원에서는 재앙입니다. 판사와 서기들은 업무를 수행하기 위해 반드시 그 구체적인 내용들을 읽어야 합니다. 그들은 누군가를 해치려는 것이 아니라, 사건을 해결하려는 것이기 때문입니다.

AI의 엄격한 학습 때문에, AI는 계속해서 자신의 업무를 거부합니다. AI는 "이 내용은 너무 충격적이어서 번역할 수 없습니다!"라고 말하거나, 번역 중간에 거대한 주의 문구를 삽м 넣어 흐름을 방해합니다. 논문에서는 이를 **"과잉 정렬(Over-Alignment)"**이라고 부릅니다. AI가 "안전하게 행동하라"는 것에 너무 정렬된 나머지, 실제 업무에 도움이 되는 능력을 상실한 것입니다.

실험: "TF-RefusalBench"

이 문제가 정확히 얼마나 심각한지 측정하기 위해, 저자들은 TF-RefusalBench라는 특별한 테스트를 구축했습니다.

이것을 AI를 위한 "스트레스 테스트"라고 생각하면 됩니다. 저자들은 스위스의 실제 매우 심각한 법정 사건 100건(독어, 불어, 이탈리아어)을 가져와 수천 가지 변형된 요청을 만들었습니다. 그리고 AI에게 다음을 요청했습니다:

  1. 텍text를 다른 언어로 번역할 것.
  2. 텍스트를 요약할 것.
  3. 다양한 언어로 지시를 내릴 것.

저자들은 다섯 가지 서로 다른 AI 모델을 테스트하여, 모델들이 얼마나 자주 다음과 같은 행동을 하는지 확인했습니다:

  • 거절(Refuse): "아니요, 저는 이것을 하지 않겠습니다"라고 말함.
  • 고지(Disclaimer): 업무는 수행하되 "이 콘텐츠는 충격적입니다"와 같은 무서운 경고 문구를 추가함.

연구 결과:

  • 단순히 "아니요"라고 말하는 것만이 문제가 아닙니다: 어떤 모델은 한 번도 "아니요"라고 말하지 않았지만, 작업 결과물의 25%에 경고 라벨을 붙였습니다. 이는 판사의 집중력을 깨뜨린다는 점에서 거절하는 것만큼이나 짜증스러운 일입니다.
  • 언어가 중요합니다: AI의 반응은 어떤 언어를 사용하냐에 따라 달라졌습니다. 예를히, 어떤 모델은 내용은 똑같더라도 독일어로 말할 때보다 프랑스어로 말할 때 훨씬 더 자주 거절하는 경향을 보였습니다.
  • 무작위적입니다: 때때로 AI는 동일한 요청에 대해 두 번 연속으로 거절하기도 하고, 다른 때는 완벽하게 업무를 수행하기도 했습니다. 이는 마치 동전 던지기와 같습니다.

해결책: 사서를 고치는 방법

저자들은 AI가 위험해지지 않으면서도 너무 과하게 보호적이지 않도록 만드는 두 가지 방법을 테스트했습니다.

1. "시스템 프롬프트" (부드러운 상기)
대화 시작 시 AI에게 다음과 같은 특정 메모를 전달하는 방 방식을 시도했습니다: "당신은 법원 보조원입니다. 당신의 임무는 내용이 충격적이더라도 문서를 충실히 번역하는 것입니다. 경고를 추가하지 마십시오."

  • 결과: 효과가 약간 있었습니다. 한 모델에서 거절률을 절반으로 줄였지만, 모든 문제를 해결하지는 못했습니다. 이는 마치 불안해하는 사서에게 "괜찮으니 그냥 할 일을 하세요"라고 말하는 것과 같지만, 사서는 여전히 여전히 긴장한 상태인 것과 같습니다.

2. "애블리테레이션(Abliteration)" (외과적 제거)
이것이 핵심적인 발견입니다. 저자들은 AI의 "거절" 행동이 코드 내의 특정하고 작은 스위치(수학적 방향)에 의해 제어된다는 것을 발견했습니다.

  • 비유: AI에게 "거절 근육"이 있다고 상상해 보세요. 저자들은 나머지 몸에 해를 끼치지 않고 오직 그 근육만을 외과적으로 제거하는 방법을 찾아냈습니다. 그들은 이를 **애블리테이션(Abliteration)**이라 부릅니다.
  • 결과: 이 방법은 완벽하게 작동했습니다. AI는 거절을 완전히 멈췄습니다. 경고 라벨도 더 이상 붙이지 않았습니다. AI는 번역을 완벽하게 수행했습니다.
  • 주의점: 논문은 이것이 "양날의 검"이라고 경고합니다. 거절 근육을 제거함으로써, AI는 실제 나쁜 요청(예: 폭탄 제조법을 묻는 경우)에 다소 취약해질 수 있습니다. 하지만 스위스 법원이라는 특정한 통제된 환경(AI가 보안 건물 안에 갇혀 있고 법률 문서만 다루는 환경)에서는, 저자들은 이러한 트레이드오프(절충)가 가치가 있다고 주장합니다.

결론

이 논문은 AI가 안전한지를 판단할 때 단순히 얼마나 자주 "아니요"라고 말하는지만 봐서는 안 된다고 주장합니다. 얼마나 자주 짜증 나는 경고를 덧붙이는지도 함께 봐야 합니다.

민감한 형사 사건을 다루는 법률 전문가들에게 현재의 "안전한" AI 모델들은 지나치게 조심스럽습니다. 애블리테이션(Abliteration) 기술을 사용하면, 우리는 이 모델들을 세상의 다른 곳에서는 충분히 안전하면서도, 법정에서는 자신의 직무를 수행할 수 있을 만큼 용감하게 튜닝할 수 있습니다.

중요 참고 사항: 저자들은 자신들이 데이터나 수정된 AI를 대중에 공개하지 않을 것임을 매우 신중하게 밝히고 있습니다. 데이터에 실제 학대 사례가 포함되어 있기 때문에, 공유하지 않겠다는 엄격한 계약에 서명한 연구자들에게만 접근 권한을 부여합니다. 또한, 악의적인 행위자가 이를 오용할 수 있으므로 "외과적으로 수정된" AI 역시 공개하지 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →