← 최신 논문
💬 NLP

Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding

이 논문은 안전 정렬된 대형 언어 모델의 과도한 거절 문제를 해결하기 위해, 시스템 프롬프트의 안전 수준 차이를 분석하여 거절 토큰 분포를 동적으로 조정하는 훈련 불필요 및 모델 독립적인 '적응형 대비 디코딩 (AdaCD)' 방법을 제안합니다.

원저자: Yupeng Qi, Ziyu Lyu, Lixin Cui, Lu Bai, Feng Xia

게시일 2026-04-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yupeng Qi, Ziyu Lyu, Lixin Cui, Lu Bai, Feng Xia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"과도한 거절 (Over-Refusal)"**이라는 문제를 해결하기 위해 개발된 새로운 기술, AdaCD에 대해 설명합니다.

한마디로 요약하면: **"AI 가 너무 겁이 많아서, harmless(해롭지 않은) 질문에도 '죄송합니다, 답변해 드릴 수 없습니다'라고 말하지 않도록 도와주는 똑똑한 필터"**입니다.

이 내용을 일상적인 비유로 쉽게 풀어서 설명해 드릴게요.


1. 문제: AI 의 '과도한 경계심' (Over-Refusal)

상상해 보세요. 아주 까다로운 보안 요원이 있습니다. 이 요원은 "폭탄", "살인" 같은 위험한 단어가 들어오면 무조건 경보를 울리고 문을 닫습니다.

그런데 이 요원이 너무 예민해서, **"게임에서 적을 잡는 (Kill) 방법"**을 묻는 질문을 받자마자, "살인"이라는 단어가 들어갔다는 이유로 **"죄송합니다, 저는 불법적인 행위를 도와드릴 수 없습니다"**라고 거절해 버립니다.

  • 실제 상황: 게임 속 가상의 적을 잡는 법을 묻는 건데, AI 는 진짜 살인을 하려는 거라고 오해합니다.
  • 결과: 사용자는 답을 못 얻고 화가 납니다. AI 는 안전하지만, 쓸모가 없어진 셈이죠.

이게 바로 이 논문이 해결하려는 '과도한 거절' 문제입니다.

2. 기존 방법의 한계: "모든 상황에 같은 처방전"

지금까지의 방법들은 두 가지 극단 중 하나를 선택했습니다.

  1. 안전만 중시: "무조건 거절해!" (안전은 되지만, 게임 질문에도 거절함)
  2. 유용성만 중시: "거절하지 마!" (게임 질문에는 잘 답하지만, 진짜 위험한 질문에도 답해버림)

이건 마치 **"모든 환자에게 같은 약을 주는 의사"**와 같습니다. 감기에도 항생제를 주고, 중증 감염에도 진통제만 주는 꼴이죠. 안전과 유용성을 동시에 잡기 힘들었습니다.

3. 해결책: AdaCD (적응형 대조적 디코딩)

이 논문은 "상황을 보고 AI 의 태도를 유연하게 바꿔주는" 새로운 방법을 제안합니다. 이를 AdaCD라고 부릅니다.

🎭 비유: '극단적인 역할극'을 하는 연기 감독

AdaCD 는 AI 에게 두 가지 역할을 동시에 시킵니다.

  1. 역할 A (안전 요원): "나는 세상에서 가장 위험한 걸 막는 요원이다. 어떤 질문이 들어와도 '거절'해야 한다!" (이걸로 AI 가 거절할 때의 패턴을 배웁니다.)
  2. 역할 B (친절한 친구): "나는 그냥 일반적인 친구야. 질문하면 자연스럽게 답해."

AdaCD 의 마법 같은 과정:

  • 상황 1: 게임 질문 (해롭지 않은 질문)

    • AI 가 "죄송합니다"라고 말하려는 순간, AdaCD 가 개입합니다.
    • "잠깐! 방금 '안전 요원'이 거절하려는 패턴을 봤는데, 이건 게임 질문이야. 거절하려는 성향을 빼버려!"
    • AI 는 "아, 맞다. 이건 게임이네."라고 깨닫고, "게임에서 적 잡는 법은..."이라고 자연스럽게 답합니다.
  • 상황 2: 진짜 위험한 질문 (예: "사람을 죽이는 법")

    • AI 가 "죄송합니다"라고 말하려는 순간, AdaCD 가 다시 개입합니다.
    • "이번엔 진짜 위험한 질문이야. 안전 요원의 거절 성향을 더 강하게 부추겨!"
    • AI 는 "네, 이건 절대 도와드릴 수 없습니다"라고 단호하게 거절합니다.

4. 핵심 원리: "거절하려는 마음이 숨어있을 때"

이 기술의 가장 재미있는 점은 AI 가 거절하지 않을 수도 있다는 사실을 발견한 데서 출발합니다.

  • AI 가 "죄송합니다"라고 말하기 직전, 머릿속에는 "죄송합니다"뿐만 아니라 **"네, 게임 방법 알려드릴게요"**라는 답변도 이미 준비되어 있었습니다.
  • 하지만 AI 가 너무 경계심 많아서, 거절하는 답변을 선택해 버린 것입니다.
  • AdaCD 는 이 숨겨진 '답변 후보'들을 다시 불러와서, 상황에 따라 거절할지 말지를 **적응형 (Adaptive)**으로 결정해 줍니다.

5. 결론: 왜 이 기술이 중요한가?

  • 안전은 유지: 진짜 위험한 질문에는 여전히 단호하게 거절합니다. (보안 요원 역할)
  • 유용성은 회복: 게임이나 일상적인 질문에는 자연스럽게 답합니다. (친절한 친구 역할)
  • 학습 불필요: AI 를 다시 가르칠 필요 없이, 답변을 만들어내는 순간 (추론 단계) 에만 적용하면 됩니다.

한 줄 요약:

AdaCD 는 AI 가 "너무 겁이 많아서" 무언가를 거절할 때, "아니야, 이건 괜찮은 질문이야!"라고 타이르거나, "진짜 위험하니까 거절해!"라고 경고하는 현명한 중재자 역할을 합니다.

이제 AI 는 더 이상 "게임에서 적 잡는 법"을 묻는 사람에게 "죄송합니다"라고 말하지 않고, 실제로 게임 팁을 알려줄 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →