← 최신 논문
💬 NLP

Beyond "I cannot fulfill this request": Alleviating Rigid Rejection in LLMs via Label Enhancement

본 논문은 라벨 향상을 위한 변분 추정을 활용하여 세밀한 거절 분포를 예측하는 LANCE라는 방법을 제안함으로써, 대규모 언어 모델이 높은 보안 수준을 유지하면서도 경직된 거절을 피하는 안전하고 자연스러운 응답을 생성할 수 있도록 합니다.

원저자: Ying Zhang, Congyu Qiao, Xin Geng, Ning Xu

게시일 2026-05-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ying Zhang, Congyu Qiao, Xin Geng, Ning Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑하고 도움이 되는 로봇 비서가 있다고 가정해 봅시다. 당신이 거의 안전하지만 민감한 주제를 약간 건드리는 질문을 했다고 치죠. 로봇이 약간의 경고와 함께 도움이 되는 답변을 주는 대신, 당황해서 매번 같은 로봇 같은 문구만 반복합니다: "이 요청은 수행할 수 없습니다."

이 논문은 이를 **"경직된 거부 (rigid rejection)"**라고 부릅니다. 이는 약간 위험한 모자를 쓴 사람이라는 이유만으로 모두를 쫓아내는 클럽의 문지기처럼 행동하는 것과 같습니다. 그들이 단지 춤을 추러 온 것일지라도 말입니다. 로봇은 실수를 할까 봐 너무 두려워해서 오히려 도움이 되지 않게 됩니다.

이 논문의 저자들은 이를 해결하기 위해 LANCE라는 새로운 시스템을 구축했습니다. 간단한 비유를 통해 작동 방식을 설명해 보겠습니다.

1. 문제: "전부 아니면 전무 (All-or-Nothing)" 스위치

현재 대부분의 안전 시스템은 단순한 전등 스위치처럼 작동합니다: ON(안전) 또는 OFF(위험).

  • 시스템이 위험한 단어를 감지하면 스위치를 "OFF"로 돌려 대화를 차단합니다.
  • 문제는 많은 질문이 순수하게 "나쁜" 것이 아니라는 점입니다. 해로운 아이디어와 위험한 세부 사항이 섞여 있을 수 있습니다. 기존 시스템은 뉘앙스를 파악하지 못해 모든 것을 차단해 버립니다.

2. 해결책: LANCE (조광기 또는 볼륨 노브)

LANCE 는 그 단순한 전등 스위치를 조광기볼륨 노브로 대체합니다. 단순히 "나쁨" 또는 "좋음"이라고 말하는 대신, *"이것이 얼마나 위험하며, 정확히 어떤 부분이 위험한가?"*라고 묻습니다.

  • 라벨 강화 (탐정): LANCE 는 (변분 추론이라고 불리는) 특수 도구를 사용하여 질문을 분석하고 분해합니다. 단순한 "예/아니오" 라벨 대신 위험의 연속 지도를 생성합니다.
    • 비유: 일기 예보를 상상해 보세요. 기존 시스템은 "비" 또는 "비 없음"이라고만 말했습니다. LANCE 는 "북쪽에는 약한 이슬비가 20% 확률로 내리지만, 남쪽은 맑습니다"라고 말합니다. 위험이 어디에 있고 얼마나 큰지 알고 있는 것입니다.

3. 과정: "외과적 편집자"

LANCE 가 위험이 정확히 어디에 있고 그 크기가 얼마나 큰지 파악하면, 전체 대화를 삭제하지 않습니다. 대신 외과적 편집자처럼 행동합니다.

  • 경사도 가이드: LANCE 는 위험 지도에 기반한 일련의 지시를 로봇에게 제공합니다.
    • 위험이 매우 작다면(약한 이슬비처럼), 로봇에게 문장에 작고 정중한 조정을 하도록 지시합니다.
    • 위험이 매우 크다면(폭풍우처럼), 로봇에게 더 큰 변화를 주도록 지시합니다.
  • 결과: 로봇은 사용자의 질문을 안전하게 만들기 위해 필요한 만큼만 다시 쓰되, 원래의 의미와 어조는 유지합니다.
    • 기존 방식: 사용자가 "이웃의 Wi-Fi 를 해킹하는 방법은 무엇인가요?"라고 묻습니다 -> 로봇: "이 요청은 수행할 수 없습니다."
    • LANCE 방식: 로봇은 "해킹" 부분이 위험하지만 "이웃의 Wi-Fi" 부분은 단순한 호기심임을 파악합니다. 생각을 다음과 같이 재구성합니다: "해킹은 도와드릴 수 없지만, Wi-Fi 보안이 어떻게 작동하여 자신의 네트워크를 보호할 수 있는지 설명해 드릴 수는 있습니다."

4. 결과: 안전하지만 자연스러움

이 논문은 이 시스템을 다른 안전 방법들과 비교 테스트한 결과, LANCE 가 다음 두 가지 측면에서 훨씬 더 뛰어나다고 밝혔습니다:

  1. 안전성: 여전히 정말로 위험한 내용은 차단합니다 (엄격한 로봇만큼 안전합니다).
  2. 도움됨과 자연스러움: 로봇이 녹음된 테이프처럼 반복되는 소리를 내지 않도록 합니다. 로봇이 단순히 "아니오"라고 말하는 대신 도움을 주려 하기 때문에 대화가 더 인간적으로 느껴집니다.

요약

LANCE 를 로봇에게 문지기가 아닌 외교관이 되도록 가르치는 것이라고 생각하세요.

  • **문지기 (기존 시스템)**는 위험한 모자를 보고 "입장 불가!"라고 말합니다.
  • **외교관 (LANCE)**은 위험한 모자를 보고, "그 모자는 이 파티에는 조금 위험하지만, 더 안전한 모자로 바꿔서 들어와서 춤을 추게 해 드릴까요?"라고 말합니다.

이 논문은 이 방법이 AI 를 귀찮거나 도움이 되지 않게 만들지 않으면서 더 안전하게 만든다고 주장합니다. 즉, 우리와 대화하기를 두려워하는 로봇들의 문제를 해결하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →