← 최신 논문
🤖 AI

LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment

LLM-VA 는 폐쇄형 가중치 업데이트를 통해 모델의 답변 및 안전성 평가 벡터를 정렬함으로써 안전 정렬 LLM 의 잼브레이크 취약점과 과도한 거절 사이의 상충 관계를 해결하여, 미세 조정 없이도 답변 의지가 안전성 판단에 인과적으로 의존하도록 합니다.

원저자: Haonan Zhang, Dongxia Wang, Yi Liu, Kexin Chen, Wenhai Wang

게시일 2026-05-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haonan Zhang, Dongxia Wang, Yi Liu, Kexin Chen, Wenhai Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델 (LLM) 을 매우 똑똑하지만 약간 혼란스러운 사서로 상상해 보십시오. 이 사서에게는 두 가지 명확한 업무가 있습니다:

  1. "답변" 업무: 사용자에게 책을 건네는지 (질문에 답하는지), 아니면 책장에 두는지 (거부하는지) 결정합니다.
  2. "안전" 업무: 요청받은 책이 읽기에 안전한지 (무해한지), 아니면 위험한지 (유해한지) 결정합니다.

문제: 분리된 두 개의 뇌

이 논문은 현재의 AI 모델에서 이 두 가지 업무가 서로 대화하지 않는 완전히 분리된 두 개의 "뇌"에 의해 처리된다고 주장합니다.

  • "답변" 뇌는 단순히 책을 건네고 싶어 하는 친절한 로봇과 같습니다. 책 안에 무엇이 들어있는지 상관없이 그저 도움을 주고 싶어 할 뿐입니다.
  • "안전" 뇌는 책이 위험한지 확인하는 경비원과 같습니다.

현재의 설정에서 이 두 뇌는 직교 (orthogonal) 합니다 (서로 90 도 각도를 이룹니다). 완전히 독립적입니다.

  • "재일브레이크 (Jailbreak)" 실패: 악의적인 행위자가 사서를 속입니다. "안전" 경비원은 잠들어 있을 수 있지만, "답변" 로봇은 도움을 주고 싶어 하는 열의가 너무 강해 위험한 책을 그대로 건네버립니다.
  • "과도한 거부 (Over-Refusal)" 실패: 평범한 사람이 무해한 질문을 합니다. "답변" 로봇은 도움을 주고 싶어 하지만, "안전" 경비원이 과도하게 의심하여 "멈춰!"라고 너무 크게 외쳐 로봇이 책이 안전함에도 불구하고 책을 건네는 것을 거부합니다.

기존의 해결책 (벡터 조향):
이전 방법들은 "답변" 로봇의 단일 "볼륨 노브"를 조절함으로써 이를 해결하려 했습니다.

  • 볼륨을 낮추면, 로봇이 위험한 책을 덜 건네게 됩니다 (재일브레이크 감소). 하지만 동시에 안전한 책도 덜 건네게 됩니다 (과도한 거부 증가).
  • 볼륨을 높이면, 더 많은 책을 건네지만, 이제 위험한 책도 실수로 건네게 됩니다.
  • 핵심: 이길 수 없습니다. 하나의 노브만 조절해서는 도움이 되면서 동시에 안전한 로봇을 만들 수 없습니다.

새로운 해결책: LLM-VA (벡터 정렬)

저자 하난장 (Haonan Zhang) 과 그의 팀은 이 사서를 고치는 새로운 방법을 제안합니다: 두 뇌가 서로 대화하게 만드십시오.

볼륨 노브를 돌리는 대신, 그들은 물리적으로 "답변" 로봇의 뇌를 "안전" 경비원의 뇌와 정렬 (align) 시킵니다.

그들이 이를 수행하는 방식을 간단한 비유로 설명하면 다음과 같습니다:

  1. 뇌 매핑: 그들은 SVM 이라는 도구 (매우 정밀한 스캐너라고 생각하십시오) 를 사용하여 모델의 마음속에서 답변을 결정하는 정확한 "방향"과 무해함을 결정하는 "방향"을 찾습니다.
  2. 정렬: 그들은 수학적 "수술" (폐형 가중치 업데이트 사용) 을 수행하여 "답변" 방향이 "안전" 방향을 가리키도록 회전시킵니다.
  3. 결과: 이제 사서의 답변 의지는 안전 점검에 인과적으로 의존하게 됩니다.
    • 안전 경비원이 "이것은 안전하다"고 말하면, 답변 로봇은 이제 기하학적으로 강제되어 "네, 답변하겠습니다"라고 말합니다.
    • 안전 경비원이 "이것은 위험하다"고 말하면, 답변 로봇은 이제 기하학적으로 강제되어 "아니요, 답변하지 않겠습니다"라고 말합니다.

이것이 중요한 이유

  • 무거운 작업 불필요: 모델을 처음부터 다시 학습시키는 (사서에게 새로운 언어를 가르치는 것과 같은) 다른 방법들과 달리, 이 방법은 기존 가중치만 미세하게 조정합니다. 새로운 뇌를 주는 것이 아니라 사서에게 새로운 안경을 끼워 주는 것과 같습니다.
  • 자동 조정: 이 방법은 사서가 무엇을 필요로 하는지 스스로 파악할 만큼 똑똑합니다.
    • 사서가 너무 무모하다면 (재일브레이크가 자주 발생한다면), 정렬이 안전 고삐를 더 꽉 조입니다.
    • 사서가 너무 겁이 많다면 (모든 것을 거부한다면), 정렬이 도움이 될 만큼 고삐를 적당히 느슨하게 풉니다.
  • 결과: 그들은 이 방법을 12 가지 다른 AI 모델에서 테스트했습니다. 새로운 방법은 이전 방법들보다 훨씬 더 잘 트레이드오프 문제를 해결했습니다 ("F1 점수"를 11.45% 향상시켰으며) 사서의 일반 지식과 유용성을 거의 그대로 유지했습니다 (유용성의 95.92% 보존).

요약

이 논문은 현재의 AI 안전 방법들이 가스 페달만 조절하여 차를 고치려는 시도와 같다고 주장합니다. 페달을 덜 밟으면 속도가 느려지지만 목적지에 도달하지 못할 수 있고, 더 밟으면 빠르게 가지만 추락할 수 있습니다.

LLM-VA는 가스 페달을 직접 핸들에 연결함으로써 이를 고칩니다. 이제 도로가 안전 (안전) 할 때만 앞으로 나아갈 수 있습니다 (답변). 도로가 막혀 있다면, 페달을 얼마나 밟든 차는 움직이지 않습니다. 이로 인해 AI 는 엔진을 재건할 필요 없이 더 안전하고 더 유용해집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →