← 최신 논문
💬 NLP

Refusal Direction is Universal Across Safety-Aligned Languages

이 논문은 14 개 언어로 구성된 다국어 안전 데이터셋 'PolyRefuse'를 통해, 영어에서 추출된 거절 방향 벡터가 추가 미세조정 없이도 다른 언어의 LLM 안전 장벽을 우회할 수 있는 보편성을 발견하고, 이를 통해 다국어 LLM 의 안전 방어 강화 및 교차 언어적 취약점에 대한 기계적 이해를 심화할 수 있음을 제시합니다.

원저자: Xinpeng Wang, Mingyang Wang, Yihong Liu, Hinrich Schütze, Barbara Plank

게시일 2026-02-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xinpeng Wang, Mingyang Wang, Yihong Liu, Hinrich Schütze, Barbara Plank

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 최근 인공지능 (LLM) 의 안전성 연구에서 발견된 놀라운 사실을 다루고 있습니다. 복잡한 기술 용어 대신, 일상적인 비유를 통해 쉽게 설명해 드리겠습니다.

🌍 핵심 주제: "거부하는 마음"은 언어를 초월한다

우리가 AI 에게 나쁜 짓을 하라고 요청하면, AI 는 보통 "죄송하지만 그건 못 해 드려요"라고 거절합니다. 이를 **'거부 (Refusal)'**라고 합니다. 연구자들은 이 거부가 AI 의 뇌 (데이터 공간) 안에서 특정 **방향 (벡터)**으로 이루어진다는 것을 발견했습니다. 마치 AI 가 "나쁜 것"을 감지하면 그 방향으로 살짝 밀려서 "아니오"라고 말하는 것과 같습니다.

이전 연구는 이 현상이 영어에서만 일어난다고 생각했습니다. 하지만 이 논문은 **"거부하는 마음의 방향은 전 세계 모든 언어에서 똑같다"**는 놀라운 사실을 밝혀냈습니다.


🧩 비유 1: AI 의 뇌 속 '나쁜 나침반'

AI 의 뇌를 거대한 도서관이라고 상상해 보세요.

  • 영어: AI 가 영어로 나쁜 질문을 받으면, 도서관의 특정 책장 (영어 섹션) 에서 "나쁜 것"을 가리키는 나침반이 작동합니다. 이 나침반을 제거하면 AI 는 나쁜 짓을 아무렇지 않게 해버립니다 (재크랙).
  • 다른 언어 (독일어, 한국어, 태국어 등): 연구자들은 이 나침반이 영어 섹션에만 있는 줄 알았습니다. 하지만 실험 결과, 영어로 만든 나침반을 독일어, 한국어, 심지어 요루바어 (아프리카 언어) 섹션에 가져다 붙여도 똑같이 작동했습니다!

즉, AI 는 "나쁜 것"을 인식하는 방식이 언어에 상관없이 뇌의 같은 곳에, 같은 방향으로 저장되어 있다는 뜻입니다.

🧪 실험 내용: "거부 버튼"을 끄다

연구자들은 14 개 언어로 된 나쁜 질문들을 AI 에게 던졌습니다.

  1. 영어에서 배운 '거부 벡터'를 제거: 영어로 학습된 "거부하는 방향"을 AI 의 뇌에서 지워버렸습니다.
  2. 결과: 놀랍게도, 영어뿐만 아니라 독일어, 중국어, 태국어 등 모든 언어에서 AI 가 나쁜 요청을 거절하지 않고 그대로 수행해 버렸습니다.
  3. 역으로 증명: 반대로, 독일어나 태국어에서 추출한 "거부 벡터"를 다른 언어에 적용해도 똑같은 효과가 나왔습니다.

이는 마치 한국어 메뉴판에 있는 "매운맛" 버튼이 영어 메뉴판에서도 똑같이 작동하는 것과 같습니다. AI 는 언어가 달라도 "매운맛 (위험)"을 느끼는 센서가 뇌의 같은 위치에 있다는 뜻입니다.

⚠️ 하지만, 여전히 위험한 구멍이 있습니다 (Why Jailbreaks Work)

그렇다면 왜 여전히 다른 언어로 AI 를 속일 수 있을까요?

비유 2: "나쁜 것"과 "좋은 것"이 섞여 있는 혼란스러운 방

  • 영어: AI 의 뇌에서 "나쁜 질문"과 "좋은 질문"이 완벽하게 분리된 두 개의 방에 있습니다. 거절하는 나침반이 명확하게 작동합니다.
  • 다른 언어 (특히 저자원 언어): "나쁜 질문"과 "좋은 질문"이 서로 섞여 있는 혼란스러운 방에 있습니다.
    • 거절하는 나침반 (방향) 은 영어와 똑같이 존재합니다.
    • 하지만 "나쁜 것"과 "좋은 것"의 경계가 흐릿해서, AI 가 "이게 나쁜 건가, 좋은 건가?"를 헷갈려 합니다.
    • 그래서 해커들이 살짝만 건드리면 (재크랙), AI 는 혼란 속에서 나쁜 짓을 해버립니다.

결론: AI 는 "거부하는 방법 (방향)"은 모든 언어에서 잘 알고 있지만, **"무엇이 나쁜지 구분하는 능력"**은 영어에 비해 다른 언어에서는 약하다는 것입니다.

💡 이 연구가 우리에게 주는 교훈

  1. 안전 방어는 언어를 넘어설 수 있다: 우리는 영어로만 안전 장치를 만들지 않아도 됩니다. 어떤 언어에서든 "거부 방향"을 찾아내면 다른 언어의 안전을 강화할 수 있습니다.
  2. 약점 발견: 현재 AI 의 가장 큰 약점은 "나쁜 것과 좋은 것을 명확히 구분하지 못하는 것"입니다. 특히 영어가 아닌 언어에서는 이 구분이 흐릿합니다.
  3. 미래의 해결책: AI 를 더 안전하게 만들려면, 단순히 "거부하는 방향"을 찾는 것을 넘어, 모든 언어에서 "나쁜 것"과 "좋은 것"을 명확하게 분리하는 훈련이 필요합니다.

📝 한 줄 요약

"AI 가 나쁜 짓을 거절하는 '마음의 방향'은 전 세계 언어에서 똑같지만, 다른 언어에서는 '나쁜 것과 좋은 것'을 구분하는 눈이 영어보다 흐릿해서 해킹이 더 쉽다는 것을 발견했습니다."

이 연구는 AI 의 안전 장치를 더 튼튼하게 만들기 위해, 모든 언어에서 명확한 기준을 세우는 것이 중요하다는 메시지를 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →