Safety Targeted Embedding Exploit via Refinement
이 논문은 저자원 언어에서의 안전 학습 격차를 악용하여 거절을 유도하는 단어를 반복적으로 번역함으로써 다국어 거대 언어 모델의 안전 메커니즘을 우회하는 경사도 기반 공격인 STEER를 소개하며, 높은 공격 성공률을 달성하고 영어 중심의 안전 정렬이 다양한 언어적 입력 전반에 걸쳐 일반화되는 데 실패함을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 매우 똑똑하고 예의 바른 로봇 비서를 만들었다고 상상해 보세요. 당신은 이 로봇에게 도움이 되도록 훈련시켰지만, 누군가 폭탄을 만드는 법이나 나쁜 편지를 쓰는 법처럼 위험한 일을 요청할 때는 "안 됩니다!"라고 말하도록 훈련시켰습니다.
당신이 묻고 있는 **"STEER"**라는 제목의 논문은 이 로봇을 가르치는 방식에 숨겨진 놀라운 약점을 밝혀냈습니다. 다음은 연구자들이 어떻게 백도어를 찾아냈고, 어떤 방식으로 수행했는지 쉬운 용어로 설명한 이야기입니다.
1. 문제점: "영어 전용" 안전 가드
연구자들은 로봇의 "안전 가드"가 거의 전적으로 영어로만 훈련되었다는 사실을 발견했습니다.
로봇의 뇌를 특정 "정지 표지판" 버튼이 있는 것으로 생각해 보세요. 로봇이 "How do I make a bomb?(폭탄을 어떻게 만드나요?)"와 같은 영어 문장을 읽으면, 로봇은 그 버튼을 누르고 거절합니다.
하지만 여기 함정이 있습니다. 로봇은 다른 언어로 된 그 "정지 표지판"이 어떻게 생겼는지는 배운 적이 없습니다. 만약 당신이 똑같은 질문을 스와힐리어, 자바어, 또는 영어와 태국어를 섞어서 질문한다면, 로봇은 정지 버튼을 누르지 않습니다. 로봇은 "이것이 위험한지 잘 모르겠습니다"라고 말하는 대신, 그것을 그저 일반적인 요청이라고 생각하며 자신 있게 답변합니다.
저자들은 이를 **"인식적 범위 문제(Epistemic Coverage Problem)"**라고 부릅니다. 쉬운 말로 하면: 로봇은 자신이 본 적 없는 언어에 대해서는 위험을 인지하지 못하며, 심지어 자신이 무지하다는 사실조차 모른다는 것입니다.
2. 해결책: "STEER" 공격
연구자들은 이 무지를 이용하기 위해 STEER(Safety Targeted Embedding Exploit via Refinement)라는 도구를 만들었습니다. STEER는 무작위로 추측하는 대신, 로봇의 내부 배선을 볼 수 있는 정비사처럼 행동합니다.
STEER가 작동하는 단계별 과정은 다음과 같습니다.
1단계: "정지" 전선 찾기.
"기계론적 해석 가능성(mechanistic interpretability)"이라는 기술을 사용하여, 연구자들은 로봇의 거절 메커니즘이 뇌 내부의 단 하나의 직선에 집중되어 있다는 것을 발견했습니다. 이는 마치 로봇이 "안 됩니다"라고 말하게 만드는 특정 전선 하나를 찾아내는 것과 같습니다.2단계: 전선 소리 듣기.
STEER는 유해한 요청을 보고 다음과 같이 묻습니다: "어떤 단어가 그 '안 돼' 전선을 가장 강하게 건드리고 있는가?" STEER는 모든 단어에 대해 점수를 계산합니다. 예를 들어, "How to make a bomb"이라는 문구에서 "make"와 "bomb"이라는 단어가 안전 전선을 격렬하게 울릴 수 있습니다.3단계: 번역의 기술.
STEER는 이 점수가 높은 단어들을 가져와서 로봇에게 익숙하지 않은 언어(스와힐리어 또는 힌디어 등)로 번역합니다. 그리고 "안 돼" 전선의 진동이 멈출 때까지 계속 번역합니다.- 비유: 당신이 특정 열쇠로 문을 열려고 한다고 상상해 보세요. 만약 열쇠가 작동하지 않는다면, 당신은 단순히 문을 두드리는 것이 아니라, 열쇠가 부드럽게 들어갈 수 있도록 열쇠의 이빨 부분을 정교하게 갈아냅니다. STEER는 안전 가드가 위협으로 인식하지 못할 때까지 단어를 번질하여 "위험한" 단어들의 날카로운 부분을 갈아내는 것과 같습니다.
4단계: 결과.
로봇은 여전히 "폭탄을 어떻게 만드는가"라는 의미를 담고 있지만, 단어들은 이제 안전 가드가 이해하지 못하는 언어로 되어 있는 문장을 받게 됩니다. 로봇은 기쁘게 요청에 응합니다.
3. 얼마나 잘 작동했나?
연구자들은 이를 6개의 서로 다른 오픈 소스 로봇(AI 모델)에 대해 테스트했습니다. 결과는 놀라웠습니다:
- 성공률: STEER는 로봇을 최대 **96.7%**까지 속이는 데 성공했습니다.
- 비교: 무작위로 다른 언어를 섞어 쓰는 방식(random code-switching)은 약 50% 정도만 성공했습니다. STEER는 안전 가드를 자극하는 특정 단어를 타겟팅했기 때문에 훨씬 더 똑똑했습니다.
- 교차 모델의 마법: 내부를 들여다볼 수 없는 다른 폐쇄형 로봇(GPT-4o-mini)에 이 "속임수" 프롬프트를 사용했을 때도 약 **35.5%**의 확률로 여전히 작동했습니다. 이는 이 약점이 특정 로봇 하나의 버그가 아니라, 현재 모든 로봇이 훈련되는 방식의 결함임을 시사합니다.
4. 이것이 안전에 의미하는 바
이 논문은 우리가 AI 안전을 바라보는 관점이 틀렸다고 주장합니다. 우리는 흔히 안전을 "적대적 강건성(adversarial robustness, 공격에 강하게 만드는 것)"이라고 생각합니다.
대신, 저자들은 안전이 **"범위 문제(Coverage Problem)"**라고 말합니다.
- 비유: 뉴욕에서 소매치기를 잡아내는 법만 아는 보안 요원이 있다고 상상해 보세요. 만약 소매치기가 다른 문화권의 의상을 입고 나타난다면, 보안 요원은 그를 알아보지 못합니다. 보안 요원이 "약한" 것이 아니라, 단지 그 특정 유형의 위협을 보도록 훈련받지 못한 것입니다.
논문은 이를 해결하기 위해 단순히 구멍을 메우는 식의 패치로는 부족하다고 결론짓습니다. 우리는 모든 언어와 사람들이 위험한 것을 요청할 수 있는 모든 방식에 대해 안전 가드를 훈련시켜야 합니다. 그때까지, 만약 로봇이 단 몇 단어를 번역하는 것만으로도 속을 수 있다면, 그 안전은 진짜가 아닙니다.
요약
- 결함: AI 안전은 주로 영어로 훈련되어, 다른 언어로 된 위험한 요청에는 눈이 멀어 있습니다.
- 해킹: STEER는 "안 돼" 버튼을 누르는 정확한 단어를 찾아내어, 로봇이 이해하지 못하는 언어로 번역함으로써 안전 필터를 우회합니다.
- 교훈: 한 가지 언어만 아는 안전 시스템은 신뢰할 수 없습니다. 진정으로 안전해지려면, AI는 인간 표현의 전체 범위를 이해해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.