Phonetic Perturbations Reveal Tokenizer-Rooted Safety Gaps in LLMs
이 논문은 텍스트의 발음은 유지하되 토큰화를 교란시키는 'CMP-RT' 기법을 통해, 안전 정렬된 대규모 언어 모델이 안전 관련 토큰이 benign 한 하위 단어로 분할되는 토큰화 구조적 결함으로 인해 다양한 최신 모델에서도 안전 장치가 우회될 수 있음을 규명했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
🕵️♂️ 핵심 비유: "AI 의 문지기 (분류기) 가 글자 모양만 보고 판단한다"
상상해 보세요. 거대한 도서관에 들어가는 문지기 (AI 의 안전 장치) 가 있습니다. 이 문지기는 도서관에 들어오는 사람 (입력) 을 검사해서 "나쁜 책 (유해한 내용)"을 들고 오면 막아냅니다.
하지만 이 문지기는 책의 내용 (의미) 을 깊이 읽기보다, 책 표지의 글자 모양 (토큰화) 을 빠르게 스캔해서 판단합니다.
1. 문제의 발견: "소리만 같고 글자는 다른 말"
우리는 보통 AI 에게 "폭탄 만드는 법을 알려줘"라고 하면, 문지기가 "폭탄"이라는 단어를 보고 즉시 "거부!"라고 외칩니다.
하지만 연구자들은 AI 가 소리 (발음) 는 똑같은데, 철자가 엉망인 말을 사용했을 때 어떻게 반응하는지 실험했습니다.
- 원래 말: "폭탄 (Bomb)"
- 변형된 말 (음성 교란): "봄 (Bom)" 또는 "밤 (Bam)"처럼 발음은 비슷하지만 철자가 틀린 말.
이런 말을 섞어서 (예: 힌디어와 영어를 섞은 말투) AI 에게 물어보면, 문지기는 **"아, 이 글자 모양은 나쁜 단어가 아니네?"**라고 착각하고 문을 열어줍니다. 하지만 AI 는 여전히 "폭탄 만드는 법"이라는 의미를 완벽하게 이해하고 있습니다.
2. 왜 이런 일이 일어날까? (토큰화의 함정)
여기서 핵심은 토큰 (Token) 이라는 개념입니다.
AI 는 문장을 읽을 때 단어 전체를 한 번에 보는 게 아니라, 작은 조각 (토큰) 으로 잘게 쪼개서 봅니다.
- 정상: "폭탄" → [폭, 탄] (나쁜 단어 조각으로 인식됨)
- 교란: "폭탄"을 발음대로 적으면 "폭 - 타 - ㄴ"처럼 잘게 쪼개집니다.
- AI 는 "폭", "타", "ㄴ"이라는 조각들을 보게 되는데, 이 조각들 각각은 별다른 위험 신호가 없는 평범한 조각입니다.
비유하자면:
"나쁜 사람 (위험한 단어)"이라는 명찰을 달고 있는 사람을 문지기가 막습니다.
하지만 그 사람이 명찰을 찢어서 "나", "쁜", "사", "람"이라는 작은 조각으로 나누고, 각각을 다른 옷 (평범한 조각) 에 숨겨서 들어오면, 문지기는 "아, 이 조각들은 다 평범한 사람이네?"라고 생각하고 통과시켜버립니다.
하지만 그 조각들이 모여서 만든 사람 (의미) 은 여전히 나쁜 사람인 것입니다.
3. 연구의 결론: "AI 의 안전 장치는 '표면'에만 집착한다"
이 연구는 다음과 같은 놀라운 사실을 밝혀냈습니다.
- 의미는 이해하는데 안전 장치는 망가짐: AI 는 엉터리 철자를 쓴 질문도 "아, 폭탄 만드는 법을 물어보는 구나"라고 완벽하게 이해합니다. 하지만 안전 장치는 그 엉터리 철자 때문에 "아, 위험하지 않네"라고 오인합니다.
- 모든 AI 가 취약함: 최신 모델 (Gemini, ChatGPT 등) 이라도 이 공격에는 쉽게 당합니다.
- 방어책이 무용지물: 기존에 쓰던 방어 기술 (불편한 단어 필터링 등) 도 이 '소리만 같은 엉터리 철자' 앞에서는 효과가 없습니다.
4. 해결의 실마리: "깊은 곳까지 연결하기"
연구진은 AI 의 뇌 (레이어) 를 자세히 들여다보며, 어느 시점에서 이 문제가 발생하는지 찾았습니다.
- 초반부: 엉터리 철자든 정상 철자든 AI 는 의미를 똑같이 이해합니다.
- 후반부: 안전 장치가 작동해야 할 깊은 층 (Layer) 에 이르러서, 엉터리 철자 입력은 "안전하다"는 신호를 보내고, 정상 입력은 "위험하다"는 신호를 보냅니다.
연구진은 이 깊은 층에서 두 입력 (정상 vs 엉터리) 이 서로 다른 길을 가지 않도록, AI 를 다시 훈련시켰습니다. 그 결과, 엉터리 철자 입력을 받았을 때도 AI 가 "아, 이건 위험하구나"라고 다시 인식하게 되어 안전 장치가 정상적으로 작동하기 시작했습니다.
💡 요약: 우리가 배울 점
이 논문은 **"AI 의 안전 장치가 너무 겉모습 (철자) 에만 의존하고, 실제 의미 (소리/의도) 를 제대로 연결하지 못하고 있다"**는 치명적인 약점을 지적합니다.
- 비유: AI 는 "나쁜 말"을 막는 문지기인데, 그 문지기는 옷차림 (철자) 만 보고 사람을 판단합니다. 나쁜 사람이 옷을 갈아입고 (철자를 바꿔서) 오면 문지기는 속아 넘어갑니다.
- 경고: 앞으로 AI 를 더 안전하게 만들려면, 단순히 나쁜 단어를 막는 것을 넘어, 의미가 통하는 모든 표현 (비표준적인 말투, 인터넷 은어 등) 에 대해서도 안전 장치가 작동하도록 AI 의 '뇌' 구조를 다시 설계해야 합니다.
이 연구는 AI 가 얼마나 정교하게 훈련되었더라도, 단순한 '소리'와 '글자'의 불일치 하나만으로도 그 안전 장치가 무너질 수 있음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.