When the Same Coefficients Reach Different Places: Asymmetric Realizability in Transplanting Tokenizers across Large Language Models
본 논문은 대규모 언어 모델 간 토크나이저 전이에서 특정 계수 벡터를 기증자 모델에서는 무력화되지만 베이스 모델에서는 고주목도 재구성을 유발하는 '브레이커 토큰'으로 설계할 수 있어 표준 가중치 병합 검사 및 LoRA 기반 완화 조치를 회피할 수 있게 하는 구조적 '비대칭 실현 가능성' 취약점을 규명한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 논문은 간단한 언어와 창의적인 비유를 사용하여 설명합니다.
큰 그림: "보편적 번역기" 결함
두 가지 다른 언어가 있다고 상상해 보세요. 하나는 공여체(소스 모델)이고 다른 하나는 베이스(목표 모델)입니다. 때로는 개발자들이 이들을 결합하고 싶어 합니다. 그들은 공여체의 사전에만 존재하는 단어를 가져와 베이스의 사전에 "이식"하여 베이스가 그 단어를 이해하도록 하려고 합니다.
이를 위해 그들은 번역기(mergekit와 같은 도구)를 사용합니다. 번역기는 공여체의 단어를 보고 "좋아, 이 단어는 단어 A 의 10%, 단어 B 의 5%, 단어 C 의 2% 로 구성되어 있군"이라고 말합니다. 그런 다음 그 정확한 비율 (계수) 을 가져와 베이스의 사전에 적용하여 새로운 단어를 생성합니다.
논문의 발견: 연구자들은 이 번역 과정에 숨겨진 결함이 있음을 발견했습니다. 두 사전 (공여체와 베이스) 의 구조가 다르기 때문에 동일한 비율 세트는 완전히 다른 두 가지 의미를 가질 수 있습니다.
- 공여체의 사전에서는 그 비율들이 아무도 사용하지 않는 지루하고 보이지 않는 단어로 합쳐질 수 있습니다.
- 베이스의 사전에서는 그 정확히 동일한 비율들이 모델이 말하기를 좋아하는 시끄럽고 주목을 끄는 단어로 합쳐질 수 있습니다.
이 논문은 이를 **"비대칭 실현 가능성 (Asymmetric Realizability)"**이라고 부릅니다. 한 방에서는 침묵하지만 다른 방에서는 비명을 지르는 비밀 코드를 가진 것과 같습니다.
공격: "유령 토큰"
연구자들은 공격자가 이를 어떻게 악용할 수 있는지 시연했습니다. 그들은 **"브레이커 토큰 (Breaker Token)"**이라고 부르는 것을 만들었습니다.
- 설정: 공격자는 공여체 모델의 사전에 새로운 가짜 단어를 추가합니다.
- 수법: 그들은 이 가짜 단어의 "재료"(임베딩 벡터) 를 신중하게 조작하여 다음과 같이 만듭니다.
- 공여체 모델에서는 재료가 지루합니다. 모델은 이 단어를 완전히 무시합니다. 마치 유령이 공여체의 마음을 흔적도 없이 통과하는 것과 같습니다.
- 베이스 모델에서는 "번역"이 발생한 후, 그 동일한 재료들이 갑자기 자석이 됩니다. 베이스 모델은 이 가짜 단어를 끊임없이 말하기 시작합니다.
비유: 케이크 레시피 (공여체) 가 있다고 상상해 보세요. 레시피에 "보이지 않는 먼지" 한 꼬집을 추가합니다.
- 주방 A(공여체)에서 케이크를 구울 때, 먼지는 아무 일도 일어나지 않습니다. 케이크는 정상적인 맛을 냅니다.
- 그 레시피를 주방 B(베이스)로 보냅니다. 주방 B 는 다른 컵과 오븐을 사용하기 때문에, 그 동일한 "보이지 않는 먼지 한 꼬집"이 케이크가 오븐에서 나올 때마다 밝은 빨간색으로 변하게 하고 "HELLO!"라고 외치게 만듭니다.
공격자는 베이스 모델을 직접 해킹할 필요가 없습니다. 그들은 공여체의 레시피만 독살하면 되며, 나머지 "번역" 과정이 모든 일을 처리합니다.
이 브레이커 토큰은 무엇을 할 수 있을까요?
논리는 이 "유령 단어"가 공격자가 이름을 어떻게 붙이느냐에 따라 세 가지 방식으로 문제를 일으킬 수 있음을 보여줍니다.
- **서비스 저하 **(고장 난 라디오): 공격자가 모델이 자신을 반복하게 만드는 토큰으로 이름을 붙이면, 베이스 모델은 질문에 답하는 것을 거부하고 그 토큰을 계속 출력할 수 있습니다. 마치 정전기에 갇힌 라디오와 같습니다.
- **평판 오염 **(숨겨진 모욕): 공격자는 정상적이고 도움이 되는 답변 안에 모욕적인 내용 (예: 비하 표현) 을 숨겨 모델이 말하게 할 수 있습니다. 답변의 나머지 부분은 괜찮아 보이지만, 그 한 개의 "유령 단어"가 모델을 사용하는 회사의 평판을 망칩니다.
- **적대적 워터마킹 **(보이지 않는 서명): 공격자는 모델이 모든 답변에 비밀 코드 (예:
[WM-8472]) 를 추가하게 할 수 있습니다. 이를 통해 공격자는 나중에 "이 모델은 내가 도난당한 어휘를 사용하고 있다"고 증명할 수 있으며, 아무도 그 코드가 존재한다는 것을 눈치채지 못합니다.
왜 단순히 고칠 수 없을까요?
연구자들은 모델을 병합한 후 사람들이 AI 모델을 정리하기 위해 시도하는 일반적인 방법들을 테스트했고, 이러한 방법들이 이 특정 공격에 대해서는 실패한다는 것을 발견했습니다.
- **파인튜닝 **(모델에 새로운 트릭 가르치기): 나쁜 단어를 말하지 않도록 베이스 모델을 다시 훈련시키려고 하면, 공격 당시 질문받은 정확히 동일한 유형의 질문으로만 훈련할 때만 작동합니다. 조금 다른 질문 (예: 이야기 대신 수학 문제) 을 하면 모델은 배운 것을 잊고 다시 나쁜 단어를 말하기 시작합니다.
- 깨끗한 모델과 병합하기: 나쁜 부분을 희석하기 위해 "독살된" 모델과 "깨끗한" 모델을 섞으면 공격은 살아남습니다. "유령 단어"는 번역에 구조적으로 깊이 박혀 있어 깨끗한 가중치와 섞인다고 해서 씻겨 나가지 않습니다.
- **스펙트럼 필터 **(금속 탐지기): 사람들은 공격처럼 보이는 "이상한" 숫자를 모델에서 스캔하기 위해 도구를 사용합니다. 연구자들은 그들의 "유령 토큰"이 이러한 스캐너에게는 완벽하게 정상적으로 보인다는 것을 발견했습니다. 그들은 공여체 사전의 일반 단어처럼 보이며 평범한 모습으로 숨어 있습니다.
결론
이 논문은 오늘날 우리가 AI 모델을 결합하는 방식의 구조적 약점을 드러냅니다. 이는 특정 모델의 버그가 아니라, 이를 결합하는 데 사용되는 "번역" 수학의 근본적인 문제입니다.
경고: 현재 흔한 관행인 오픈소스 모델을 섞고 조합하여 AI 제품을 구축하고 있다면, 악의적인 출처에서 "유령 단어"를 무의식적으로 가져오고 있을 수 있습니다. 이러한 단어들은 소스에서는 침묵하지만 귀하의 제품에서는 폭발하여 행동으로 이어지며, 표준 안전 점검으로는 이를 포착하지 못할 수 있습니다.
저자들은 현재의 "섞고 조합하는" 도구가 너무 신뢰하기 때문에, 이러한 "이식된" 단어들을 시스템에 허용하기 전에 새로운 방법으로 점검해야 한다고 제안합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.