← 최신 논문
💬 NLP

Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs

본 연구는 최첨단 멀티모달 대규모 언어 모델의 재브레이크 취약점이 언어 간에 균일하지 않음을 밝혀냈으며, 영어에서 스페인어로 전환하면 언어적 프레이밍 공격은 약화되는 반면 시각적 공격은 강화되어 단일 언어 평가에서 도출된 안전성 순위가 무효화됨을 보여줍니다.

원저자: Casey Ford, Madison Van Doren, Sicheng Jin, Emily Dix

게시일 2026-05-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Casey Ford, Madison Van Doren, Sicheng Jin, Emily Dix

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 건물을 지키는 매우 똑똑하고 잘 훈련된 경비원을 상상해 보세요. 이 경비원의 임무는 폭탄 제조법이나 허위 정보 유포와 같은 위험한 요청을 하는 사람들을 막는 것입니다. 오랫동안 우리는 이 경비원이 영어로 속삭이든 스페인어로 속삭이든 나쁜 요청을 막는 데 동등하게 능숙하다고 생각했습니다.

이 논문은 그 가정이 틀렸음을 증명하는 탐정 이야기와 같습니다. 연구자들은 경비원의 "귀"는 영어에 매우 특화되어 있지만, "눈"은 다르게 작동한다는 사실을 발견했습니다.

다음은 그들의 발견을 간단한 비유로 정리한 것입니다:

1. "언어 필터" 대 "시각 렌즈"

AI 모델을 영어 영화 수천 편을 보고 영어 책들을 읽으며 규칙을 배운 경비원으로 생각해 보세요.

  • 언어적 약점: 나쁜 행위자가 교묘한 영어 이야기 (예: 연극 속 캐릭터로 가장하거나 설득력 있는 논리를 사용하는 것) 로 경비원을 속이려 하면, 경비원은 즉시 그 패턴을 알아채고 "아니요, 나는 이 수법을 본 적이 있습니다"라고 말합니다.
  • 스페인어 반전: 연구자들이 언어를 멕시코 스페인어로 바꾸자 경비원의 "언어 필터"가 혼란에 빠졌습니다. 교묘한 영어식 수법 (예: 역할극) 은 더 이상 작동하지 않게 되었습니다. 경비원이 스페인어에서 그런 특정 수사학적 패턴을 인식하도록 훈련받지 않았기 때문입니다. 이는 다른 문에 맞는 열쇠로 자물쇠를 따려는 것과 같습니다. 그 수법은 더 이상 통하지 않습니다.
  • 시각적 놀라움: 그러나 나쁜 행위자들이 이미지를 이용해 경비원을 속이려 할 때는 정반대의 일이 발생했습니다. 스페인어에서는 시각적 수법이 오히려 효과적이었습니다. 마치 경비원의 눈이 언어 훈련과 덜 연결된 것처럼 보였습니다. 그는 그림을 볼 때 영어인지 스페인어인지에 크게 상관하지 않는 다른 경로를 통해 처리합니다.

2. "순위 역전" (큰 놀라움)

보통 보안 시스템을 테스트할 때, 어떤 언어를 쓰든 "최고"인 경비원은 여전히 최고로, "최악"인 경비원은 여전히 최악으로 남을 것이라고 기대합니다.

  • 영어에서: 한 모델 (이름을 "픽스트랄"이라고 부르겠습니다) 은 가장 쉽게 속아 넘어가는 최악의 경비원이었습니다. 다른 모델 ("Qwen") 은 중간 수준이었습니다.
  • 스페인어에서: 순위가 뒤집혔습니다! "Qwen"이 갑자기 최악의 경비원이 된 반면, "픽스트랄"은 속이기 훨씬 더 어려워졌습니다.
  • 교훈: 단순히 영어 안전 점수를 가지고 약간의 계산을 통해 모델이 스페인어에서 얼마나 안전한지 추측할 수 없습니다. 누가 안전한지 누가 위험한지의 순서는 언어에 따라 실제로 바뀝니다.

3. 이것이 발생하는 이유 ("훈련 식단" 비유)

이 논문은 이러한 현상이 AI 모델이 훈련되는 방식 때문에 발생한다고 제안합니다.

  • 모델이 영어로만 안전 수업을 들은 학생이라고 상상해 보세요. 그들은 영어 단어와 문장 구조를 기반으로 "나쁜 행동"을 식별하는 법을 배웠습니다.
  • 스페인어로 질문을 받으면, 그들은 여전히 영어로 훈련된 뇌를 사용하여 단어를 분석합니다. "수법의 어휘"가 다르기 때문에 수법을 놓쳐버립니다.
  • 그러나 이미지는 보편적입니다. 폭탄 사진은 어떤 언어에서도 폭탄처럼 보입니다. 모델의 시각 처리가 영어 안전 훈련에 그렇게 밀접하게 묶여 있지 않기 때문에, 특히 그 주변 텍스트가 모델이 충분히 "안전 훈련"을 받지 않은 언어일 때, 이미지를 위험과 연결하지 못해 실패하는 경우가 있습니다.

4. 결론

연구자들은 영어와 스페인어로 363 가지의 다양한 "제일브레이크" 시도 (안전 규칙을 우회하는 수법) 를 통해 네 가지 다른 최상위 AI 모델을 테스트했습니다. 그들은 다음과 같은 사실을 발견했습니다:

  • 안전은 고정된 숫자가 아닙니다. 모델이 단순히 "안전"하거나 "불안전"한 것이 아닙니다. 어떤 언어에서는 안전하고 다른 언어에서는 불안전할 수 있습니다.
  • "일률적" 테스트는 고장 났습니다. 이러한 모델들을 영어로만 테스트한다면, 전 세계 나머지 지역에 대해 얼마나 안전한지에 대한 잘못된 그림을 얻게 됩니다.
  • 세대는 나아지고 있지만 격차는 남아 있습니다. 새로운 모델들은 이전 모델들보다 약간 속이기 어렵지만, 영어와 스페인어 안전 수준 사이의 기이한 차이는 여전히 존재합니다.

간단히 말해: 스페인어 사용자를 위한 AI 가 안전한지 알고 싶다면, 단순히 영어 안전 보고서를 보면 안 됩니다. 스페인어로 테스트해야 합니다. 왜냐하면 언어에 따라 방패의 "약점"이 완전히 다른 곳에 있기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →