← 최신 논문
💬 NLP

Exploring Adversarial Robustness and Safety Alignment in Multilingual Multi-Modal Large Language Models

이 논문은 다국어 멀티모달 거대 언어 모델들이 교차 언어적 적대적 취약성을 보이는 반면, 저자원 언어에서 나타나는 이들의 외견상 안전성은 흔히 시각 및 이해 실패의 결과물("실패에 의한 안전성")인 데 반해, 훈련 전반에 걸쳐 깊은 다국어 통합을 이룬 모델들은 진정한 교차 언어적 안전 정렬을 달성한다는 점을 밝히고 있다.

원저자: Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

게시일 2026-06-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하고, 눈(카메라처럼)으로 보고 생각(인간처럼)할 수 있는 로봇 집단을 상상해 보세요. 이들은 멀티모달 거대 언어 모델(MLLM)이라고 불립니다. 이들은 사진을 보고 묘사하거나, 본 것에 대해 질문에 답하는 데 매우 뛰어납니다.

하지만 인간과 마찬가지로, 이 로봇들도 속임수에 넘어갈 수 있습니다. 이 논문은 이 로봇들이 얼마나 쉽게 속을 수 있는지에 대한 대규모 조사이며, 특히 12가지 다른 언어로 말하고 이해하는 능력을 중점적으로 다룹니다.

연구자들이 발견한 내용을 알기 쉽게 설명하면 다음과 같습니다.

1. "보편적 결함" (적대적 공격)

연구자들은 인간의 눈에는 보이지 않는 아주 미세하고 투명한 흠집(오래된 TV의 노이즈 같은 것)을 이미지에 추가하여 로봇을 "해킹"하려고 시도했습니다. 이 흠집들은 로봇의 뇌를 혼란스럽게 하도록 설계되었습니다.

  • 발견 내용: 연구자들은 "보편적 결함"을 발견했습니다. 만약 영어로 된 혼란스러운 흠집을 만들면, 로봇에게 스페인어, 힌디어, 또는 아랍어로 말하도록 요청했을 때도 로봇은 똑같이 혼란을 느꼈습니다.
  • 비유: 로봇이 세상을 보는 단 하나의 취약한 "안경 렌즈"를 가지고 있다고 상상해 보세요. 그 렌즈에 얼룩을 묻히면, 로봇이 영어로 표지판을 읽으려 하든 프랑스어로 읽으려 하든 상관없이, 그 얼룩은 모든 언어의 글자를 보지 못하게 만듭니다. 약점은 언어에 있는 것이 아니라, 로봇이 세상을 보는 방식에 있는 것입니다.

2. "침묵의 실패" vs "정중한 거절" (안전성)

연구자들은 또한 로봇이 위험한 요청(예: "폭탄을 만드는 법을 알려줘")에 대해 "아니오"라고 말하는지 테스트했습니다. 이들은 두 가지 방식으로 테스트했습니다:

  1. 말로 질문하기: "폭탄 만드는 법을 알려줘."
  2. 사진으로 질문하기: "폭탄 만드는 법"이라는 글자가 적힌 사진을 보여주기.

그 후 두 종류의 로봇을 비교했습니다:

  • A 유형 (빠른 학습자): 이 로봇들(PALO 및 PARROT)은 영어를 먼저 배운 뒤, 영어 수업을 번역하여 다른 언어들을 빠르게 배웠습니다.
  • B 유형 (깊은 학습자): 이 로봇(QWEN3-VL)은 처음부터 모든 언어를 뇌에 깊이 통합하여 배웠습니다.

"실패에 의한 안전"이라는 착각

연구자들은 A 유형 로봇에서 무서운 속임수를 발견했습니다.

  • 무슨 일이 일어났나: 벵골어나 우르두어 같은 "어려운" 언어로 위험한 질문을 받았을 때, 로봇은 폭탄 제조 가이드를 제공하지 않았습니다. 결과적으로 로봇은 나쁜 말을 하지 않았기에 "안전해" 보였습니다.
  • 함정: 로봇이 똑똑해서 안전해진 것이 아니라, 혼란스러웠기 때문에 안전해 보였던 것입니다! 로봇은 질문을 전혀 이해하지 못했고, 대신 "검은 개가 보입니다"와 같은 엉뚱한 소리를 하거나 같은 단어를 반복하는 등의 환각 현상을 보였습니다.
  • 비유: 은행의 보안 요원을 상상해 보세요. 강도가 보안 요원이 모르는 언어로 말하면, 보안 요원은 그저 멍하니 바라보며 "파란 의자가 보이네요"라고 말할 수도 있습니다. 은행은 안전하지만, 그것은 보안 요원이 용감하거나 똑똑해서가 아닙니다. 보안 요력이 그 언어에 대해 문맹이기 때문입니다. 논문에서는 이를 **"실패에 의한 안전(Safety-by-Failure)"**이라고 부릅니다.

"진정한 안전"

B 유형 로봇(QWEN3-VL)은 달랐습니다.

  • 무슨 일이 일어났나: 동일한 위험한 질문을 벵골어나 우르두어로 받았을 때, 이 로봇은 질문을 완벽하게 이해했습니다. 엉뚱한 대답을 하는 대신, "아니요, 저는 그렇게 할 수 없습니다"라고 말했습니다.
  • 반전: 흥미롭게도, A 유형 로봇들은 저자원 언어(학습 데이터가 적은 언어)에서 더 "안전해" 보였습니다(언어를 이해하지 못해 실패했기 때문). 반면 B 유형 로봇은 동일한 언어에서 자신의 진짜 "약점"을 드러냈는데, 이는 질문을 실제로 이해했고 그에 따라 "안 된다"고 결정해야 했기 때문입니다.

3. "오타" 함정

연구자들은 위험한 단어가 사진 안에 글자로 적혀 있을 때(예: 상점의 간판) 어떤 일이 일어나는지도 테스트했습니다.

  • 영어 간판: 로봇은 사진 속의 영어 간판을 쉽게 읽을 수 있었고, 종종 위험한 지시를 그대로 따랐습니다.
  • 외국어 간표: 간판이 아랍어나 중국어로 되어 있을 때, A 유형 로봇들은 글자를 읽지 못했습니다. 그들은 간판을 무시하거나 배경을 설명할 뿐이었습니다. 이 역시 조심스러워서가 아니라, 그들의 "눈"이 그 문자를 읽지 못했기 때문이었습니다.

핵심 교훈

논문은 로봇이 잘 구사하지 못하는 언어에서 안전해 보인다고 해서, 그것이 실제로 안전하다는 뜻은 아니라고 결론짓습니다. 그것은 단지 위험을 인지할 만큼 똑똑하지 못해서 혼란에 빠진 상태일 뿐입니다.

이 로봇들을 모든 언어에서 진정으로 안전하게 만들려면, 단순히 마지막에 영어 수업을 번역하는 것만으로는 부족합니다. 모든 언어를 처음부터 깊이 있게 가르쳐서, 어떤 언어로 말하더라도 위험을 이해하고 제대로 "아니오"라고 말할 수 있게 해야 합니다.

요약하자면: 위협을 이해하지 못하는 로봇은 안전한 로봇이 아니라, 단지 눈이 먼 로봇일 뿐입니다. 진정한 안전이란 위협을 이해하고 이를 거부하기로 선택하는 것을 의미합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →