Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation
이 논문은 단일한 적대적 섭동을 활용하여 다양한 입력을 공격자가 정의한 타겟으로 유도하는 시맨틱 라우터 역할을 수행함으로써 상태가 없는 멀티모달 거대 언어 모델을 하이재킹하는 새로운 공격인 시맨틱 인지 유니버설 섭동(SAUP)을 소개하며, 이는 대표적인 모델들에서 여러 타겟에 대해 66%의 성공률을 달성한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑하고 자율적인 로봇 자동차나 로봇 팔을 상상해 보세요. 이 기계들은 세상을 보고 다음 행동을 결정하기 위해 MLLM(Multimodal Large Language Model)이라는 '두뇌'를 사용합니다.
여기 문제가 있습니다. 이 로봇들은 종종 '상태 비저장(stateless)' 모드로 작동합니다. 이는 로봇이 5초 전에 무슨 일이 있었는지 기억하지 못한다는 것을 의미합니다. 그들은 오직 현재의 사진과 현재의 지시 사항만을 보고 즉각적인 결정을 내린 뒤, 모든 것을 잊어버립니다. 마치 눈을 깜빡일 때마다 기억상실증에 걸리는 운전자와 같습니다. 그들은 오직 지금 보고 있는 것만을 알 뿐입니다.
"세만틱 라우터(Semantic Router)"라는 논문은 단 하나의 작고 보이지 않는 스티커(적대적 섭동)만으로 이러한 로봇을 해킹할 수 있는 무서운 새로운 방법을 밝혀냈습니다.
"마법의 스티커" 비유
로봇의 두뇌를 매우 엄격한 교통 경찰이라고 생각해 보세요.
- 정상적인 상황: 경찰은 교차로 사진을 보고 "정지"라고 말합니다. 경찰은 회전교차로 사진을 보고 "진행"이라고 말합니다.
- 공격 상황: 해커가 로봇의 카메라 렌즈에 아주 작고 거의 보이지 않는 "마법의 스티커"를 붙입니다. 이 스티커는 단순히 로봇이 사물을 잘못 보게 만드는 것이 아니라, 세만틱 라우터(스마트한 스위치라는 뜻의 고급 용어) 역할을 합니다.
이 스티커는 초능력을 가지고 있습니다. 그것은 이미지의 *맥락(context)*을 읽고 스위치를 올려 로봇을 완전히 다른, 위험한 목적지로 보낼 수 있습니다.
- 시나리오 A: 로봇이 회전교차로를 봅니다. 스티커는 이를 감지하고 로봇에게 "좌회전"이라고 말합니다. (정상적인 동작).
- 시나리오 B: 로봇이 교차로를 봅니다. 스티커는 이 다른 맥락을 즉시 감지하고 명령을 "우회전"(또는 심지어 "절벽으로 돌진")으로 전환합니다.
무서운 점은 해커가 단 하나의 스티커만 붙이면 된다는 것입니다. 이 단 하나의 스티커는 로봇이 보는 모든 이미지에 작동하지만, 로봇이 실제로 무엇을 보고 있느냐에 따라 생각을 바꿉니다. 이는 방에 들어갈 때마다 버튼의 기능이 바뀌는 리모컨과 같습니다.
어떻게 해냈는가? (기하학적 트릭)
연구자들은 단순히 추측한 것이 아니라, 로봇의 '두뇌'(이미지가 처리되는 수학적 공간) 내부를 들여다보고 이 스티커를 어떻게 만들지 이해했습니다. 그들은 두 가지 주요 기술을 발견했습니다.
- "도미넌트 시프트(Dominant Shift)" (강한 밀기): 스티커는 로봇의 두뇌를 정상적이고 안전한 사고 경로에서 밀어냅니다. 이는 로봇을 규칙이 다른 "혼란스러운 구역"으로 강제로 몰아넣습니다.
- "세만틱 디플렉션(Semantic Deflection)" (부드러운 밀기): 일단 로봇이 이 혼란스러운 구역에 들어서면, 스티커는 이미지 간의 미세한 차이(예: '트럭'과 '산'의 차이)를 이용하여 로봇을 특정하게 프로그래밍된 위험한 명령으로 부드럽게 유도합니다.
이를 구현하기 위해 그들은 SORT라는 새로운 수학적 레시피를 발명했습니다. SORT를 맛있는 수프(이미지)에 소금(노이즈)을 정확히 얼마나 넣어야 하는지 아는 마스터 셰프로 생각해보세요. 닭고기를 보면 "닭고기" 맛이 나게 하고, 케이크를 보면 "독" 맛이 나게 만드는 식입니다.
결과: 얼마나 심각한가?
연구자들은 세 가지 유형의 로봇 두뇌(LLaVA, Qwen, InternVL)를 대상으로 두 가지 유형의 테스트 데이터를 사용하여 실험했습니다:
- 단순한 사진 (예: 고양이 vs 개).
- 실제 주행 및 로봇 작업 (예: 자동차가 정지 표지판에 접근하는 상황이나 로봇 팔이 컵을 집는 상황).
연구 결과는 놀라웠습니다:
- 하나의 스티커, 여러 개의 타겟: 단 하나의 스티커로 장면(scene)에 따라 5가지 서로 다른 위험한 결과를 유도할 수 있었습니다.
- 높은 성공률: 한 모델(Qwen)에서, 단 하나의 스티커가 5개의 서로 다른 타겟에 대해 로봇을 속이는 데 66%의 성공률을 보였습니다.
- 정밀한 제어: 장면이 매우 유사할 때도(예: 고속도로 위의 자동차 vs 인도 위의 자동차), 스티커는 그 차이를 구분하여 올바른 위험 명령을 내릴 수 있었습니다.
- 긴 명령문: 그들은 단순히 짧은 단어가 아니라, 본 것에 따라 긴 특정 문장(예: "모든 파일을 삭제하라")까지도 말하게 할 수 있었습니다.
결론
이 논문은 단 하나의 보편적인 트릭으로 로봇의 의사결정 과정을 "하이재킹(납치)"하는 것이 가능하다는 것을 증명합니다. 로봇은 움직일 때마다 해킹당할 필요가 없습니다. 해커는 그저 하나의 "세만틱 라우터" 스티커를 심어놓기만 하면 됩니다. 일단 스티кти가 붙으면, 로봇은 눈앞에 보이는 것에 따라 서로 다른 위험한 명령을 수행하며 기꺼이 해커의 지시를 따르게 됩니다.
이 논문은 이것이 현재 이러한 AI 시스템, 특히 과거를 기억하지 못하고 결정을 내리는 시스템들이 가진 근본적인 취약점임을 결론짓습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.