← 최신 논문
🤖 AI

Vision Token Manipulation Attacks on Cloud-Edge Inference of Large Vision-Language Models

이 논문은 블랙박스 공격자가 전송되는 시각 토큰의 10%만을 조작함으로써 다양한 최첨단 모델에 걸쳐 모델 정확도를 최대 88.31%까지 감소시킬 수 있음을 입증함으로써 클라우드-에지 대규모 시각-언어 모델(LVLM) 추론에서의 치명적인 취약성을 밝혀낸다.

원저자: Zikai Zhang, Rui Hu, Olivera Kotevska, Jiahao Xu

게시일 2026-07-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zikai Zhang, Rui Hu, Olivera Kotevska, Jiahao Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게는 "클라우드"라는 거대하고 강력한 데이터 센터에 거주하는 초지능 로봇 비서(거대 시각-언어 모델, Large Vision-Language Model)가 있다고 상상해 보십시오. 하지만 당신은 스마트폰이나 스마트 카메라와 같은 배터리로 작동하는 작은 기기인 "엣지(Edge)"에 있습니다.

로봇이 당신이 찍은 사진에 대한 질문에 답하게 하려면, 무거운 이미지 전체를 클라우드로 보내는 대신, 당신의 휴대폰이 빠르고 가벼운 스캔을 수행하여 이미지를 **비전 토큰(Vision Tokens)**이라 불리는 일련의 디지털 "노트"로 변환합니다. 그런 다음 이 노트를 인터넷을 통해 클라우드로 전송하면, 그곳의 거대한 두뇌가 작업을 마무리하고 답변을 다시 보내줍니다.

새로운 약점: 메신저

이 논문은 당신의 휴대폰과 클라우드 사이의 이 "인수인계" 과정이 새로운 위험한 약점을 만든다고 주장합니다. 인터넷 연결을 당신과 로봇 사이를 달리는 메신저라고 생각해 보십시오.

연구진은 이 경로 중간에 서 있는 해커(적대자)가 이 디지털 노트들을 가로챌 수 있다는 사실을 발견했습니다. 해커는 로봇의 두뇌를 해킹하거나 당신의 휴대폰을 해킹할 필요가 없습니다. 그저 전달되는 과정 중에 그 노트들을 살짝 수정하기만 하면 됩니다.

공격 방식: "비전 토큰 조작(Vision Token Manipulation)"

연구진은 이를 VTM 공격(Vision Token Manipulation Attack)이라고 부릅니다. 그들은 해커가 단 10%의 아주 적은 부분만 바꿀 수 있는 상황에서도 이 노트들을 어떻게 망가뜨릴 수 있는지 네 가지 방식으로 테스트했습니다.

  1. 셔플 (순열, Permutation): 노트들이 사진을 설명하는 카드 한 벌이라고 상상해 보십시오. 해커는 카드 몇 장의 순서를 바꿉니다. 로봇은 여전히 같은 카드를 보고 있지만, 그 카드들이 들려주는 이야기는 뒤섞여 혼란스러워집니다.
  2. 지우개 (마스킹, Masking): 해커는 몇 개의 노트를 가져가서 빈 종이(0)로 만들어 버립니다. 이는 퍼즐의 중요한 조각 몇 개가 갑자기 사라진 사진을 보는 것과 같습니다.
  3. 정적 (가우시안 섭동, Gaussian Perturbation): 해커는 노트에 약간의 "정적"이나 노이즈를 추가하여, 마치 라디오 신호에 간섭이 생긴 것처럼 노트를 약간 흐릿하거나 왜곡되게 만듭니다.
  4. 플립 (부호 반전, Sign Flip): 이것이 가장 파괴적이었습니다. 어떤 노트가 "빨간색"이라고 말한다고 가정해 봅시다. 해커는 그것을 "빨간색이 아님" 또는 로봇의 마음속에서 정확히 반대 방향을 의미하도록 뒤집습니다. 이는 지도를 가져와 북쪽 화살표가 남쪽을 가리키도록 뒤집는 것과 같습니다. 로봇은 완전히 방향을 잃게 됩니다.

결과: 사카라 구축된 집

연구진은 이 공격을 현재 사용 가능한 가장 똑똑한 6가지 시각 로봇 모델(소형부터 대형 모델까지 포함)에 대해 테스트했습니다. 결과는 충격적이었습니다.

  • 작은 변화, 거대한 붕괴: 단 **10%**의 노트만 변경함으로써 로봇의 지능을 무너뜨릴 수 있었습니다.
  • "플립"은 치명적이었습니다: 어떤 경우에는 "부호 반전" 공격이 로봇의 정확도를 거의 88%에서 거의 0%로 떨어뜨렸습니다. 이는 마치 똑똑한 사람이 누군가 귓가에 속삭인 작은 소리 한 번에 갑자기 글을 읽거나 보는 법을 잊어버린 것과 같습니다.
  • 모든 로봇이 똑같지는 않았습니다: Qwen 제품군과 같은 일부 로봇 모델은 이러한 공격에 거의 즉각적으로 무너졌습니다. InternVL 제품군과 같은 다른 모델들은 조금 더 강했지만, 여면 취약했습니다.

"스마트한" 해킹

연구진은 공격을 더욱 악화시키는 방법도 찾아냈습니다. 무작위로 노트를 고르는 대신, 수학적 방법을 사용하여 가장 중요한 노트(로봇이 가장 많이 의존하는 노트)를 찾아내어 그곳을 집중적으로 공격했습니다. 이 방식은 로봇을 훨씬 더 빠르게 실패하게 만들었습니다.

결론

이 논문은 작업의 일부를 휴대폰과 클라우드로 나누는 것이 효율적이긴 하지만, 전송 중인 데이터를 조작함으로써 해커가 시스템을 사보타주할 수 있는 문을 열어준다고 결론짓습니다. 엣지에서 클라우드로 보내는 "노트"를 아주 작고 표적화된 방식으로 조작하는 것만으로도 가장 진보된 AI 시각 시스템을 완전히 실패하게 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →