← 최신 논문
⚡ electrical engineering

SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models

이 논문은 삼중 모드 오디오-비디오-언어 모델이 다양한 멀티모달 처리 단계의 취약점을 악용함으로써 최소한의 지각적 왜곡만으로 최대 96%의 성공률을 달성할 수 있는 비표적 오디오 전용 적대적 공격에 매우 취약하다는 것을 입증한다.

원저자: Aafiya Hussain, Gaurav Srivastava, Alvi Ishmam, Zaber Hakim, Chris Thomas

게시일 2026-01-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Aafiya Hussain, Gaurav Srivastava, Alvi Ishmam, Zaber Hakim, Chris Thomas

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 비디오를 보고, 소리를 듣고, 텍스트를 동시에 읽을 수 있는 매우 똑똑한 세 눈 박이 로봇 "트라이모달(Trimodal)"이 있다고 상상해 보세요. 이 로봇은 이 세 가지 감각을 함께 사용하여 "영상 속 인물이 무엇을 하고 있는가?" 또는 "배경에 어떤 노래가 흐르고 있는가?"와 같은 질문에 답합니다.

SOUNDBREAK라는 논문은 무서운 질문을 던집니다: 만약 우리가 비디오나 텍xt를 전혀 건드리지 않고, 그저 로봇의 귀에 대고 속삭이는 것만으로 이 로봇을 속일 수 있다면 어떻게 될까요?

다음은 이 연구의 결과를 쉬운 비유를 들어 정리한 내용입니다:

1. 공격 방식: "속삭이는 유령"

대부분의 사람들은 로봇을 속이려면 로봇의 눈(비디오)을 망가뜨리거나 뇌(텍스트)를 조작해야 한다고 생각합니다. 하지만 연구진은 새로운 방법을 찾아냈습니다. 그들은 오직 오디오만을 건드렸습니다.

  • 비유: 로봇이 노이즈 캔슬링 헤드폰을 쓴 채 퍼즐을 풀려고 노력하고 있다고 상상해 보세요. 연구진은 헤드폰을 부순 것이 아니라, 오디오 트랙에 아주 특정한, 거의 들리지 않는 "유령의 속삭임"을 추가했습니다.
  • 결과: 비디오는 완벽해 보였고 텍스트도 정상이었지만, 로봇은 혼란에 빠졌습니다. 로봇은 아주 확신에 찬 태도로 틀린 답을 내놓기 시작했습니다. 일부 테스트에서 이 공격은 로봇을 96%의 확률로 무너뜨렸습니다.

2. 로봇을 속인 여섯 가지 방법

연구진은 로봇의 뇌 중 어느 부분이 가장 민감한지 알아보기 위해 여섯 가지 "속삭임"(공격 방법)을 시도했습니다.

  1. "자신감 파괴자" (부정적 언어 손실 - Negative Language Loss): 로봇이 자신의 정답을 의심하게 만드는 명령을 속삭였습니다.
  2. "귀마개" (인코더 유사성 - Encoder Similarity): 로봇의 원시 오디오 처리 과정(소리 파동을 데이터로 변환하는 부분)을 건드려, 인간의 귀에는 똑같이 들리더라도 로봇의 내부 센서에는 소리가 완전히 다르게 보이도록 만들었습니다. 이 방법이 가장 효과적이었습니다.
  3. "안대" (시각 주의 억제 - Vision Attention Suppression): 로봇이 비디오를 완전히 무시하고, (이제는 오염된) 오디오에만 집중하도록 만드는 방식으로 속삭였습니다.
  4. "과잉 청취자" (오디오 주의 증폭 - Audio Attention Amplification): 로봇이 오디오에 너무 많이 집중하게 만들어, 시각적 단서들을 무시하게 강제했습니다.
  5. "혼돈의 대리인" (주의력 무작위화 - Attention Randomization): 로봇의 내부 집중력을 뒤섞어, 무작위적이고 터무니없는 순서로 사물을 보게 만들었습니다.
  6. "브레인 포그" (은닉 상태 유사성 - Hidden-State Similarity): 로봇의 내부 기억 층을 건드려, 로봇의 생각이 진실로부터 벗어나 표류하게 만들었습니다.

승자: "귀마개" 방식(오디오 인코더를 건드리는 방식)이 가장 강력했습니다. 이는 단순히 최종 답변을 혼란스럽게 만드는 것이 아니라, 로봇이 생각을 시작하기도 전에 로봇이 사용하는 언어 자체를 바꾸는 것과 같습니다.

3. 공격의 "마법"

연구진은 이러한 공격들이 어떻게 작동하는지에 대해 몇 가지 놀라운 사실을 발견했습니다.

  • 볼륨의 문제가 아니다: 로봇에게 소리를 지를 필요가 없습니다. 이 "속삭임"은 너무 작아서 인간 청취자는 차이를 느낄 수 없었습니다. 왜곡이 너무 적어 인간의 귀에는 거의 보이지 않았지만, 로봇을 완전히 무너뜨리기에는 충분했습니다.
  • 연습이 완벽을 만든다: 공격을 훈련시키기 위해 거대한 비디오 라이브 library를 사용하는 것은 중요하지 않았습니다. 중요한 것은 작은 데이터 세트를 가지고 얼마나 오래 연습했느냐였습니다. 이는 마치 한 명의 특정 인물을 대상으로 몇 시간 동안 연습하여 숙련된 기술자가 된 소매치기와 같습니다. 수천 명의 주머니를 한 번씩 털려고 시도하는 것과는 다릅니다.
  • 로봇은 여전히 자신만만하다: 로봇이 틀린 답을 낼 때조차, 로봇은 자신이 맞다는 데 100% 확신을 가졌습니다. 로봇은 "잘 모르겠습니다"라고 말하지 않았습니다. 그저 확신에 차서 거짓말을 했습니다. 이 때문에 로봇이 실수하고 있다는 것을 잡아내기가 매우 어렵습니다.

4. 한계: 모든 곳에 통하는 만능 열쇠는 아니다

연구진은 이 기술이 모든 로봇에 통하는 "마스터 키"는 아니라는 점도 발견했습니다.

  • 모델 특정적: 만약 로봇 A를 속이도록 속삭임을 훈련시킨다면, 그것은 보통 로봇 B에서는 실패합니다. 이는 특정 브랜드의 자물쇠를 따는 법을 배우는 것과 같아서, 다른 브랜드의 자물쇠에는 작동하지 않습니다.
  • 음성 인식은 다르다: 이 기술을 단순한 음성-텍스트 변환 시스템(Siri나 Whisper 같은)에 적용했을 때, 시스템은 속삭임의 종류에는 신경 쓰지 않았습니다. 시스템은 오직 소음이 얼마나 큰지에만 관심을 가졌습니다. 소음이 소리를 왜곡할 만큼 충분히 컸다면 음성 시스템은 실패했습니다. 하지만 복잡한 "비디오+오디오+텍스트" 로봇의 경우, 소음의 크기보다 속삭임의 구조가 더 중요했습니다.

5. 핵심 결론

이 논문은 우리가 이러한 똑똑한 로봇의 보안을 잘못된 관점에서 바라보고 있다고 결론짓습니다. 우리는 비디오와 텍스트를 보호해야 한다고 생각했습니다. 하지만 이 연구는 **오디오가 숨겨진 뒷문(backdoor)**임을 보여줍니다.

작고 구조화된 "유령의 속삭임"을 오디오에 추가함으로써, 공격자는 비디오나 텍스트를 전혀 건드리지 않고도 고도로 지능적인 다감각 로봇을 완전히 실패하게 만들 수 있습니다. 연구진은 이를 해결하기 위해, 로봇이 단순히 하나의 감각만을 신뢰하는 것이 아니라, 자신의 귀, 눈, 그리고 뇌가 모두 같은 이야기를 하고 있는지 확인하도록 구축해야 한다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →