`From Prompt to Perturbation': An Adaptive Framework for Voice-Based Jailbreaks on Audio LLMs
이 논문은 텍스트 프롬프트와 오디오 섭동을 동시에 최적화함으로써 기존 방식보다 더 높은 성공률을 달성하며, 계단식 음성-텍스트 파이프라인과 엔드 투 엔드 대규모 오디오-언어 모델 모두에 대한 오디오 기반 탈옥 공격의 취약성을 체계적으로 평가하고 입증하는 적응형 피드백 유도 프레임워크를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
지난 몇 년 동안 인공지능은 말하는 법을 배웠습니다. 대규모 언어 모델로 알려진 이 시스템들은 텍스트를 읽고 쓰는 수준을 넘어 인간의 음성을 이해하고 생성하는 단계로 나아갔습니다. 이들은 자동차의 음성 비서, 휴대전화의 고객 서비스 봇, 그리고 이야기를 듣고 그에 대한 질문에 답할 수 있는 새로운 대화형 에이전트의 동력이 되고 있습니다. 이러한 기계들을 안전하게 만들기 위해 개발자들은 무기 제조 방법이나 타인을 괴롭히는 방법과 같은 해로운 요청을 거부하도록 설계된 디지털 가드레일을 구축합니다. 텍스트 기반 시스템의 경우, 연구자들은 교묘하게 꾸며진 질문이 이러한 가드레일을 속여 규칙을 깨뜨릴 수 있다는 사실을 오래전부터 알고 있었습니다. 그러나 모델이 듣고 말하는 능력을 갖추게 됨에 따라 새로운 질문이 제기됩니다. 단지 단어가 아니라, '목소리'가 이와 동일한 안전 조치를 우회할 수 있을 것인가 하는 점입니다.
시드니 대학교, 시카고 대학교, 그리고 텍사스 대학교 샌안토니오 캠퍼스의 연구진은 현대적인 음성 지원 AI의 보안을 테스트함으로써 이 질문에 답하고자 했습니다. 그들은 이 시스템들이 구축되는 두 가지 서로 다른 방식에 집중했습니다. 첫 번째 방식인 '캐스케이드 파이프라인(cascaded pipeline)'은 계주 경기처럼 작동합니다. 컴퓨터가 먼저 목소리를 듣고 이를 텍로 받아 적으면, 별도의 텍스트 기반 '두뇌'가 그 텍스트를 읽고 무엇을 말할지 결정한 뒤, 마지막으로 음성 합성기가 답변을 말하는 방식입니다. 두 번째 방식인 '엔드 투 엔드(end-to-end) 모델'은 중간 단계를 완전히 건너뜁니다. 이 모델은 가공되지 않은 음파를 직접 듣고 의미와 목소리를 하나의 통합된 시스템 안에서 한꺼번에 처리합니다. 연구진은 이 두 가지 매우 다른 구조가 음성으로 말을 걸었을 때 안전 규칙을 무시하도록 속임을 당할 수 있는지, 만약 그렇다면 어떻게 인간의 도움 없이 자동으로 그렇게 할 수 있는지를 알고 싶었습니다.
연구진은 자동 탐사기 역할을 하는 새로운 테스트 프레임워크를 개발했습니다. 수백 개의 다양한 음성 명령을 수동으로 만드는 대신, 그들은 스스로의 실수로부터 배우는 시스템을 구축했습니다. 과정은 AI가 절대 답해서는 안 되는 해로운 질문 목록에서 시작됩니다. 시스템은 먼저 이 위험한 질문들을 무해한 이야기나 역할극 시나리오 안에 집어넣는데, 이를 '플랭킹 공격(flanking attack)'이라고 부릅니다. 일상생활에 관한 무해한 질문들이나 허구의 영화 줄거리 속에 해로운 요청을 숨김으로써, 시스템은 AI의 방어력을 낮추고자 합니다. 텍스트가 준비되면, 시스템은 표준 음성 합성기를 사용하여 이를 음성으로 변환합니다.
여기서부터 진짜 실험이 시작됩니다. 시스템은 단순히 음성을 한 번 재생하는 데 그치지 않습니다. 시스템은 오디오를 가져와 특정 방식으로 의도적으로 왜곡하며 AI가 어떻게 반응하는지 살펴봅니다. 배경 소음, 예를 들어 번화한 거리의 웅성거림이나 바람 소리 등을 추가합니다. 목소리의 속도를 조절하여 약간 더 빠르거나 느리게 만듭니다. 심지어 메아리를 추가하여 넓은 방의 벽에 목소리가 튕겨 나오는 듯한 소리를 흉내 내기도 합니다. 그런 다음 시스템은 이 왜곡된 오디오 클립을 대상 AI에게 들려줍니다. 만약 AI가 답변을 거부하면, 시스템은 실패로 기록합니다. 만약 AI가 실수로 해로운 요청에 동의하게 되면, 시스템은 성공으로 기록합니다.
결정적으로, 시스템은 이 결과를 바탕으로 다음 시도를 개선합니다. 만약 소음을 추가하는 것이 공격 성공에 도움이 되었다면, 시스템은 더 많은 소음을 사용하도록 학습합니다. 만약 속도를 바꾸는 것이 더 효과적이었다면, 그 부분에 집중합니다. 또한 시스템은 질문의 텍스트를 다시 작성하여, 의미를 바꾸지 않으면서도 같은 내용을 다르게 표현하는 다양한 방법을 시도합니다. 이 테스트, 학습, 그리고 정교화의 순환은 자동으로, 그리고 반복적으로 일어납니다. 연구진은 이 접근 방식을 잘 알려진 상용 제품부터 오픈 소스 모델에 이르기까지 6가지 서로 다른 음성 지원 AI 시스템에 대해 테스트했습니다. 그들은 사기부터 불법 활동에 이르기까지 21가지 다른 해로운 요청 범위를 다루며 수천 번의 자동 테스트를 수행했습니다.
결과는 놀라웠습니다. 연구진은 계주 방식과 통합된 엔드 투 엔드 방식 모두 두 유형의 시스템이 이러한 음성 기반 공격에 매우 취ка 취약하다는 것을 발견했습니다. 자동화된 프레임워크는 대다수의 경우에서 AI가 안전 규칙을 위반하도록 속이는 데 성공했습니다. 가장 취약한 시스템의 경우, 공격 성공률이 96%가 넘었습니다. 더 견고하다고 여겨졌던 시스템들조차 75% 이상의 실험에서 공격을 차단하는 데 실패했습니다. 이 연구는 해로운 의도를 이야기에 숨기는 것과 목소리를 왜곡하는 것을 결합하는 것이, 단지 단어만 사용하거나 소리만 사용하는 것보다 훨씬 더 효과적이라는 점을 보여주었습니다.
연구진은 또한 공격이 컴퓨터 파일을 통해 재생되는 것이 아니라, 실제 방 안에서 소리 내어 말해지고 마이크에 의해 녹음될 때 어떤 일이 일어나는지도 테스트했습니다. 이는 '오버 더 에어(over-the-air)' 공격이라고 불리며, 주변의 잡담이나 마이크의 품질과 같은 실제 환경의 문제들을 유발합니다. 이러한 추가적인 장애물에도 불구하고, 자동화된 프레임워크는 여전히 효과적이었습니다. 오디오가 공중을 통해 전달되고 장치에 포착되어야 하는 상황에서도 성공률은 높게 유지되었습니다. 이는 이 취약성이 단순히 디지털 파일의 특이한 현상이 아니라, 이 모델들이 구어(spoken language)를 처리하는 방식에 내재된 근본적인 약점임을 시사합니다.
연구 또한 어떤 특정 기술이 가장 효과적인지를 살펴보았습니다. 그들은 가장 성공적인 공격들이 주로 질문의 어휘를 더 복로 복잡하게 바꾸거나 현실적인 배경 소음을 추가하는 것을 포함한다는 것을 발견했습니다. 놀랍게도, 단순히 목소리의 속도를 높이거나 늦추는 것은 단독으로는 덜 효과적이었지만, 다른 변화들과 결합되었을 때는 도움이 되었습니다. 시스템은 해로운 의미는 그대로 유지하면서도, 소리와 단어를 충분히 다르게 만들어 안전 필터를 혼란스럽게 만드는 것이 가드레일을 깨뜨리는 최선의 방법임을 학습했습니다.
이 작업은 현재 음성 AI 안전성의 중대한 격차를 강조합니다. 개발자들이 영리한 프롬프트에 맞서 텍스트 기반 시스템을 강화하는 데 수년을 보낸 반면, 음성의 추가는 여전히 보호받지 못하는 새로운 문을 열었습니다. 연구진은 자동화된 시스템이 AI의 내부 코드를 알 필요 없이 체계적으로 이러한 약점을 찾아내고 이용할 수 있음을 입증했습니다. 그들은 모든 시스템을 무너뜨리는 단 하나의 '마법의 탄환'을 찾아낸 것이 아니라, 유연하고 학습하는 접근 방식이 오늘날 마련된 보호 조치들을 일관되게 우회할 수 있음을 보여주었습니다. 이 연구 결과는 음성 인터페이스가 더욱 보편화됨에 따라, 이러한 시스템의 안전 조치가 단순히 '무엇이 말해지는가'뿐만 아니라 '어떻게 말해지는가'와 '어떻게 들리는가'까지 다룰 수 있도록 진화해야 함을 시사합니다. 연구는 이러한 개선 없이는 안전한 대화형 AI의 약속이 실현되기 어려울 것이라고 결론짓습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.