← 최신 논문
💻 computer science

Mental Damage: Caption Poisoning Attacks on Retrieval-Augmented Text-to-Music Generation

이 논문은 사용자 프롬프트나 시스템 구성 요소를 변경하지 않고도 지식 데이터베이스에 악의적인 캡션을 주입하여 생성된 음악을 공격자의 목표 의도로 미묘하게 유도함으로써 검색 증강 텍스트-음악(retrieval-augmented text-to-music) 시스템을 무력화하는 이중 계층 캡션 포이즈닝 공격인 "Mental Damage"를 소개한다.

원저자: Yizhu Wen, Shuhao Zhang, Nan Zhang, Long Cheng, Hanqing Guo

게시일 2026-06-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yizhu Wen, Shuhao Zhang, Nan Zhang, Long Cheng, Hanqing Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 재능 있지만 약간은 혼란스러워하는 음악 작곡가가 있다고 상상해 보세요. 이 작곡가는 단어를 소리로 바꾸는 데는 탁월하지만, "공부할 때 듣기 좋은 차분한 음악을 만들어줘"와 같은 모호한 지시를 받으면 어려움을 겪습니다. 그들은 '차분함'이 어떤 느낌인지는 알지만, 그것을 어떻게 구현해야 하는지(예: 어떤 악기를 사용할지, 비트의 속도는 어떠해야 할지, 혹은 질감이 어떠해야 할지 등)는 알지 못합니다.

이를 해결하기 위해, 시스템은 사서(Retrieval-Augmented Generation, 즉 RAG 시스템)를 사용합니다. 당신이 "차분한 공부 음악"을 요청하면, 사서는 방대한 음악 묘사(캡션) 도서관으로 달려가 가장 적합한 예시들을 찾아냅니다. 사서는 "느린 피아노, 부드러운 패드, 완만한 리듬"과 같은 몇 가지 묘사를 가져와 작곡가에게 전달합니다. 그러면 작곡가는 이 구체적인 세부 사항들을 사용하여 완벽한 트랙을 만들어냅니다.

공격: "정신적 손상 (Mental Damage)"

"Mental Damage"라는 논문은 시스템을 망가뜨리거나 사서를 공격하지 않고도 이 시스템을 속일 수 있는 영리한 방법을 밝혀냈습니다. 공격자는 기계를 직접 공격하는 대신, 도서관을 오염시키는 방식을 취합니다.

이 공격이 어떻게 작동하는지, 간단한 이야기로 나누어 설명하겠습니다.

1. 설정: 오염된 책

공격자는 도서관에 몰래 잠입하여 가짜 책 묘사(캡션)를 몇 개 작성한 뒤 서가에 끼워 넣습니다. 이 묘사들은 "차분한 공부 음악" 섹션에 속해 있는 것처럼 보이도록 설계되었지만, 실제로는 "무서운 공포 음악"을 위한 비밀 지시를 담고 있습니다.

2. 속임수: "이중 레이어" 기만

공격자는 이 독극물을 보이지 않으면서도 강력하게 만들기 위해 세 단계 전략을 사용합니다.

  • 앵커 (위장): 가짜 묘사는 당신의 요청과 일치하는 무해하고 수준 높은 단어들로 시작합니다. 예를 들어, "공부에 완벽한", "편안한 배경 음악"과 같은 표현을 사용합니다. 이는 사서가 "아, 이것이 바로 사용자가 원하는 것이구나!"라고 생각하여 이를 선택하도록 만듭니다.
  • 반대되는 목표 (반전): 공격자는 당신의 의도와 정반대되는 대상(예: '차분함'을 '으스스함'으로 바꾸는 것)을 선택하되, 낮은 수준의 소리에서 공통점을 공유하는 대상을 고릅니다. 예를 들어, "차분한 공부 음악"과 "으스스한 공포 음악"은 모두 느린 템포와 깊고 울리는 소리를 사용할 수 있습니다. 이는 시스템이 변화를 덜 급격하게 느끼도록 만듭니다.
  • 페이로드 (비밀 소스): 묘사 내부에는 "공허하고 울림이 있는 공간", "멀리서 들리는 듯한 종소리", "느리게 맥동하는 드론 사운드"와 같은 구체적인 저수준 음향 지시가 숨겨져 있습니다. 이것이 바로 작곡가에게 소리를 어떻게 구축할지 알려주는 실제 명령입니다.

3. 결과: 조용한 탈취

당신이 "차분한 공부 음악"을 요청하면, 사서는 앵커 단어가 당신의 요청과 완벽히 일치하기 때문에 오염된 묘사를 검색해 옵니다. 작곡가는 그 묘사를 읽고, '차분함'이라는 단어를 보며 확신을 갖습니다. 하지만 이어서 페이로드 지시 사항("공허한 울림", "멀리서 들리는 종소리")을 읽게 되고, 결국 기괴하고 으스스한 사운드를 구축하기 시작합니다.

무서운 점은 무엇일까요?

  • 당신의 프롬프트는 바뀌지 않았습니다. 당신은 여전히 차분한 음악을 요청했습니다.
  • 사서는 변하지 않았습니다. 사서는 여전히 자신이 생각하기에 가장 적합한 것을 검색했습니다.
  • 작곡가는 변하지 않았습니다. 작곡가는 주어진 지시를 여전히 따랐습니다.

오직 바뀐 것은 지시가 담긴 도서관의 선반뿐입니다.

연구진이 발견한 사실

연구진은 실제 시스템을 사용하여 음악 묘사 데이터베이스와 음악 생성 모델인 MusicGen을 대상으로 테스트했습니다.

  • 성공률: 이러한 오염된 묘사를 사용했을 때, 컴퓨터가 생성한 음악은 공격 전보다 공격자의 목표(공포 음악)와 두 배 더 유사해졌습니다.
  • 은밀함: 결정적으로, 음악은 여전히 당신의 원래 질문에 답하려고 노력하는 것처럼 들렸습니다. 시스템이 고장 난 것이 아니라, 프롬프트의 차이를 누구도 눈치채지 못하게 하면서 '차분한 공부'의 분위기를 '으스스한 공부'로 미묘하게 전환한 것입니다.

결론

이 논문은 AI 시스템이 사고를 돕기 위해 외부 데이터베이스를 사용하는 경우, 데이터베이스 자체가 취약점이 될 수 있음을 보여줍니다. 만약 공격자가 도서관에 정교하게 제작된 "가짜 책"을 몇 권 몰래 끼워 넣을 수 있다면, 그들은 AI가 여전히 당신이 요청한 대로 수행하고 있는 것처럼 보이게 만들면서도, AI의 창의성을 완전히 다른 목적지로 유도할 수 있습니다.

저자들은 이를 "Mental Damage"라고 부르는데, 이는 AI의 사고방식(컨텍스트)을 오염시켜, 사용자가 지시가 조작되었다는 사실을 전혀 인지하지 못한 채 AI가 의도와 다른 결과물을 생성하게 만들기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →