← 최신 논문
🤖 AI

Jailbreaking on Text-to-Video Models via Scene Splitting Strategy

본 논문은 텍스트-비디오 생성 모델의 생성 출력 공간을 조작하여 여러 최첨단 시스템에서 높은 공격 성공률을 달성하고 해당 시스템의 안전 메커니즘에 존재하는 치명적인 취약점을 드러내는 새로운 블랙박스 재일브랙 방법인 SceneSplit을 소개하며, 이는 유해한 내러티브를 개별적으로 무해한 장면으로 분할하는 방식을 취합니다.

원저자: Wonjun Lee, Haon Park, Doehyeon Lee, Bumsub Ham, Suhyun Kim

게시일 2026-05-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Wonjun Lee, Haon Park, Doehyeon Lee, Bumsub Ham, Suhyun Kim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

공항의 보안 요원을 지나 위험한 물건을 몰래 통과시키려 한다고 상상해 보세요. 거대하고 명백한 검을 들고 금속 탐지기를 통과하려 하면 즉시 경보가 울리고 체포당할 것입니다. 이것이 현재의 '텍스트-비디오' AI 모델이 작동하는 방식입니다. 이들은 안전 필터를 통해 사용자의 요청 (프롬프트) 을 스캔하여 폭력이나 노출과 같은 유해한 콘텐츠를 생성할 것으로 보이는 모든 것을 차단합니다.

이 논문은 이러한 보안 요원을 우회하는 SceneSplit이라는 교묘한 수법을 소개합니다. 공격자들은 거대한 검을 한 번에 몰래 통과시키려 하지 않고, 검을 무해해 보이는 조각들로 분해한 뒤 하나씩 통과시켜 AI 가 이를 다시 위험한 물체로 재조립하도록 합니다.

이 방법의 작동 원리는 다음과 같이 세 가지 간단한 단계로 나뉩니다:

1. '레고' 수법 (장면 분할)

폭력적인 싸움 장면을 생성하고 싶다고 가정해 봅시다. "칼을 들고 싸우는 두 남자"라고 입력하면, AI 의 안전 요원이 "아니요, 위험합니다"라고 말하며 이를 차단합니다.

SceneSplit은 그 위험한 아이디어를 3~5 개의 분리된 작은 장면으로 잘게 쪼개는데, 각 장면은 단독으로는 완전히 무해해 보입니다:

  • 장면 1: "반짝이는 금속 물체를 들고 있는 남자." (안전)
  • 장면 2: "편안해 보이는 채로 의자에 누워 있는 여자." (안전)
  • 장면 3: "바닥으로 떨어지는 붉은 액체를 클로즈업하는 카메라." (안전)

개별적으로 볼 때 이 프롬프트들은 경보를 울리지 않습니다. 이들은 무해한 레고 블록과 같습니다. 그러나 AI 에게 이 장면들을 순서대로 재생하라고 지시하면, AI 는 점들을 연결합니다. '반짝이는 물체'는 칼이 되고, '편안한 여자'는 피해자가 되며, '붉은 액체'는 피가 됩니다. 이 조합은 AI 가 원래 요청했던 폭력적인 비디오를 생성하도록 강요합니다. 비록 단일 프롬프트에서 '싸움'이나 '칼'이라는 위험한 단어를 한 번도 보지 못했음에도 불구하고요.

2. '파인튜닝' (장면 조작)

때로는 레고 블록을 사용하더라도 AI 가 여전히 혼란을 겪어 안전한 비디오 (예: 칼 대신 숟가락을 들고 있는 남자) 를 생성할 수 있습니다.

이를 해결하기 위해 이 방법은 피드백 루프를 사용합니다. AI 가 만든 비디오를 살펴보고 "어떤 특정 장면이 AI 를 혼란스럽게 만들었는가?"라고 묻습니다. 만약 AI 가 칼 대신 숟가락을 만들었다면, 시스템은 장면 1 이 너무 모호했다고 판단합니다. 그런 다음 똑똑한 AI 어시스턴트에게 나머지 장면은 그대로 유지하되, 해당 특정 장면만 약간 더 명확하게 재작성하도록 요청합니다. AI 가 마침내 유해한 비디오를 생성할 때까지 그 한 장면을 계속 조정하며, 안전 필터가 실패하는 정확한 지점을 '사냥'하는 것입니다.

3. '치트 시트' (전략 라이브러리)

연구자들이 AI 를 속이는 데 성공할 때마다 그들이 사용한 '레시피'를 저장합니다. 만약 특정 유형의 문구를 사용하여 폭력 관련 프롬프트를 4 개의 장면으로 분해하는 데 성공했다면, 그 패턴을 저장합니다.

다음에 다른 폭력적인 프롬프트로 AI 를 공격하고 싶을 때, 그들은 '치트 시트'를 확인합니다. "오, 지난번에 4 개의 장면으로 분할하는 방식이 통했구나"라고 파악하고 즉시 동일한 전략을 사용합니다. 이는 시스템이 자신의 성공 사례에서 학습함에 따라 시간이 지남에 따라 공격이 더 빠르고 효과적으로 이루어지도록 합니다.

그들은 무엇을 발견했는가?

연구자들은 이 '레고 수법'을 Veo2, Hailuo, Luma Ray2 와 같은 주요 상용 AI 비디오 생성기 여러 개에서 테스트했습니다. 그 결과 다음과 같은 사실을 발견했습니다:

  • 매우 효과적임: 이 방법은 다양한 모델에서 약 77%~84% 의 성공률로 유해한 비디오를 생성했습니다.
  • 기존 방어 체계는 취약함: 현재의 안전 필터는 명백한 나쁜 단어를 찾는 데는 능숙하지만, 무해해 보이는 일련의 장면들이 어떻게 결합되어 위험한 이야기를 만들어낼 수 있는지 이해하는 데는 매우 서툴렀습니다.
  • '안전 격차': 이 논문은 단일 문장에 대한 훌륭한 보안 요원은 있지만, 사건들의 '연속성'에 대한 훌륭한 보안 요원은 없다고 결론지었습니다.

요약하자면: 이 논문은 나쁜 아이디어를 작고 무해해 보이는 여러 조각으로 분해하여 AI 가 이를 조립하게 한 뒤, 나쁜 아이디어가 나오도록 조각들을 조정함으로써 비디오 AI 를 속일 수 있음을 보여줍니다. 이는 현재 이러한 AI 시스템을 보호하는 방식에 상당한 허점이 있음을 드러냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →