TrajShield: Trajectory-Level Safety Mediation for Defending Text-to-Video Models Against Jailbreak Attacks
TrajShield 는 텍스트-비디오 모델에서 프롬프트 궤적을 시뮬레이션하여 안전하지 않은 콘텐츠를 인과적으로 국소화하고 최소한으로 재작성하면서도 의미적 충실도를 유지함으로써, 텍스트-비디오 모델의 잼브레이크 공격과 시간적으로 발생하는 위험을 완화하는 학습 없이 추론 시에 작동하는 방어 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 작성한 문장을 짧은 영화로 변환할 수 있는 마법 같은 이야기꾼 로봇이 있다고 말입니다. 이 로봇은 한 순간에서 다음 순간으로 장면이 자연스럽게 이어지도록 만드는 데 탁월한 재능을 지니고 있어, 마치 실제 영화처럼 느껴집니다. 하지만 문제가 하나 있습니다. 때로는 해롭지 않게 들리지만 Trouble 을 암시하는 문장을 주면, 로봇이 이야기꾼으로서의 열정에 휩싸여 과잉 반응한다는 점입니다. 로봇은 두 사람 사이의 해롭지 않은 논쟁으로 시작하더라도, 이야기를 극적이고 일관되게 만들려는 노력 끝에 사용자가 전혀 요청하지 않았던 폭력적인 싸움으로 치닫게 만들 수 있습니다.
이것이 바로 TrajShield가 해결하는 핵심 문제입니다.
문제: 이야기꾼의 "미끄러운 경사"
이러한 로봇을 위한 기존 안전 장치는 클럽 입구의 도어맨처럼 작동합니다. 그들은 당신의 티켓 (텍스트 프롬프트) 을 "폭탄"이나 "칼" 같은 나쁜 단어가 있는지 확인합니다. 나쁜 단어를 발견하면 입장을 막습니다.
하지만 이 접근법에는 맹점이 있습니다. 바로 시간에 따른 이야기 흐름을 이해하지 못한다는 점입니다.
- 구식 방식: "주차장에서 논쟁하는 두 남자"라고 말하면, 도어맨은 무기가 없음을 확인하고 입장을 허락합니다.
- 로봇의 실수: 로봇은 좋은 영화를 만들려다, "좋아, 논쟁은 보통 밀치기로 이어지고, 밀치기는 싸움으로 이어지지"라고 생각합니다. 그래서 로봇은 가혹한 싸움 장면을 담은 영상을 생성합니다.
- 결과: 당신은 논쟁을 요청했지만, 폭력적인 영화를 얻게 됩니다. "나쁜" 부분은 당신의 말에 있었던 것이 아니라, 이야기가 어떻게 전개되어야 하는지에 대한 로봇의 상상 속에 있었습니다.
해결책: TrajShield (시나리오 편집자)
이 논문의 저자들은 TrajShield를 개발했습니다. 이는 단순히 티켓을 확인하는 것이 아니라, 영화 촬영 전에 이야기를 읽는 시나리오 편집자처럼 작동하는 새로운 안전 시스템입니다.
다음은 간단한 3 단계 프로세스로 작동하는 방식입니다:
1. 이야기 분해 (운동 - 의미 분리)
로봇의 프롬프트를 엉킨 털실 뭉치라고 상상해 보세요. TrajShield 는 이를 세 가지 명확한 부분으로 풀어냅니다:
- 배경 (정적): 누가 있는가? 그들은 어디에 있는가? 그것은 어떻게 보이는가? (예: "두 남자, 주차장, 밤 시간.")
- 줄거리 (동적): 다음에 무슨 일이 일어나는가? (예: "그들이 논쟁하고, 그 다음에는...")
- 목표 (의도): 사용자는 실제로 무엇을 보여주고자 하는가? (예: "긴장감 넘치는 장면.")
배경과 행동을 분리함으로써 시스템은 이야기를 수정할 때 실수로 캐릭터나 장소를 바꾸지 않도록 보장합니다. 오직 줄거리만 건드리게 됩니다.
2. 미래 시뮬레이션 (시간적 위험 전파)
로봇이 실제로 영상을 만들기 전에 TrajShield 는 "정신적 시뮬레이션"을 실행합니다. *"내가 이 논쟁으로 시작한다면, 가장 가능성 있는 다음 장면은 무엇일까? 그리고 그다음 장면은?"*이라고 묻습니다.
이는 이야기의 미래에 대한 "위험 지도"를 구축합니다. 이야기가 위험으로 미끄러지기 시작하는 정확한 순간을 찾아냅니다.
- 예시: "논쟁" "외침" "밀치기"가 위험한 경로임을 감지합니다.
- 이는 방아쇠 지점을 식별합니다. 이야기가 "안전"에서 "위험"으로 전환되는 정확한 순간 (예: 외침이 밀치기로 변하는 순간) 을 찾아냅니다.
3. 최소한의 재작성 (시간적 일관성 안전 재작성)
방아쇠 지점을 찾으면 TrajShield 는 이야기에 "수술"을 가합니다. 전체 영화를 삭제하지 않습니다. 대신, 나머지 모든 것을 그대로 유지하면서 이야기를 안전한 방향으로 이끌기 위해 위험한 부분의 줄거리만 다시 씁니다.
- 원래 위험한 경로: 논쟁 외침 싸움 (위험!)
- TrajShield 의 재작성: 논쟁 외침 분노하며 떠나감 (안전!)
결과는 여전히 사용자의 원래 아이디어 (긴장감, 극적임, 주차장의 두 남자) 를 느끼게 하는 영상이지만, 폭력적으로 변하기 전에 멈춥니다. "이야기"는 자연스럽게 흐르되, 안전한 방향으로 흐릅니다.
왜 이것이 중요한가
이 논문은 이 시스템을 폭력, 불법 행위, 또는 불쾌한 콘텐츠와 같은 14 가지 유형의 안전 위험과 6 가지 다른 영상 생성 모델에 대해 테스트했습니다.
- 결과: TrajShield 는 이전 방법들보다 약 52% 더 많은 위험한 영상을 차단했습니다.
- 품질: 결정적으로, 좋은 영상을 망치지 않았습니다. 안전한 프롬프트가 주어지면 결과 영상은 여전히 사용자가 원했던 것과 정확히 같았습니다. 평화로운 장면을 지루한 것으로 바꾸지 않았을 뿐만 아니라, 위험으로 이어지는 "미끄러운 경사"를 방지했을 뿐입니다.
결론
TrajShield를 이야기가 절벽에서 떨어지기 전에 잡아주는 안전망으로 생각하세요. 단순히 단어를 금지하는 대신, 이야기에는 방향이 있다는 점을 이해합니다. 이는 로봇의 마음속에서 이야기가 펼쳐지는 것을 지켜보다가, 궤도에서 벗어나려 하는 순간을 포착하여 배경이나 캐릭터를 변경하지 않고도 부드럽게 안전한 경로로 되돌립니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.