← 최신 논문
💻 computer science

Pulling The REINS: Training-Free Safety Alignment of Video Diffusion Models via Representation Steering

이 논문은 비디오 확산 모델의 내부 표현을 추론 시점에 안전한 생성 방향으로 유도함으로써 모델을 정렬하는 훈련이 필요 없는 방법인 REINS를 소개하며, 이는 일반적인 능력을 저하시키지 않으면서 다양한 모델과 규모에 걸쳐 유해한 콘텐츠를 효과적으로 차단하기 위해 지도 PCA(Supervised PCA)를 통해 발견된 단일 선형 방향을 활용한다.

원저자: Rohit Kundu, Arindam Dutta, Sarosij Bose, Athula Balachandran, Amit K. Roy-Chowdhury

게시일 2026-06-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Rohit Kundu, Arindam Dutta, Sarosij Bose, Athula Balachandran, Amit K. Roy-Chowdhury

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: 야생마

강력한 비디오 생성 AI(비디오 확산 모델)를 하나의 야생마라고 상상해 보세요. 이 말은 매우 재능이 넘칩니다. 당신이 무엇을 요청하든 극사실적인 장면 속으로 질주할 수 있죠. 하지만 이 말은 길들여지지 않았기 때문에, 만약 당신이 위험한 것(예: "싸움 장면을 보여줘" 또는 "가짜 뉴스를 만들어줘")을 요청하면 기꺼이 그대로 수행할 것입니다.

현재 사람들은 이 말을 멈추기 위해 두 가지 방법을 사용하지만, 둘 다 큰 결함이 있습니다:

  1. 문지기 (프롬프트 필터링): 말이 달리기 시작하기 전에 당신의 요청을 검사하여 막으려고 시도합니다. 만약 당신이 "싸움"이라고 말하면 차단됩니다. 하지만 영리한 협잡꾼은 대신 "갈등이 있는 극적인 장면"이라고 말하여 문을 통과해 버릴 수 있습니다.
  2. 쓰레기통 (출력 필터링): 말이 달리게 내버려 두고 비디오를 만든 다음, 결과물을 확인합니다. 만약 그것이 위험하다면 쓰레기통에 던져버립니다. 이는 비디오를 만드는 데 들어간 모든 에너지와 시간을 낭비하게 만들며, 말은 여전히 그 위험한 경로로 달리는 법을 학습하게 됩니다.

해결책: REINS (조종 핸들)

저자들은 REINS(REpresentation-space INference-time Safety steering)를 소개합니다. REINS는 말을 막거나 비디오를 버리는 대신, 말이 달리는 동안 말의 뇌에 직접 연결된 조종 핸들처럼 작동합니다.

이 방식은 말을 다시 훈련시키지 않습니다 (비싼 교육 세션이 필요 없습니다). 말의 근육을 바꾸지도 않습니다 (가중치 업데이트가 없습니다). 그저 비디오를 생성하는 동안 말의 내부적인 생각을 안전한 방향으로 살짝 밀어줄 뿐입니다.

작동 원리: "안전 나침반"

1. "안전선" 찾기
연구자들은 AI의 뇌 내부(구체적으로는 "숨겨진 상태" 또는 내부적 생각)에 "안전한" 아이디어와 "안전하지 않은" 아이디어를 구분하는 명확하고 곧은 선이 있다는 것을 발견했습니다.

  • 비유: AI의 뇌가 거대한 지도라고 상상해 보세요. 모든 "안전하지 않은" 비디오는 왼쪽에 모여 있고, 모든 "안전한" 비디오는 오른쪽에 모여 있습니다.
  • 발견: **지도 학습 PCA(Supervised PCA)**라는 수학적 기법을 사용하여, 그들은 "안전하지 않은" 쪽에서 "안전한" 쪽으로 곧게 뻗은 하나의 화살표(방향)를 찾아냈습니다.

2. 밀어주는 완벽한 타이밍
여행의 아주 시작 단계(아직 지도가 그려지지 않음)나 아주 끝 단계(이미 충돌함)에는 자동차를 조종할 수 없습니다.

  • 논문은 가장 좋은 타이밍이 과정의 중간(비디오 생성 과정의 약 50% 지점)이라는 것을 밝혀냈습니다.
  • 비유: 이것은 배가 바다 한가운데 있을 때 배를 조종하는 것과 같습니다. 너무 일찍 조종하면 배가 회전할 만큼의 추진력을 얻지 못합니다. 너무 늦게 조종하면 이미 바위에 부딪히고 있는 상태입니다. "중간 레이어"는 AI가 요청을 이해할 만큼 충분한 정보를 가지고 있으면서도, 동시에 마음을 바꿀 수 있을 만큼 유연한 최적의 지점(sweet spot)입니다.

3. 부드러운 밀기
AI가 비디오를 생성할 때, REINS는 내부적인 생각에 대해 지도의 "안전한" 쪽을 향하는 작고 계산된 밀기(push)를 더합니다.

  • 결과: 만 만약 당신이 "폭력적인 싸움"을 요청한다면, AI는 단순히 거절하는 것이 아닙니다. 대신 조종 핸들을 따라 "극적인 대치 상황"이나 "스포츠 경기"를 생성합니다. 요청의 정신(액션, 움직임)은 유지하면서, 위험한 내용을 안전한 것으로 교체합니다.

왜 특별한가

  • 보이지 않음: AI는 자신이 조종되고 있다는 사실을 모릅니다. 그저 자연스럽게 비디오를 생성하고 있다고 생각할 뿐입니다.
  • 강력함: 해커가 교묘한 프롬프트(탈옥)로 AI를 속이려 해도, "조종 핸들"은 여전히 작동합니다. 왜냐하면 단어가 아닌 생각을 수정하기 때문입니다.
  • 빠름: AI를 다시 훈련시킬 필요가 없습니다. 방향을 한 번만 계산하면, 그 후에는 AI가 만드는 어떤 비디오에도 사용할 수 있습니다.
  • 어디서나 작동함: 저자들은 이 방식을 9가지의 서로 다른 비디오 모델(작은 것부터 큰 것까지)에 테스트했으며, 텍스트를 입력하거나 이미지를 업로드하여 비디오를 시작하는 경우 모두에서 작동함을 확인했습니다.

트레이드오프 (The "Goldilocks" Zone)

논문은 흥미로운 발견을 언급합니다: 안전 정보는 AI가 더 깊게 생각할수록 쌓이지만, AI의 마음을 바꿀 수 있는 능력은 더 깊이 들어갈수록 약해집니다.

  • 너무 얕음: AI가 아직 충분히 생각하지 못했습니다. 조종이 효과를 발휘하지 못합니다.
  • 너무 깊음: AI가 이미 무엇을 할지 결정했습니다. 지금 밀어붙이면 글리치(오류)가 발생하거나 비디오가 깨집니다.
  • 딱 적당함: 중간 레이어는 AI가 요청을 이해할 수 있게 하면서도, 안전을 향해 방향을 틀 수 있을 만큼 여전히 유연합니다.

요 요약

REINS는 야생의 비디오 제작마에 GPS 가이드 자동 항법 장치를 설치하는 것과 같습니다. 이 방식은 말의 달리기를 멈추지 않으며, 말에게 새로운 기술을 가르칠 필요도 없습니다. 그저 말의 내부적인 생각이 위험한 절벽에서 벗어나 안전하고 경치 좋은 경로로 향하도록 부드럽게 안내하여, 최종 비디오가 아름다우면서도 무해하도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →