← 최신 논문
💻 computer science

TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation

이 논문은 다중 이벤트 비디오 생성 시 발생하는 시간적 불일치와 주의력 충돌 문제를 해결하기 위해, 추가 학습 없이 기존 텍스트 - 비디오 모델에 통합되어 일관성과 프롬프트 준수 능력을 동시에 향상시키는 'TS-Attn'이라는 새로운 어텐션 메커니즘을 제안합니다.

원저자: Hongyu Zhang, Yufan Deng, Zilin Pan, Peng-Tao Jiang, Bo Li, Qibin Hou, Zhiyang Dou, Zhen Dong, Daquan Zhou

게시일 2026-04-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hongyu Zhang, Yufan Deng, Zilin Pan, Peng-Tao Jiang, Bo Li, Qibin Hou, Zhiyang Dou, Zhen Dong, Daquan Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎬 TS-Attn: 비디오 생성 AI 를 위한 '시간 분할' 마법

이 논문은 **"복잡한 이야기를 한 번에 영상으로 만들어주는 AI"**의 문제를 해결한 새로운 기술을 소개합니다.

기존의 AI 는 "강아지가 공을 쫓다가, 벽에 부딪히고, 다시 굴러가는 영상"처럼 여러 사건이 이어지는 복잡한 지시를 받으면 혼란을 겪었습니다. 강아지가 공을 쫓는 순간과 벽에 부딪히는 순간이 섞여버리거나, 아예 일부 사건이 사라져버리는 일이 잦았습니다.

이 문제를 해결한 **TS-Attn (Temporal-wise Separable Attention)**이라는 기술을 쉽게 설명해 드리겠습니다.


🤔 왜 기존 AI 는 헷갈렸을까요? (문제 상황)

기존 AI 는 영화를 감독하는 혼란스러운 감독과 같습니다.

  • 상황: 배우 (강아지) 에게 "먼저 공을 쫓아, 그다음 벽에 부딪혀, 마지막으로 굴러가"라고 지시합니다.
  • 문제: AI 는 이 지시들을 한 번에 모두 들으려다 보니, "벽에 부딪히는" 장면에서 갑자기 "공을 쫓는" 행동을 하거나, "굴러가는" 동작이 "벽에 부딪히는" 장면과 뒤섞여 버립니다.
  • 결과: 시간이 흐르는 순서가 꼬인, 어색하고 부자연스러운 영상이 나옵니다.

💡 TS-Attn 의 해결책: "시간대별 역할 분담"

TS-Attn 은 이 혼란을 해결하기 위해 **매우 똑똑한 '시간 관리 비서'**를 도입했습니다. 이 비서의 핵심 아이디어는 **"각 사건은 제때에, 제자리에서 일어나게 하자"**는 것입니다.

1. 🎭 무대 위의 '주인공'만 집중하기 (운동 영역 추출)

비서 (TS-Attn) 는 먼저 영상 속의 무엇이 움직이고 있는지를 정확히 파악합니다.

  • 비유: 무대 위에 강아지 (주인공) 가 있고 배경은 정적인 풍경이라면, 비서는 "강아지가 움직이는 부분만 집중하고, 배경은 무시하자"라고 정합니다.
  • 효과: 불필요한 정보에 신경 쓰지 않고, 진짜 중요한 '동작'에만 집중하게 됩니다.

2. ⏱️ 시간대를 나누어 지시하기 (주의력 재배치)

이제 비서는 AI 에게 지시를 내릴 때, 시간순서대로 딱딱 끊어서 전달합니다.

  • 기존 방식: "공 쫓기 + 벽 부딪히기 + 굴러가기"를 한 번에 섞어서 말함.
  • TS-Attn 방식:
    • 0~3 초: "이 시간엔 오직 '공 쫓기'만 해! 다른 건 생각하지 마!"
    • 3~6 초: "이제 '벽 부딪히기'만 해! 공 쫓기는 잊어버려."
    • 6~9 초: "마지막으로 '굴러가기'만 해!"
  • 효과: AI 는 매 순간 어떤 행동을 해야 할지 명확하게 알게 되어, 사건들이 순서대로 자연스럽게 이어집니다.

3. 🔊 목소리 크기 조절하기 (주의력 강화)

만약 AI 가 "공 쫓기"를 할 때 목소리가 너무 작게 들린다면 (집중이 안 됨), 비서는 그 부분의 목소리를 크게 키워줍니다.

  • 비유: 중요한 지시사항에는 "이거 정말 중요해!"라고 강조하고, 관련 없는 지시사항에는 "그건 나중에 해"라고 소리를 줄입니다.
  • 효과: AI 가 헷갈리지 않고 정확한 순간에 정확한 행동을 하도록 돕습니다.

🚀 이 기술의 놀라운 점 (장점)

  1. 학습 불필요 (Training-free):

    • 기존에 이런 문제를 해결하려면 AI 를 다시 가르치는 (학습) 데 몇 달이 걸리고 엄청난 돈이 들었습니다.
    • 하지만 TS-Attn 은 이미 훈련된 AI 에 그냥 끼워만 넣으면 (Plug-and-play) 바로 작동합니다. 마치 좋은 카메라 렌즈를 기존 카메라에 끼우는 것처럼 쉽습니다.
  2. 속도도 빠름:

    • 복잡한 작업을 하더라도 영상 생성 속도는 거의 느려지지 않습니다. (약 2% 만 증가)
  3. 다양한 모델 적용 가능:

    • 다양한 최신 비디오 생성 모델 (Wan2.1, Wan2.2, CogVideoX 등) 에 모두 적용할 수 있습니다.

📊 실제 결과

이 기술을 적용한 결과, 복잡한 이야기를 영상으로 만드는 능력 (StoryEval-Bench 점수) 이 30% 이상이나 향상되었습니다.

  • 예시: "강아지가 공을 쫓다가 벽에 부딪히고, 그 공이 굴러가서 고양이를 놀라게 한다"는 지시를 받았을 때, AI 는 강아지, 공, 벽, 고양이의 순서와 상호작용을 완벽하게 이해하고 자연스러운 영상을 만들어냅니다.

🎯 결론

TS-Attn은 AI 가 복잡한 이야기를 이해할 때, **시간의 흐름을 따라 각 사건을 분리해서 처리하게 해주는 똑똑한 '시간 관리 비서'**입니다. 덕분에 AI 는 이제 영화 감독처럼, 여러 사건이 얽힌 복잡한 스토리도 흐트러짐 없이 멋진 영상으로 만들어낼 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →