← 최신 논문
💻 computer science

Grounded Forcing: Bridging Time-Independent Semantics and Proximal Dynamics in Autoregressive Video Synthesis

이 논문은 장기적 의미 일관성, 시각적 드리프트, 제어성 손실이라는 세 가지 과제를 해결하기 위해 듀얼 메모리 KV 캐시, 듀얼 레퍼런스 RoPE 주입, 비대칭 근접 리캐치 메커니즘을 통합한 'Grounded Forcing' 프레임워크를 제안하여 상호작용형 장편 비디오 합성의 안정성과 일관성을 획기적으로 개선합니다.

원저자: Jintao Chen, Chengyu Bai, Junjun hu, Xinda Xue, Mu Xu

게시일 2026-04-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jintao Chen, Chengyu Bai, Junjun hu, Xinda Xue, Mu Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"Grounded Forcing(그라운딩 포싱)"**이라는 새로운 기술을 소개합니다. 이 기술은 오래 지속되는 비디오를 자동으로 만들어주는 AI의 가장 큰 약점들을 해결해 줍니다.

쉽게 비유하자면, 이 AI 는 **"기억력이 좋고, 방향 감각이 뛰어나며, 사용자의 지시를 잘 따르는 최고의 영화 감독"**이 되려는 시도입니다.

기존의 AI 는 긴 영상을 만들 때 세 가지 큰 문제를 겪었습니다. 이 논문은 그 세 가지 문제를 각각 다른 비유로 해결했습니다.


1. 문제: "기억 상실증" (Semantic Forgetting)

상황: AI 가 1 분, 10 분짜리 영상을 만들다 보면, "처음에 등장했던 주인공이 누구였지?"를 잊어버립니다. 할아버지가 등장했는데, 중간에 강아지가 나오면 할아버지가 사라지거나, 할아버지가 갑자기 강아지로 변해버리는 식입니다.
기존의 해결책: "처음 장면만 계속 기억해라!"라고 강요했지만, 이렇게 하면 새로운 등장인물 (예: 할아버지 옆에 나타난 슈퍼히어로) 을 받아들이지 못하고 고집을 부립니다.

🌟 Grounded Forcing 의 해결책: "이중 메모리 시스템"
이 기술은 AI 의 머리를 두 개의 방으로 나눕니다.

  • 방 1 (로컬 메모리): 최근 10 초 동안의 움직임만 빠르게 기억합니다. (예: 사람이 걷는 동작, 바람이 불어오는 모습)
  • 방 2 (글로벌 메모리): 영상의 핵심 정체성을 영구적으로 저장합니다. (예: "할아버지", "고양이", "배경의 집")
  • 비유: 마치 극장 같습니다. 무대 위의 배우들 (로컬 메모리) 은 계속 바뀌고 움직이지만, 극장의 간판과 무대 배경 (글로벌 메모리) 은 영구적으로 고정되어 있어 "이 영화가 어떤 이야기인지"를 잊지 않게 해줍니다. 새로운 캐릭터가 등장하면, 이 간판에 추가만 할 뿐, 기존 간판은 지우지 않습니다.

2. 문제: "방향 감각 상실" (Visual Drift)

상황: AI 는 시간이 지날수록 "지금 몇 번째 프레임인가?"를 혼동합니다. 훈련할 때는 100 초까지 봤는데, 1000 초가 넘어가면 AI 가 "이게 무슨 시간이지?"라며 길을 잃습니다. 그 결과 영상이 뭉개지거나, 캐릭터가 기괴하게 변형됩니다.
원인: AI 는 절대적인 시간 번호 (1 번, 2 번, 3 번...) 를 붙여서 기억하는데, 시간이 무한히 늘어나면 이 번호들이 훈련 데이터 범위를 벗어나기 때문입니다.

🌟 Grounded Forcing 의 해결책: "이중 시간표"
이 기술은 시간 번호를 붙이는 방식을 바꿉니다.

  • 글로벌 메모리에는 "영원한 0 번"을 붙입니다: "할아버지"라는 캐릭터는 시간이 몇 시가 되든 항상 '0 번' 위치에서 기억됩니다. 그래서 시간이 흘러도 할아버지의 모습이 변하지 않습니다.
  • 로컬 메모리에는 "상대적 시간"을 붙입니다: "지금 걷는 동작"은 항상 '최근 20 초' 안에서만 1 번, 2 번, 3 번으로 다시 매겨집니다.
  • 비유: 항해를 생각해보세요. 배 (로컬 메모리) 는 파도 (움직임) 에 따라 계속 움직이지만, 등대 (글로벌 메모리) 는 항상 같은 곳에 고정되어 있습니다. 배가 아무리 멀리 가도 등대를 보면 "아, 내가 어디에 있는지 알겠다"라고 방향을 잃지 않습니다.

3. 문제: "지시 따르기 실패" (Controllability Loss)

상황: 사용자가 "걸어라"라고 했다가 갑자기 "달려라"라고 지시하면, AI 는 당황합니다. 갑자기 모든 것을 잊어버리고 새로 시작하거나, 반대로 지시를 무시하고 계속 걷기만 합니다.
기존의 해결책: 지시가 바뀌면 메모리를 모두 지우고 새로 시작했습니다. 하지만 이렇게 하면 "그런데 그 사람은 누구지?"라는 연결 고리가 끊어집니다.

🌟 Grounded Forcing 의 해결책: "점진적인 기억 교체 (비대칭 리캐시)"
지시가 바뀌었을 때, 메모리를 한 번에 다 지우는 게 아니라 시간에 따라 다르게 처리합니다.

  • 가장 최근의 장면: 새로운 지시 ("달려라") 를 100% 반영합니다.
  • 오래된 장면: 이전의 맥락 ("그 사람은 누구였지?") 을 100% 유지합니다.
  • 중간 장면: 두 가지 사이의 비율로 부드럽게 섞입니다.
  • 비유: 강물을 생각해보세요. 새로운 지시는 강 상류에서 떨어지는 물방울처럼 가장 먼저 흘러갑니다. 하지만 강 하류 (과거의 기억) 에는 이미 흐르던 물 (이전 맥락) 이 섞여 있어 갑자기 색이 변하지 않습니다. 이렇게 하면 "걸다가 달리기 시작하는" 자연스러운 전환이 가능해집니다.

🎬 요약: 이 기술이 가져온 변화

이 논문은 **"Grounded Forcing"**이라는 기술을 통해, AI 가 1 분 이상의 긴 영상을 만들 때 다음과 같은 능력을 갖게 했습니다.

  1. 기억력: 할아버지, 고양이, 강아지가 동시에 등장해도, 시간이 지나도 서로의 정체성을 잃지 않습니다.
  2. 방향 감각: 영상이 길어질수록 흐트러지지 않고 선명한 화질을 유지합니다.
  3. 유연성: "할아버지가 산책을 하다가, 갑자기 고양이가 나타나고, 그다음에 비가 오게 해줘"라고 지시하면, AI 는 자연스럽게 장면 전환을 해냅니다.

결론적으로, 이 기술은 AI 가 **단순한 영상 생성기를 넘어, 사용자와 대화하며 긴 이야기를 만들어내는 '인터랙티브 영화 제작자'**가 될 수 있는 발판을 마련했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →