← 최신 논문
🤖 machine learning

Mitigating Compounding Error via Video Representation Regularization

이 논문은 자기회귀적 비디오 생성에서의 오차 누적이 은닉 표현의 차원 붕괴에서 기인하며 데이터 스케일링만으로는 불충분하다는 점을 밝히고, 장기 생성의 안정성을 유의미하게 높이고 시각적 품질 지표를 개선하는 경량 비디오 표현 정규화 방법을 제안한다.

원저자: Taiye Chen, Qi Zhang, Yisen Wang

게시일 2026-07-30
📖 6 분 읽기🧠 심층 분석

원저자: Taiye Chen, Qi Zhang, Yisen Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 영원히 프레임 단위로 영화를 꿈꾸도록 가르치고 있다고 상상해 보세요. 이것은 단순히 예쁜 그림을 그리는 것이 아닙니다. 사물이 시간이 흐름에 따라 어떻게 움직이고, 변하며, 상호작용하는지를 이해하는 '세계 모델(world model)', 즉 디지털 두뇌를 구축하는 일입니다. 과학자들이 이 모델에 집착하는 이유는 이것이 언젠가 자율주행차가 교통 상황을 예측하거나, 로봇이 주방을 망가뜨리지 않고 요리하는 법을 배우거나, 비디오 게임이 스스로 무한하고 독특한 이야기를 생성하도록 도울 수 있기 때문입니다. 이를 위해 로봇은 '자기회귀 생성(autoregressive generation)'이라는 기술을 사용하는데, 이는 직역하자면 로봇이 자신이 만든 지난 몇 개의 프레임을 보고 다음에 올 것을 추측한 뒤, 그 추측을 이야기에 더하고, 다시 그 새로운 추측을 사용하여 그다음 프레임을 알아내는 똑똑한 방식입니다. 이것은 마치 아주 똑똑한 예술가가 벌이는 '전화 놀이(telephone game)'와 같습니다. 한 차례의 결과물이 다음 차례의 입력값이 되는 것이죠.

이 게임의 큰 문제는 예술가가 첫 번째 추측에서 아주 작은 실수라도 하면, 그 실수가 줄줄이 이어지는 것입니다. 다음 차례에 예술가는 그 실수를 고치려 노력하지만 오히려 상황을 악화시키고, 백 번째 프레임에 도달할 때쯤이면 영화는 정지 화면의 노이즈나 눈부시게 하얀 화면으로 변해버립니다. 이를 '누적 오차(compounding error)'라고 부릅니다. 오랫동안 과학계는 해결책이 간단하다고 생각했습니다. 바로 로봇에게 더 많은 학습 데이터를 제공하는 것이죠. 로봇에게 수백만 개의 영화를 더 보여주면 완벽해질 것이라는 논리였습니다. 하지만 만약 로봇이 영화를 충분히 보지 못해서 게으른 것이 아니라, 게임이 길어질 때 뇌를 망가뜨리는 일종의 '정신적 지름길'을 택하고 있는 것이라면 어떨까요?

이 논문은 바로 이 미스터리를 파헤칩니다. 왜 비디오 생성 로봇들이 시간이 지나면 미쳐버리는지 조사하고, 기존의 해결책인 '단순히 데이터 추가하기'가 사실은 상황을 악화시킨다는 것을 발견했습니다. 저자들은 로봇의 내부적인 '생각'(은닉 표현, hidden representations)이 붕괴하고 다양성을 잃기 시작한다는 것을 발견했습니다. 마치 사람들이 갑자기 모두 똑같은 문장을 속삭이기 시작하는 북적이는 방처럼 말이죠. 이를 해결하기 위해 그들은 '비디오 표현 정규화(Video Representation Regularization, VRR)'라는 새로운 훈련 규칙을 도입했습니다. 이는 엄격한 코치처럼 작동하여, 로봇이 자신의 생각을 다양하고 날카롭게 유지하도록 강제합니다. 그 결과, 로봇은 이제 무너지지 않고 길고 일관된 비디오를 생성할 수 있게 되었으며, 이는 때때로 더 많은 데이터보다 더 많은 데이터와 더 많은 규율이 중요하다는 것을 증명합니다.

사라져가는 영화의 이야기

비디오 세계 모델을 디지털 스토리텔러라고 생각해 보세요. 당신이 비디오의 처음 몇 초를 주면, 그것은 한 프레임씩 예측하여 나머지 영화를 완성하려고 노력합니다. 이것은 마치 화가가 자신이 그린 마지막 붓터치만을 보고 벽화를 완성해야 하는 것과 같습니다. 만약 그들이 작은 얼룩을 남긴다면, 다음 붓터치는 그것을 덮으려 하겠지만 결국 더 큰 엉망을 만들게 되고, 곧 전체 그림은 망가지고 맙니다. AI의 세계에서는 이를 '누적 오차' 또는 '드리프트(drift)'라고 부릅니다. 비디오는 처음에 아주 멋져 보이지만, 시간이 지나면 무작위 노이즈나 과하게 노출된 덩어리로 변해버립니다.

오랫동안 연구자들은 이에 대한 답이 명확하다고 생각했습니다. "더 많은 학습 데이터가 필요해!"라는 것이었죠. AI가 세상이 움직이는 방식에 대한 충분한 사례를 본다면 결코 실수하지 않을 것이라는 생각이었습니다. 하지만 이 논문의 저자들은 로봇이 긴 비디오를 생성하는 동안 그 내부에서 실제로 어떤 일이 일어나고 있는지 확인하기 위해 뚜껑을 열어보기로 했습니다.

비밀: 뇌가 '붕괴'하고 있다

연구팀은 놀라운 사실을 발견했습니다. 비디오가 무너지기 시작하는 순간, 모델 내부에서도 동시에 다른 일이 일어나고 있다는 것을 발견했습니다. 바로 내부 '표현(representations)'이 붕괴하고 있다는 것입니다.

모델의 뇌를 수천 권의 서로 다른 책(표현)을 가진 도서관이라고 상상해 보세요. 모델이 잘 작동할 때는 풍부하고 상세한 장면을 만들기 위해 다양한 책을 꺼내 씁니다. 하지만 비디오 생성이 계속됨에 따라, 모델은 대부분의 책을 잊어버리기 시작합니다. 모델은 전체 도서관을 사용하는 대신 단 한두 권의 좋아하는 책에만 의존하며, 똑같은 아이디어를 반복해서 내놓습니다. 저자들은 이를 '차원 붕괴(dimensional collapse)'라고 부릅니다.

이를 측정하기 위해 그들은 '유효 랭크(effective rank, erank)'라는 지표를 사용했습니다. erank를 모델의 뇌가 사용하는 서로 다른 '방향'의 점수라고 생각하세요. 높은 점수는 뇌가 여러 가지 방식으로 생각하고 있음을 의미하고, 낮은 점수는 뇌가 틀에 박혀 있음을 의미합니다. 그들은 비디오 품질이 노이즈로 무너지기 시작하는 바로 그 시점에 erank 점수가 급락한다는 것을 발견했습니다. 완벽하게 일치합니다. 뇌가 지루해지면 비디오도 망가집니다.

'더 많은 데이터'라는 신화

여기서 이 논문은 정말 흥SA적인 부분을 보여줍니다. 저자들은 "더 많은 데이터가 좋다"는 기존 이론을 테스트했습니다. 그들은 18,000개의 마인크래프트 게임 플레이 영상으로 구성된 거대한 데이터셋으로 모델을 훈련시켰습니다. 그들은 모델이 더 많은 영상을 볼수록 긴 비디오를 만드는 데 더 능숙해질 것이라고 기대했습니다.

하지만 결과는 정반대였습니다. 이 거대한 데이터셋으로 모델을 더 오래 훈련시킬수록, 모델은 긴 비디오를 생성하는 능력이 오히려 더 나빠졌습니다. 유효 랭크(생각의 다양성)가 훨씬 더 낮아진 것입니다. 모델에게 너무 많은 데이터가 주어지면, 모델은 '지름길'을 배운다는 것을 발견했습니다. 세상이 어떻게 움직이는지 진정으로 이해하는 대신, 훈련 중에 높은 점수를 받는 가장 쉬운 방법인 '이전 프레임을 그대로 복사하기'를 배우는 것입니다. 이 지름길은 짧은 클립에서는 잘 작동하지만, 모델이 오랫동안 지속해야 할 때는 지름길이 실패하고 비디오가 붕괴됩니다.

따라서 이 논문은 단순히 데이터셋의 규모를 키우는 것이 해결책이라는 생각을 명시적으로 부정합니다. 사실, 이 특정 문제에 있어서는 더 많은 데이터를 던져주는 것이 상황을 더 악화시킬 수 있습니다.

해결책: 엄격한 코치 (VRR)

모델이 지름길을 택하고 뇌가 붕괴하고 있다면, 어떻게 고칠 수 있을까요? 저자들은 **비디오 표현 정규화(Video Representation Regularization, VRR)**라는 새로운 방법을 제안합니다.

당신이 학생에게 글쓰기를 가르치고 있다고 상상해 보세요. 만약 그냥 원하는 대로 쓰게 내버려 둔다면, 학생은 게을러져서 같은 문구를 반복할 수도 있습니다. 하지만 "모든 문장에 새롭고 독특한 단어를 사용해야 한다"라는 규칙을 추가한다면, 학생은 더 열심히 생각하고 어휘를 다양하게 유지하도록 강요받을 것입니다. VRR은 AI에게 정확히 이 역할을 수행합니다.

훈련 중에 저자들은 특별한 '패널티' 또는 '정규화' 항을 추가합니다. 이 항은 모델의 내부 뇌 상태(은닉층)를 점검하고, 모델이 몇 가지 특정 패턴에 너무 많이 의존하기 시작하면 벌칙을 줍니다. 이는 모델이 높은 '유효 랭크'를 유지하도록 강제하여, 비디오가 길어지더라도 도서관의 다양한 '책'들을 계속해서 사용하도록 보장합니다.

결과: 새로운 기록

연구팀은 이 새로운 방법을 '디퓨전 포싱(Diffusion Forcing)'이라는 인기 있는 방법론을 포함한 현재 최고의 기술들과 비교 테스트했습니다. 그들은 비디오가 얼마나 좋은지를 측정하기 위해 VBench라는 표준 점수 시스템을 사용하여 '미적 품질(Aesthetic Quality, 얼마나 예쁜가)'과 '이미징 품질(Imaging Quality, 얼마나 선명하고 노이즈가 없는가)'을 측정했습니다.

결과는 극적이었습니다.

  • 디퓨전 포싱 (기존 방식): 16,000 스텝 동안 훈련했을 때, 미적 품질 점수는 38.65, 이미징 품질은 44.37이었습니다.
  • VRR (새로운 방식): 동일한 양의 훈련을 진행했을 때, 미적 품질은 55.56으로 뛰었고, 이미ging 품질은 72.08로 치솟았습니다.

더 인상적인 것은, 기존 방식들이 훈련을 오래 할수록 성능이 떨어지는 반면, VRR 방식은 계속해서 좋아지고 안정적이었다는 점입니다. 비디오가 재생되는 과정을 지켜보면, 기존 방식들은 몇 분 후에 정지 화면의 노이즈처럼 변했지만, VRR 방식은 훨씬 더 오랫동안 명확하고 일관된 비디오를 생성했습니다.

이것이 의미하는 바

이 논문은 단순히 새로운 기술 하나를 제시하는 것이 아니라, 우리가 이 문제를 생각하는 방식을 바꿉니다. 이 모델들이 긴 비디오에서 실패하는 이유는 충분한 사례를 보지 못해서가 아니라, 게으르게 학습하고 있기 때문이라는 점을 시사합니다. 그들의 내부적인 사고를 다양하게 유지하도록 강제함으로써, 우리는 '전화 놀이'가 무너지는 것을 막을 수 있습니다.

저자들은 이 방법이 테스트에서 매우 효과적이었지만, 여전히 의문이 남아 있다는 점을 주의 깊게 언급했습니다. 왜 더 많은 데이터가 지름길 형성을 유발하는지, 혹은 모델이 정확히 어떤 지름길을 배우는지에 대해서는 완전히 알지 못합니다. 하지만 모델의 뇌를 활발하고 다양하게 유지하는 단순한 규칙이 비디오가 노이즈로 변하는 문제를 해결할 수 있다는 점은 입증했습니다. 이는 AI의 세계에서 더 나은 미래를 위한 열쇠가 단순히 더 많은 데이터가 아니라, 더 나은 규율일 수 있음을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →