VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System
VideoCoCo는 실행 가능한 Blender 코드를 프로세스 수준의 사고 사슬(chain of thought)로 활용하여, 먼저 결정론적인 시공간 초안을 생성한 다음 이를 사실적인 출력물로 정교화함으로써 물리적으로 일관된 비디오를 생성하는 에이전트 기반 듀얼 엔진 프레임워크를 도입하며, 이는 물리적 일관성 벤치마크에서 기존 베이스라인들을 크게 능가합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 단순히 "맛있게 만들어줘"라고 속삭여서 케이크를 굽는 법을 가르치는 상황을 상상해 보세요. 로봇은 "맛있는"이라는 단어는 이해할 수 있겠지만, 레시피가 없다면 밀가루를 섞기 전에 달걀을 먼저 섞어야 하는지, 얼마나 오래 구워야 하는지, 혹은 왜 케이크가 벽돌처럼 딱딱해지면 안 되는지 알지 못합니다. 이것이 현재 인공지능 비디오 생성 분야가 겪고 있는 문제입니다. 과학자들은 텍나 설명으로부터 움직이는 영상을 만들어내는 모델을 구축하고 있지만, 이 AI "몽상가"들은 물리 법칙을 다루는 데 종종 어려움을 겪습니다. 공이 아래로 떨어지는 대신 위로 떠오르게 하거나, 유리가 바닥에 닿기도 전에 깨지게 만드는 식인데, 이는 AI가 세상이 어떻게 작동하는지 진정으로 이해하는 것이 아니라 사건의 순서를 추측하기 때문입니다.
이를 해결하기 위해 연구자들은 AI가 행동하기 전에 먼저 "생각"하게 만드는 방법, 즉 **사고의 사슬(Chain-of-Thought)**이라 알려진 개념을 찾고 있습니다. 최종 영상을 바로 만들어내는 대신, AI가 중간 계획을 세우도록 유도하는 것입니다. 이는 집을 짓기 전에 설계도를 그리는 건축가나, 요리하기 전에 레시피를 쓰는 요리사와 같습니다. 여기서 큰 질문은 "어떤 종류의 설계도가 가장 좋은가?"입니다. 단어의 목록일까요? 몇 개의 거친 스케치일까요? 아니면 더 정밀한 무언가일까요? 이것이 바로 VideoCoCo 논문이 해결하고자 하는 퍼즐이며, AI가 생성한 비디오가 단순히 보기 좋을 뿐만 아니라 실제 현실의 규칙을 따르도록 만드는 것을 목표로 합니다.
"Code-as-CoT"의 마법: 두 엔진의 드림팀
물리 법칙을 어기지 않는 영상을 만들기 위해 감독과 예술가가 협력하는 것처럼 작동하는 새로운 시스템, VideoCoCo를 만나보세요. 연구진은 AI가 텍스트 프롬프트만으로 장면의 변화를 예측하려고 할 때 종종 "이야기"를 틀리게 만든다는 점을 깨달았습니다. 그래서 그들은 AI에게 새로운 도구를 주었습니다. 바로 **실행 가능한 코드(executable code)**입니다.
이 과정을 다음과 같이 생각해 보세요:
- 감독 (코딩 에이전트): 당신이 AI에게 "뜨거운 팬 위에서 녹는 버터"와 같은 프롬프트를 주면, 감독은 단순히 장면을 상상하는 데 그치지 않습니다. 대신, 블렌더(Blender) 프로그램(컴퓨터 명령 세트)을 작성합니다. 이 코드는 엄격하고 깨뜨릴 수 없는 레시피와 같습니다. 이 코드는 컴퓨터에 명시적으로 지시합니다: "여기에 버터 덩어리를 놓으시오. 열을 켜시오. 정확히 5초 동안 버터가 부드러워지고, 형태가 무너지고, 퍼지게 만드시오." 이것은 코드이기 때문에, 쓰인 대로 반드시 실행되어야 합니다. 이것은 추측이 아니라 시뮬레이션입니다.
- 샌드박스 (시뮬레이션 엔진): 컴퓨터는 "샌드박스"라고 불리는 안전하고 격리된 놀이터에서 이 코드를 실행합니다. 그 결과물은 아직 멋진 영화가 아닙니다. 그것은 **결정론적인 초안(deterministic draft)**입니다. 마치 저화질의 찰흙 애니메이션을 상상해 보세요. 플레이도(찰흙)로 만든 거친 스케치처럼 보이지만, 움직임은 완벽하게 정확합니다. 코드가 물리 법칙에 따라 일어나도록 강제했기 때문에, 버터는 물리 법칙이 말하는 방식 그대로 녹아내립니다.
- 예술가 (생성 비디오 엔진): 이제 두 번째 엔진이 등장합니다. 이 엔진은 그 거친 찰흙 스케치를 가져와서 고화질 영화처럼 보이도록 색을 입히는 예술가입니다. 예술가는 이미 완벽한 "플레이도" 버전을 복사할 대상으로 가지고 있기 때문에, 버터가 어떻게 움직여야 하는지 추측할 필요가 없습니다. 그들은 단지 버터가 어떻게 더 반짝이고, 황금빛이며, 맛있어 보이게 만들지에만 집중하면 됩니다.
이 접근 방식이 게임 체인저인 이유
이 논문은 이전의 방법들이 한 번에 너무 많은 것을 하려고 했다고 주장합니다. 어떤 AI 모델들은 텍사 프롬프트(예: "버터가 녹는다")와 같은 텍스트 계획을 쓰려고 했지만, 텍스트는 모호합니다. 다른 모델들은 비디오의 다음 프레임을 예측하려고 했지만, 그것은 이전의 흐릿한 사진을 보고 걸작을 그리려는 것과 같습니다.
VideoCoCo는 이렇게 말합니다: "물리학을 추측하지 마라. 그냥 시뮬레이션하라."
코드를 "사고의 사슬(CoT)"로 사용함으로써, 이 시스템은 움직임의 논리와 이미지의 미적 요소를 분리합니다. 코드는 "무엇이 언제 일어나는가"를 처리하고, 비디오 편집기는 "그것이 어떻게 보이는가"를 처리합니다. 이는 첫 번째 단계가 100% 신뢰할 수 있는 두 단계의 과정으로 변모한다는 점에서 엄청난 변화입니다.
증거는 푸딩(그리고 물리 법칙)에 있다
연구진은 자신들의 시스템을 두 가지 주요 과제인 PhyGenBench와 VBench-2.0으로 테스트했습니다. 이것들은 AI를 위한 시험지로, 특히 비디오가 중력, 열, 물질의 거동과 같은 현실 세계의 규칙을 따르는지를 테스트합니다.
- 결과: VideoCoCo 이전의 베이스라인 AI(OmniWeaving이라 불림)는 물리 테스트에서 평균 0.475를 기록했습니다. "Code-as-CoT" 시스템을 추가한 후, 점수는 0.558로 뛰어올랐습니다. 다른 테스트(VBench-2.0)에서는 점수가 **52.18%**에서 **77.88%**로 급등했습니다.
- "아하!" 모먼트: 가장 큰 개선은 AI가 보통 가장 많이 실패하는 영역인 열역학(열과 녹는 현상 등) 및 물질 역학(물체가 깨지거나 흐르는 방식)에서 나타났습니다. 이는 코드 초안이 단순히 비디오를 예쁘게 만드는 것을 넘어, AI에게 물리학이 어떻게 작동하는지를 실제로 가르치고 있음을 증명합니다.
이 논문이 배제하는 것
VideoCoCo가 아닌 것이 무엇인지 명시하는 것도 중요합니다. 논문은 수백만 개의 영상을 통해 더 큰 AI를 훈련시켜서 물리학을 "학습"할 수 있다는 생각에 명시적으로 반대합니다. 연구진은 명시적이고 실행 가능한 계획(코드) 없이는 AI가 여전히 사건의 순서를 제대로 맞추는 데 어려움을 겪는다는 것을 발견했습니다. 또한 단순히 거친 텍스트 계획이나 몇 개의 키프레임을 갖는 것만으로는 충분하지 않으며, 계획은 컴퓨터가 실제로 실행하여 초안을 만들 수 있는 실행 가능한 코드여야 한다는 점을 보여줍니다.
한계와 미래
결과는 인상적이지만, 논문은 한계점에 대해서도 솔직합니다. 이 시스템은 코드를 쓰고, 시뮬레이션을 실행하고, 그 다음 비디오를 그려야 하기 때문에 현재는 다소 느립니다. 이는 천재적인 건축가와 화가가 있지만, 사진을 찍는 것보다 시간이 조금 더 걸리는 것과 같습니다. 또한, 시스템은 Blender 시뮬레이터가 얼마나 복잡할 수 있는지에 따라 제한됩니다. 소용돌이치는 혼돈스러운 물의 움직임과 같은 초복잡한 요소들은 현재 시뮬레이션하기에 여전히 까다로울 수 있습니다.
하지만 저자들은 이 "Code-as-CoT" 접근 방식이 AI에 대한 강력한 새로운 사고방식이라고 제안합니다. AI가 마법처럼 세상을 이해하기를 바라는 대신, 우리는 AI에게 먼저 세상의 모델을 구축할 수 있는 도구를 주고, 그 견고한 토대 위에 예술을 창조하도록 할 수 있습니다. 이는 때때로 아름다운 것을 만드는 가장 좋은 방법은 먼저 제대로 작동하는 것을 만드는 것임을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.