Agentic Video Generation: From Text to Executable Event Graphs via Tool-Constrained LLM Planning
이 논문은 LLM 이 자연어 추론을 통해 서사를 계획하고 프로그램적 백엔드가 시뮬레이터 제약을 강제하여 실행 가능한 '사건 그래프 (GEST)'를 생성함으로써, 기존 신경망 기반 비디오 생성의 물리적·의미적 오류를 해결하고 게임 엔진에서 결정론적으로 실행되는 고품질 영상을 만드는 새로운 에이전트 시스템을 제안합니다.
원저자:Nicolae Cudlenco, Mihai Masala, Marius Leordeanu
기존의 AI 영상 생성 시스템 (VEO, WAN 등) 은 마치 **"재미있는 이야기를 구상한 감독이 있지만, 배우들이 대본도 없이 즉흥적으로 연기하는 상황"**과 같습니다.
문제점: 감독이 "커피를 마시고 친구와 웃자"라고 말하면, 배우 (AI) 는 커피잔을 공중에 띄우거나, 친구가 갑자기 사라지거나, 시간 순서가 뒤죽박죽이 되는 엉뚱한 장면을 만들어냅니다. (물리 법칙 위반, 의미 불일치)
이 논문이 제안하는 시스템은 **"완벽한 대본과 무대 지시서를 작성하는 감독"**과 **"그 지시서를 100% 정확히 따르는 로봇 배우"**로 나뉩니다.
🚀 이 시스템이 하는 일: 3 단계 과정
1. 이야기 기획자 (Director Agent): "무슨 일이 일어날지 구상"
역할: 이 부분은 거대한 AI 언어 모델 (LLM) 입니다.
일: "두 친구가 재회해서 웃고, 커피를 마시고, 포옹하는 이야기" 같은 창의적인 스토리를 구상합니다.
한계: 이 기획자는 "무대 위에서는 물리 법칙이 어떻게 작동하는지"를 정확히 모릅니다. 그래서 직접 무대를 짓는 것은 위험합니다.
2. 무대 감독 및 안전 관리자 (Scene Builder & State Backend): "규칙에 맞게 실행"
역할: 이 부분은 엄격한 규칙을 따르는 프로그램입니다.
일: 기획자가 "커피를 마셔"라고 하면, 이 시스템은 "커피잔이 어디에 있는지, 배우가 앉을 수 있는지, 커피를 들 수 있는 상태인지"를 실시간으로 확인합니다.
핵심: 만약 "공중에 떠 있는 커피잔"을 만들려고 하면, 시스템은 **"그건 불가능합니다"**라고 즉시 거절하고 수정을 요구합니다.
결과: 이렇게 해서 절대 무너지지 않는, 물리 법칙을 지키는 완벽한 영상이 만들어집니다.
3. 결과물: "영상 + 완벽한 설명서"
이 시스템은 영상뿐만 아니라, **매 프레임마다 "누가, 어디서, 무엇을 했는지"에 대한 완벽한 데이터 (지식 그래프)**도 함께 만들어냅니다.
기존 AI 는 영상을 만들어도 "왜 커피잔이 사라졌는지" 설명할 수 없지만, 이 시스템은 **"커피잔이 바닥에 떨어졌기 때문에 사라졌습니다"**라고 정확히 알려줍니다.
🧩 왜 기존 방식은 실패했을까요? (실험 결과)
연구진은 먼저 **"단계별로 나누어 AI 가 대본을 수정하게 하는 방식"**을 시도했습니다.
시나리오: 6 명의 AI 가 차례로 대본을 다듬고, 마지막에 무대에 올리게 했습니다.
결과:50 번 시도 중 0 번 성공했습니다.
이유: AI 가 이야기를 만들 때는 좋지만, 50~200 개의 사건이 이어지는 긴 이야기 속에서 "누가 무엇을 들고 있는지", "누가 어디에 있는지" 같은 세부적인 상태를 기억하는 데 실패했습니다. (예: "아까 커피를 마셨는데, 왜 지금 다시 커피를 들고 있죠?" 같은 오류가 발생)
그래서 "기획 (LLM)"과 "실행 (프로그램)"을 완전히 분리하는 새로운 방식을 고안해냈습니다.
🏆 이 시스템의 놀라운 성과
연구진은 이 시스템을 다른 최신 AI (VEO 3.1, WAN 2.2) 와 비교했습니다.
물리 법칙 준수:
이 시스템: 100% 물리 법칙을 지킵니다. (사람이 벽을 뚫고 지나가지 않음)
기존 AI: 20~25% 만 물리 법칙을 지킵니다. (사람이 갑자기 사라지거나 물체가 뚫고 지나감)
이야기 일치도:
"친구가 오면 인사하고 웃자"라고 했을 때, 이 시스템은 정확히 그렇게 합니다.
기존 AI 는 "친구가 오자마자 싸우기 시작"하거나 "웃지 않고 울기 시작"하는 등 의도와 다른 결과를 냅니다.
성공률:
이야기를 미리 정해준 경우 (Seed Generation), 이 시스템은 80% 성공했습니다.
기존 방식은 이야기가 복잡해지면 실패하거나 엉뚱한 결과가 나옵니다.
💡 요약: 이 연구가 왜 중요한가요?
이 논문은 **"영상을 만드는 것"**을 **"픽셀을 그리는 것"**에서 **"논리적인 사건을 설계하는 것"**으로 바꾸었습니다.
기존: AI 가 그림을 그립니다. (아름답지만, 논리적으로 엉망일 수 있음)
이 논문: AI 가 **명확한 지시서 (대본)**를 만들고, 로봇이 그 지시서를 그대로 실행합니다. (조금은 덜 예술적일 수 있지만, 완벽하게 논리적이고 사실적임)
이 방식은 앞으로 영화 제작, 게임 시나리오, 교육용 영상 등에서 "무엇이 일어났는지"를 정확히 추적하고 설명해야 할 때 매우 유용하게 쓰일 것입니다. 마치 **"완벽한 대본을 가진 영화 감독"**이 AI 를 조종하여, 실제와 똑같은 법칙을 따르는 영상을 만들어내는 것입니다.
1. 문제 정의 (Problem Statement)
기존의 멀티 에이전트 비디오 생성 시스템은 LLM(대규모 언어 모델) 에이전트를 사용하여 신경망 기반 비디오 생성기 (Neural Video Generators) 를 조율하는 방식을 취합니다. 이러한 시스템은 시각적으로 인상적인 결과를 생성할 수 있지만, 다음과 같은 근본적인 한계를 가집니다:
의미론적 불확실성: 객체가 갑자기 나타나거나 사라지고, 캐릭터가 프레임 간에 변형되며, 시간적 순서가 위반되는 등 물리적, 의미론적 일관성이 보장되지 않습니다.
지상 진실 (Ground Truth) 부재: 생성된 비디오에 대한 정확한 공간 - 시간 주석 (spatiotemporal annotations) 을 제공하지 못합니다.
LLM 의 상태 추적 한계: LLM 은 서사적 일관성은 뛰어나지만, 50~200 개의 이벤트로 구성된 복잡한 멀티 캐릭터 스토리에서 시뮬레이터의 제약 조건 (객체 수명 주기, POI 용량, 시간적 제약 등) 을 정확히 추적하여 실행 가능한 명세를 생성하는 데 실패합니다.
저자들은 이 패러다임을 반전시켜, 에이전트가 픽셀을 직접 생성하는 대신 **실행 가능한 공식 이벤트 그래프 (GEST: Graph of Events in Space and Time)**를 구성하고, 이를 3D 게임 엔진에서 결정론적으로 실행하여 비디오를 생성하는 시스템을 제안합니다.
2. 방법론 (Methodology)
시스템은 **서사적 계획 (Narrative Planning)**과 **제약 조건 강제 (Constraint Enforcement)**를 분리하는 '관심 분리 (Separation of Concerns)' 아키텍처를 기반으로 합니다.
2.1. 계층적 2 에이전트 아키텍처
디렉터 에이전트 (Director Agent):
시뮬레이션 세계를 탐색하고 (에피소드, 지역, 캐릭터 스킨 확인), 전체 스토리 구조를 계획합니다.
캐릭터 할당, 장면 순서 결정, 장면 간 시간적 제약 연결을 담당합니다.
자연어 프롬프트 (선택 사항) 또는 자율적으로 스토리를 구상합니다.
장면 빌더 서브에이전트 (Scene Builder Subagent):
디렉터로부터 할당된 개별 장면을 담당합니다.
**라운드 기반 상태 머신 (Round-based State Machine)**을 통해 액션 체인, 상호작용, 시간적 제약을 구축합니다.
각 액션은 유효한 다음 액션만 반환하는 도구 호출을 통해 수행되며, 무효한 상태 전이는 차단됩니다.
2.2. 관계 서브에이전트 (Relation Subagents)
논리적 관계 에이전트: 이벤트 간의 인과 관계 (원인, 가능, 방지, 요구) 를 추가합니다.
의미론적 관계 에이전트: 서사적 일관성 (관찰, 중단, 동기 부여 등) 을 추가합니다.
이 에이전트들은 절차적 생성이 비워두는 GEST 형식의 논리적/의미론적 엣지 유형을 채워, 표현력의 한계를 극복합니다.
2.3. 도구 기반 제약 조건 강제 레이어 (Tool-Based Constraint Enforcement)
상태 백엔드: 기존 절차적 생성기를 재사용하여 상태 백엔드로 활용합니다.
트랜잭션 기반 검증: 모든 도구 호출 (캐릭터 생성, 액션 시작, 제약 추가) 은 상태 백엔드에서 검증됩니다.
유효성 검사: 객체 수명 주기, POI 용량 (예: 의자에 동시에 앉을 수 없음), 시간적 순환 (Temporal Cycles) 감지 등을 실시간으로 검사합니다.
거부 메커니즘: 유효하지 않은 작업은 그래프에 영향을 미치기 전에 거부됩니다.
결과: LLM 이 무엇을 시도하든, 시스템이 생성하는 모든 GEST 는 **구현 시 실행 가능 (Executable by Construction)**합니다.
3. 주요 기여 (Key Contributions)
실패 분석 및 아키텍처 전환: 6 단계 LLM 정제 파이프라인이 50 회 시도 중 0 회 성공하여 실패한 이유 (상태 일관성 붕괴, 할루시네이션 등) 를 분석하고, 이를 해결하기 위한 새로운 에이전트 아키텍처를 제안했습니다.
새로운 아키텍처: 디렉터와 장면 빌더, 관계 서브에이전트로 구성된 계층적 2 에이전트 시스템을 통해 서사적 의도와 기술적 실행 가능성을 동시에 달성했습니다.
최초의 완전한 GEST 활용: 절차적 생성이 채우지 못했던 논리적 및 의미론적 엣지 유형을 서브에이전트를 통해 채워, GEST 형식의 **전체 표현 능력 (Full Expressive Capacity)**을 최초로 실현한 시스템입니다.
완벽한 주석 생성: 생성된 비디오와 함께 RGB, 공간 관계 그래프, 이벤트 - 프레임 매핑 등 영구적인 공간 - 시간 주석을 제로 마진 비용으로 제공합니다.
4. 실험 결과 (Results)
4.1. 성공률 (Generation Success)
기존 LLM 파이프라인: 50 회 시도 중 0 회 성공 (0%).
절차적 무작위 생성: 74% 성공.
제안된 에이전트 시스템 (Seed 모드): 80% 성공 (25 회 중 20 회).
제안된 에이전트 시스템 (자율 모드): 약 50% 성공.
4.2. 평가 (Evaluation)
LLM 배심원 (3 모델) 평가:
자율 생성: 절차적 생성은 더 많은 이벤트로 인해 실행 로그 (VDG) 비교에서 우세했으나, **서사적 의도 (Narrative)**가 포함된 비교에서는 에이전트 시스템이 텍스트 (79%), 비디오 (74%) 모두에서 승리했습니다.
시드 생성 (Seeded): 동일한 텍스트 명세를 VEO 3.1, WAN 2.2 와 비교했습니다.
인간 평가 (Human Annotation):
물리적 유효성: 엔진 생성 비디오 (58%) 가 VEO 3.1 (25%), WAN 2.2 (20%) 보다 월등히 높았습니다.
의미론적 정렬 (Semantic Alignment): 엔진 생성 (3.75/5) 이 VEO 3.1 (2.33), WAN 2.2 (1.50) 보다 훨씬 높았습니다.
결론: 동일한 텍스트 명세라도 신경망 생성기는 물리적으로 불가능하고 의미론적으로 일관성 없는 결과를 생성하는 반면, 엔진 기반 시스템은 이를 정확히 구현합니다.
5. 의의 및 결론 (Significance & Conclusion)
이 연구는 비디오 생성을 프로그래밍 작업 (절차적 생성기의 코드에 의존) 에서 명세 작업 (자연어로 스토리 구조를 정의) 으로 전환시켰습니다.
패러다임 반전: 에이전트가 픽셀을 생성하는 대신, 실행 가능한 형식 명세 (GEST) 를 생성하여 3D 엔진에 전달함으로써 의미론적 확실성을 보장합니다.
신경망과의 보완성: 3D 엔진은 의미론적 정확성과 풍부한 주석을 제공하지만 시각적 사실성은 부족합니다. 반대로 신경망은 시각적 사실성은 뛰어나지만 의미론적 일관성이 부족합니다. 이 연구는 GEST 를 신경망 생성기의 구조적 조건부 신호 (Conditioning Signal) 로 활용하는 미래 방향성을 제시합니다.
한계 및 향후 과제: 현재 자율 생성의 안정성 (약 50%) 과 카메라 워크, 시간적 뉘앙스, 환경 표현 등의 표현력 부족 (Fidelity Gap) 이 존재하지만, 이는 아키텍처가 아닌 플랫폼의 제약으로, 향후 엔진 확장 (Unreal, Unity 등) 을 통해 해결 가능하다고 주장합니다.
요약하자면, 이 논문은 LLM 의 서사적 창의성과 게임 엔진의 엄격한 물리/논리 검증을 결합하여, 물리적으로 유효하고 의미론적으로 정합적인 멀티 캐릭터 비디오를 생성하는 새로운 패러다임을 제시했습니다.