← 최신 논문
💻 computer science

Agentic Video Generation: From Text to Executable Event Graphs via Tool-Constrained LLM Planning

이 논문은 LLM 이 자연어 추론을 통해 서사를 계획하고 프로그램적 백엔드가 시뮬레이터 제약을 강제하여 실행 가능한 '사건 그래프 (GEST)'를 생성함으로써, 기존 신경망 기반 비디오 생성의 물리적·의미적 오류를 해결하고 게임 엔진에서 결정론적으로 실행되는 고품질 영상을 만드는 새로운 에이전트 시스템을 제안합니다.

원저자: Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

게시일 2026-04-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎬 핵심 비유: "감독 vs. 배우"와 "명확한 대본"

기존의 AI 영상 생성 시스템 (VEO, WAN 등) 은 마치 **"재미있는 이야기를 구상한 감독이 있지만, 배우들이 대본도 없이 즉흥적으로 연기하는 상황"**과 같습니다.

  • 문제점: 감독이 "커피를 마시고 친구와 웃자"라고 말하면, 배우 (AI) 는 커피잔을 공중에 띄우거나, 친구가 갑자기 사라지거나, 시간 순서가 뒤죽박죽이 되는 엉뚱한 장면을 만들어냅니다. (물리 법칙 위반, 의미 불일치)

이 논문이 제안하는 시스템은 **"완벽한 대본과 무대 지시서를 작성하는 감독"**과 **"그 지시서를 100% 정확히 따르는 로봇 배우"**로 나뉩니다.

🚀 이 시스템이 하는 일: 3 단계 과정

1. 이야기 기획자 (Director Agent): "무슨 일이 일어날지 구상"

  • 역할: 이 부분은 거대한 AI 언어 모델 (LLM) 입니다.
  • 일: "두 친구가 재회해서 웃고, 커피를 마시고, 포옹하는 이야기" 같은 창의적인 스토리를 구상합니다.
  • 한계: 이 기획자는 "무대 위에서는 물리 법칙이 어떻게 작동하는지"를 정확히 모릅니다. 그래서 직접 무대를 짓는 것은 위험합니다.

2. 무대 감독 및 안전 관리자 (Scene Builder & State Backend): "규칙에 맞게 실행"

  • 역할: 이 부분은 엄격한 규칙을 따르는 프로그램입니다.
  • 일: 기획자가 "커피를 마셔"라고 하면, 이 시스템은 "커피잔이 어디에 있는지, 배우가 앉을 수 있는지, 커피를 들 수 있는 상태인지"를 실시간으로 확인합니다.
  • 핵심: 만약 "공중에 떠 있는 커피잔"을 만들려고 하면, 시스템은 **"그건 불가능합니다"**라고 즉시 거절하고 수정을 요구합니다.
  • 결과: 이렇게 해서 절대 무너지지 않는, 물리 법칙을 지키는 완벽한 영상이 만들어집니다.

3. 결과물: "영상 + 완벽한 설명서"

  • 이 시스템은 영상뿐만 아니라, **매 프레임마다 "누가, 어디서, 무엇을 했는지"에 대한 완벽한 데이터 (지식 그래프)**도 함께 만들어냅니다.
  • 기존 AI 는 영상을 만들어도 "왜 커피잔이 사라졌는지" 설명할 수 없지만, 이 시스템은 **"커피잔이 바닥에 떨어졌기 때문에 사라졌습니다"**라고 정확히 알려줍니다.

🧩 왜 기존 방식은 실패했을까요? (실험 결과)

연구진은 먼저 **"단계별로 나누어 AI 가 대본을 수정하게 하는 방식"**을 시도했습니다.

  • 시나리오: 6 명의 AI 가 차례로 대본을 다듬고, 마지막에 무대에 올리게 했습니다.
  • 결과: 50 번 시도 중 0 번 성공했습니다.
  • 이유: AI 가 이야기를 만들 때는 좋지만, 50~200 개의 사건이 이어지는 긴 이야기 속에서 "누가 무엇을 들고 있는지", "누가 어디에 있는지" 같은 세부적인 상태를 기억하는 데 실패했습니다. (예: "아까 커피를 마셨는데, 왜 지금 다시 커피를 들고 있죠?" 같은 오류가 발생)

그래서 "기획 (LLM)"과 "실행 (프로그램)"을 완전히 분리하는 새로운 방식을 고안해냈습니다.


🏆 이 시스템의 놀라운 성과

연구진은 이 시스템을 다른 최신 AI (VEO 3.1, WAN 2.2) 와 비교했습니다.

  1. 물리 법칙 준수:
    • 이 시스템: 100% 물리 법칙을 지킵니다. (사람이 벽을 뚫고 지나가지 않음)
    • 기존 AI: 20~25% 만 물리 법칙을 지킵니다. (사람이 갑자기 사라지거나 물체가 뚫고 지나감)
  2. 이야기 일치도:
    • "친구가 오면 인사하고 웃자"라고 했을 때, 이 시스템은 정확히 그렇게 합니다.
    • 기존 AI 는 "친구가 오자마자 싸우기 시작"하거나 "웃지 않고 울기 시작"하는 등 의도와 다른 결과를 냅니다.
  3. 성공률:
    • 이야기를 미리 정해준 경우 (Seed Generation), 이 시스템은 80% 성공했습니다.
    • 기존 방식은 이야기가 복잡해지면 실패하거나 엉뚱한 결과가 나옵니다.

💡 요약: 이 연구가 왜 중요한가요?

이 논문은 **"영상을 만드는 것"**을 **"픽셀을 그리는 것"**에서 **"논리적인 사건을 설계하는 것"**으로 바꾸었습니다.

  • 기존: AI 가 그림을 그립니다. (아름답지만, 논리적으로 엉망일 수 있음)
  • 이 논문: AI 가 **명확한 지시서 (대본)**를 만들고, 로봇이 그 지시서를 그대로 실행합니다. (조금은 덜 예술적일 수 있지만, 완벽하게 논리적이고 사실적임)

이 방식은 앞으로 영화 제작, 게임 시나리오, 교육용 영상 등에서 "무엇이 일어났는지"를 정확히 추적하고 설명해야 할 때 매우 유용하게 쓰일 것입니다. 마치 **"완벽한 대본을 가진 영화 감독"**이 AI 를 조종하여, 실제와 똑같은 법칙을 따르는 영상을 만들어내는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →