← 최신 논문
💻 computer science

The GEST-Engine: From Event Graphs to Synthetic Video. A Full Technical Report

GEST-Engine은 자연어를 명시적이고 검사 가능한 '시공간 내 사건의 그래프(Graph of Events in Space and Time, GEST)'로 먼저 변환하여 상용 게임 엔진을 조율함으로써, 시간적 일관성과 객체 영속성을 보장하는 동시에 추가적인 주석 비용 없이 풍부한 정답 데이터를 생성하는 결정론적 시스템이다.

원저자: Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

게시일 2026-07-15
📖 5 분 읽기🧠 심층 분석

원저자: Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 영화 한 편을 만들고 싶다고 상상해 봅시다. 두 사람이 주방에서 만나고, 한 명이 자리에 앉으며 대화를 시작하는 장면입니다. 만약 당신이 현대적인 AI 비디오 생성기(몽환적이고 멋진 클립을 만들어내는 것들)에게 이를 요청한다면, 그것은 실제처럼 보일 수는 있지만 사실은 '거짓말'을 하고 있을 것입니다. 사람이 앉을 때 의자가 사라지거나, 두 번째 사람이 갑자기 허공에서 나타나거나, 혹은 방에 들어오기도 전에 대화가 시작될 수도 있습니다. 이러한 AI 모델들은 마치 '몽상가'와 같습니다. 그들은 본 데 패턴을 바탕으로 세상이 어떻게 보여야 하는지를 추측할 뿐, 물체가 어디에 있는지나 시간이 어떻게 흐르는지는 실제로 알지 못합니다.

GEST-Engine은 그 반대입니다. 이것은 몽상가가 아니라, 설계도를 가진 엄격한 감독입니다.

단순히 추측하는 대신, 이 시스템은 GEST(시공간 이벤트 그래프)라고 불리는 정식 그래프로 이루어진 완전하고 보이지 않는 "세계 지도"를 구축합니다. 이 그래프는 일종의 매우 상세한 대본과 같습니다. 예를 들어 "배우 A는 테이블에 있고, 배우 B는 문 앞에 있으며, 의자는 배우 A의 아래에 있고, 포옹은 악수 이후에 일어난다"라고 정확히 명시합니다. 엔진은 이 설계도를 가져와서 Grand Theft Auto: San Andreas라는 비디오 게임 안에서 실행합니다.

마법의 기술: 영화 스튜디오로서의 게임 엔진

왜 20년 된 비디오 게임을 사용할까요? 연구자들은 완전히 새로운 가짜 세계를 만드는 데는 수년의 시간과 수백만 달러가 든다는 사실을 깨달았습니다. 대신, 이미 다음과 같은 것들을 갖춘 기존 게임을 활용했습니다:

  • 733개의 다양한 오브젝트 (침대와 노트북부터 자동차와 나무까지)
  • 2,500개 이상의 애니메이션 (춤추기, 잠자기, 담배 피우기, 운동하기 등)
  • 312개의 서로 다른 캐릭터 스킨 (다양한 연령, 인종, 의상의 사람들)
  • 70개 이상의 서로 다른 장소 (집, 체육관, 정원, 거리 등)

그들은 게임과 통신하기 위해 Multi Theft Auto라는 도구를 사용했습니다. 이는 게임에 "앨리스라는 캐릭터를 생성하고, 그녀를 주방으로 걷게 한 뒤, 의자에 앉히고, 그 다음 밥과 대화하게 해라"라고 명령할 수 있는 리모컨을 가진 것과 같습니다. 게임 엔진은 이미 물리 법칙과 애니메이션의 규칙을 알고 있기 때문에, 결과물은 100% 일관적입니다. 스크립트에 앨리스가 앉으라고 되어 있으면 그녀는 앉습니다. 의자가 거기 있다고 하면 의치는 반드시 그곳에 있습니다. 아무것도 사라지지 않고, 글리치(오류)도 발생하지 않으며, 시간이 뒤로 점프하는 일도 없습니다.

작동 방식: 4단계 조립 라인

이 시스템은 단순히 게임을 '실행'하는 것이 아니라, 정밀한 4단계 공정 라인을 통해 실행됩니다:

  1. 설계도 검사 (Graph Parsing): 무언가가 일어나기 전, 시스템은 스크립트(GEST)를 읽고 게임 세계에 필요한 방, 의자, 배우들이 실제로 존재하는지 확인합니다. 스마트한 알고리즘을 사용하여 이야기에 딱 맞는 최적의 게임 레벨 조합을 찾아냅니다.
  2. 캐스팅 호출 (Grounding): 시스템은 실제 게임 캐릭터를 역할에 할당합니다. 스크립트에 "여성"이라고 되어 있으면, 게임 라이브러리에서 무작위로 여성 캐릭터 스킨을 선택합니다. 또한 스크립트의 요구 사항에 맞춰 게임 세계 내의 특정 의자와 테이블을 찾아냅니다.
  3. 타이밍 마스터 (Temporal Orchestration): 이것이 바로 두뇌입니다. 시스템은 수학(구체적으로는 Floyd–Warshall 알고리즘)을 사용하여 모든 사람이 적절한 시간에 적절한 위치에 있도록 합니다. 만약 스크립트에 "앨리스가 앉은 후에 밥이 말을 해야 한다"라고 되어 있다면, 시스템은 앨리스가 자리에 앉기 전까지는 밥이 절대로 말을 시작할 수 없도록 타임라인을 잠급니다. 이는 세 사람이 동시에 각기 다른 일을 하는 복잡한 장면에서도 서로 충돌하지 않도록 관리합니다.
  4. 카메라 및 캡처 (Execution): 시스템은 시뮬레이션을 실행합니다. 여기서 흥istic한 부분은, 게임이 돌아가는 동안 단순히 비디오만 녹화하는 것이 아니라, 다른 모든 정보를 공짜로 함께 기록한다는 점입니다. 다음을 캡처합니다:
    • 비디오 (RGB)
    • 어떤 픽셀이 어떤 오브젝트에 속하는지 보여주는 "마스크" (Instance Segmentation)
    • 장면의 깊이 (Depth)
    • 모든 배우의 정확한 골격 포즈 (Skeleton Pose)
    • 누가 누구를 기준으로 어디에 서 있는지에 대한 지도
    • 발생한 사건에 대한 자연어 설명

이 모든 것은 **결정론적(deterministically)**으로 캡처됩니다. 즉, 동일한 스크립트를 두 번 실행하면 똑같은 이야기를 얻게 되지만, 시스템은 이야기의 핵심은 유지하면서 의자 모델이나 캐릭터의 셔츠를 교체하여 다르게 보이게 할 수 있습니다.

"금지 구역": 이 시스템이 거부하는 것들

이 논문은 이 시스템이 무엇이 아닌지를 매우 명확히 밝히고 있습니다. 논문은 엄격한 논리가 필요한 작업에 대해 "암시적(implicit)" AI 모델(텍스트로부터 비디오를 생성하는 거대 신경망 모델들)에 의존해서는 안 된다고 명시적으로 주장합니다.

  • AI가 정답을 "추측"할 수 있다는 생각을 거부합니다. 논문은 이러한 AI 모델들이 "객체 영속성"(물체가 사라지는 현상), "다중 행위자 협응"(사람들이 서로 부딪히거나 순서가 뒤바뀌는 현상), "시간적 일관성"(시간이 점프하는 현상) 문제로 어려움을 겪는다는 것을 보여줍니다.
  • 새로운 맞춤형 3D 세계를 구축할 필요가 없다는 생각을 거부합니다. 새로운 엔진을 만드는 데 수년을 소비하는 대신, 적절한 "어댑터"만 있다면 기존 게임 엔진을 활용할 수 있음을 증명했습니다.

규모와 증거

연구자들은 단순히 장난감을 만든 것이 아니라 생산 라인을 구축했습니다.

  • 이 작업을 수행하기 위해 약 100,000줄의 코드(주로 Lua, Python, C++)를 개발했습니다.
  • 엄청난 양의 데이터를 생성하기 위해 25개의 병렬 가상 머신에서 실행했습니다.
  • 게임 내에 **'월드 에디터(World Editor)'**를 구축하여, 새로운 코드를 작성하지 않고도 약 1~2시간 안에 새로운 방과 오브젝트를 정의할 수 있게 했습니다.

그 결과, 픽셀 단위의 완벽한 주석(annotation)이 달린 수백 개의 비디오를 생성할 수 있는 시스템이 탄생했습니다. 이 논문은 이 데이터가 다른 AI 모델을 훈련시키는 데 매우 가치 있다고 제안합니다. 이 완벽한 "그라운드 트루스(ground truth)" 비디오를 신경망에 입력함으로써, AI가 세상을 올바르게 이해하도록 가르쳐 그들이 흔히 범하는 실수들을 바로잡을 수 있습니다.

결론

GEST-Engine은 혼란스럽고 예측 불가능한 AI 생성의 세계와 엄격하고 완벽한 게임 로직의 세계를 잇는 가교입니다. 이것은 모자 속에서 토끼를 꺼내는 마술사가 되려는 것이 아니라, 설계도에 따라 토끼와 모자, 그리고 무대를 정확하게 만드는 숙련된 목수가 되려는 것입니다. 이 시스템은 오래된 게임 엔진과 엄격한 "이벤트 그래프" 스크립트를 사용함으로써, 현재의 "꿈꾸는" AI 모델들이 스스로는 절대 할 수 없는, 논리적으로 일관되고 시간적으로 정확하며 완벽하게 주석이 달린 합성 비디오 데이터를 생성할 수 있음을 입증합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →