← 최신 논문
💬 NLP

GS-Agent: Creating 4D Physical Worlds With Generative Simulation

GS-Agent는 자산 관리, 재질 튜닝, 모션 제어 및 렌더링을 위한 인간과 유사한 워크플로우를 모방함으로써, 자연어 설명을 통해 역동적이고 물리적으로 타당하며 제어 가능한 4D 세계를 자동으로 생성하기 위해 파운데이션 모델과 물리 엔진을 활용하는 엔드 투 엔드 멀티 에이전트 프레임워크를 도입합니다.

원저자: Hongxin Zhang, Chunru Lin, Junyan Li, Zhou Xian, Tsun-Hsuan Wang, Chuang Gan

게시일 2026-07-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hongxin Zhang, Chunru Lin, Junyan Li, Zhou Xian, Tsun-Hsuan Wang, Chuang Gan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

농구공이 트램펄린에 튕겨 나간 뒤 수영장에 풍덩 빠지고, 그 후 멀리 굴러가는 영화 장면을 만든다고 상상해 보세요. 현실 세계에서는 물리 법칙이 그냥 '발생'합니다. 중력이 끌어당기고, 물이 튀며, 물체가 어떻게 구성되어 있느냐에 따라 공이 튀어 오릅니다. 하지만 컴퓨터의 디지털 세계에서 사물을 사실적으로 움직이게 만드는 것은 악몽과 같습니다. 전통적인 방식이라면 예술가와 엔지니어 팀이 모든 물방울과 모든 튕김을 일일이 수동으로 조정해야 했으며, 이는 엄청난 시간이 걸리는 작업입니다. 최근 컴퓨터는 AI를 사용해 이미지와 영상을 '꿈꾸듯' 만들어내는 데 매우 능숙해졌지만, 이 디지털 꿈꾸는 자들은 물리 법칙을 틀리는 경우가 많습니다. 그들은 단순히 다음 픽셀이 어떻게 보여야 할지를 추측할 뿐, 세상이 실제로 어떻게 작동하는지를 계산하는 것이 아니기 때문에, 공이 유령처럼 떠다니거나 물이 단단한 유리처럼 변해버리는 식의 오류를 범하곤 합니다. 과학자들은 이 간극을 메우기 위해 노력해 왔습니다. 즉, 우리가 간단한 문장 하나만 입력해도 컴퓨터가 단순히 실제 세계처럼 '보이게' 만드는 것을 넘어, 실제로 실제 세계처럼 '행동하게' 만드는 방법은 무엇일까요?

여기에 4D 세계(시간에 따라 움직이는 3D 세계)를 만들기 위한 초지능적이고 자동화된 영화 제작팀 역할을 하는 새로운 시스템, GS-Agent가 등장했습니다. GS-Agent는 마법 상자처럼 영상을 직접 '꿈꾸는' 대신, AI 전문가 팀을 활용하여 실제 물리 엔진 내부에서 장면을 구축합니다. 이렇게 생각하면 쉽습니다. 만약 일반적인 AI에게 "딸기가 물방울에 부딪히는 영상을 만들어줘"라고 요청한다면, 그 AI는 잠시 동안은 그럴싸해 보일지 몰라도 확대해보면 무너져 내리는 예쁜 그림을 그려낼 뿐일 것입니다. 하지만 GS-Agent는 감독이자 소품 담당자, 그리고 카메라 기사 역할을 동시에 수행합니다. 이 시스템은 당신의 요청을 단계별로 분해합니다. 딸기와 물의 3D 모델을 찾거나 만들고, 그것들에게 적절한 '성격'(얼마나 말랑하거나 딱딱한지 등)을 부여하며, 물체들이 공중에 떠 있지 않도록 배치한 뒤, 실제로 충돌했을 때 어떤 일이 일어나는지 확인하기 위해 실제 물리 시뮬레이션을 실행합니다.

이 논문은 세 가지 서로 다른 AI '에이전트'가 협력하여 이를 수행하는 프레임워크를 소개합니다. **매니저 에이전트(Manager Agent)**는 대장입니다. 문장을 읽고 할 일 목록을 만든 뒤 업무를 배분합니다. **엔티티 에이전트(Entity Agent)**는 제작자입니다. 3D 모델을 가져오고 재질을 조절하며(반죽은 부드럽고 테이블은 딱딱하게 만드는 등), 물체가 공중에 떠 있지 않도록 배치합니다. **렌더 에이전트(Render Agent)**는 촬영 감독입니다. 장면을 영화적으로 만들기 위해 카메라, 조명, 각도를 설정합니다. 결정적으로, 이 에이전트들은 단순히 추측만 하지 않습니다. 이들은 시뮬레이션을 실행하기 위한 코드를 작성하고, 결과를 관찰하며, 만약 공이 바닥을 뚫고 떨어지는 것과 같은 이상한 현상이 발생하면 자동으로 수정합니다. 이들은 물리 법칙이 타당해지고 영상이 설명과 완벽하게 일치할 때까지 장면을 계속해서 미세 조정합니다.

연구진은 이 시스템을 Sora나 Wan과 같이 현재 사용 가능한 최고의 영상 생성 AI 모델들, 그리고 장면을 구축하려는 다른 AI 에이전트들과 비교 테스트했습니다. 그 결과, 다른 모델들은 보기에는 예쁘지만 물리 법칙을 어기는 영상(물체가 서로 통과하거나 액체가 고체 블록처럼 행동하는 등)을 만드는 경우가 많았던 반면, GS-Agent는 물리적으로 현실적인 세계를 만들어냈습니다. 이 시스템은 총알이 물풍선을 뚫거나 스펀지가 비틀리며 툭 끊어지는 것과 같은 복잡한 상호작용을 정확한 물리 법칙과 함께 성공적으로 시뮬레이션했습니다. 또한 "카메라를 원형으로 움직여줘"라거나 "초콜릿이 천천히 흐르게 해줘"와 같은 구체적인 지시를 따르는 데 훨씬 뛰어난 성능을 보였습니다.

이 기술이 특히 멋진 이유는 GS-Agent가 단순히 영상을 만드는 데서 그치지 않기 때문입니다. 실제 물리 코드를 사용하여 세계를 구축하기 때문에, 정확한 깊이 지도(depth maps)와 모든 입자의 움직임 같은 숨겨진 데이터를 포함하는 '4D 세계'를 생성합니다. 이는 출력물이 단순한 영화 파일이 아니라, 플레이 가능하고 상호작용이 가능한 시뮬레이션임을 의미합니다. 저자들은 이것이 로봇이나 자율주행 자동차를 훈련시키는 데 있어 거대한 도약이 될 수 있다고 제안합니다. 실제 세계에 투입되기 전, 안전하고 현실적인 장소에서 연습할 수 있는 환경을 제공하기 때문입니다. 비록 이 시스템이 아직 완벽하지 않고 현재의 물리 시뮬레이션 기술의 한계에 의존하고 있지만, 이는 새로운 길을 제시합니다. 즉, AI에게 현실을 환각(hallucinate)하도록 가르치는 대신, 하나의 물리 법칙씩 쌓아가며 현실을 구축하도록 가르치는 길입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →