← 최신 논문
💻 computer science

Coding Agent Is Good As World Simulator

본 논문은 조정된 계획, 코딩, 시각적 검토 및 물리 분석을 통해 실행 가능한 시뮬레이션 코드를 반복적으로 생성하고 정제하여 물리적으로 타당한 세계 모델을 구축하는 에이전트 기반 프레임워크를 소개하며, 이는 물리적 정확성, 지시 충실도 및 시각적 품질 측면에서 비디오 기반 접근법보다 우수한 성능을 입증합니다.

원저자: Hongyu Wang, Jingquan Wang, Bocheng Zou, Radu Serban, Dan Negrut

게시일 2026-05-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hongyu Wang, Jingquan Wang, Bocheng Zou, Radu Serban, Dan Negrut

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현실적인 영화 장면을 만들고 싶다고 상상해 보세요. 예를 들어 물 위에 떠 있는 다리를 자동차가 지나가거나, 로봇이 지저분한 사무실을 이동하는 장면 말입니다.

기존 방식 (비디오 모델):
현재의 AI 비디오 생성기를 천재적인 화가들로 생각해보세요. 만약 자동차가 물을 지나가는 장면을 그려달라고 요청하면, 그들은 수백만 장의 자동차와 물에 대한 사진과 비디오를 참고합니다. 그리고 패턴을 기반으로 다음 프레임이 어떻게 보여야 할지 추측합니다.

  • 문제점: 그들은 실제로 물리 법칙을 '알지' 못합니다. 단지 색상과 모양을 추측할 뿐입니다. 자동차가 요철을 만나면, 화가는 실수로 자동차가 요철을 통과해 공중에 뜨게 그리거나, AI 가 중력이 어떻게 작용하는지 '잊어버려' 다리가 기이한 형태로 비틀릴 수도 있습니다. 잠시 동안은 멋져 보일 수 있지만, 물리 법칙은 금방 무너집니다.

새로운 방식 (이 논문의 접근법):
저자들은 다른 방법을 제안합니다. 영화 프레임을 프레임별로 그리는 대신, AI 에게 물리 엔진을 위한 **지침서 (코드)**를 작성하도록 요청하는 것입니다.

다음과 같이 생각해보세요:

  • 기존 방식은 다음 트릭을 추측하려는 마술사와 같습니다.
  • 이 논문의 방식은 실험실에서 실제로 작동하는 모델을 구축하도록 엔지니어를 고용하는 것과 같습니다.

"코딩 에이전트"의 작동 원리

이 논문은 시뮬레이션을 구축하기 위해 함께 일하는 AI '에이전트들' (전문 보조 요원) 팀을 설명합니다. 그들은 건설 현장의 작업대처럼 행동합니다:

  1. 플래너 (건축가): 당신은 팀에게 "사무실에 로봇이 있었으면 좋겠다"고 말합니다. 플래너는 이를 청사진으로 분해합니다. "우리는 바닥, 두 개의 책상, 일곱 개의 의자, 그리고 로봇이 필요합니다. 로봇은 그 사이를 걸을 수 있어야 합니다."
  2. 코더 (건설자): 이 에이전트는 청사진을 받아 실제 컴퓨터 코드 (Project Chrono 라는 도구를 사용) 를 작성하여 컴퓨터에게 방을 어떻게 구축할지, 가구를 어디에 배치할지, 모든 물체의 무게는 얼마인지 정확히 지시합니다.
  3. 시각 검토자 (검사자): 코드가 실행되면 비디오가 생성됩니다. 검토자는 비디오를 보고 말합니다. "잠깐, 로봇이 책상을 통과해 떠다니고 있어요. 그건 잘못됐습니다."
  4. 물리 분석가 (엔지니어): 이 에이전트는 수학을 점검합니다. "책상이 너무 가볍거나 로봇이 너무 무겁습니다. 코드를 수정해야 합니다."라고 말합니다.
  5. 루프: 코더가 코드를 수정하고 다시 실행합니다. 시뮬레이션이 완벽하게 작동하고 물리 법칙을 준수할 때까지 이 과정을 반복합니다.

왜 이것이 중요한가

이 논문은 단순히 비디오 프레임을 예측하는 것이 아니라 실행 가능한 코드를 통해 세상을 구축함으로써 시뮬레이션이 다음과 같이 된다고 주장합니다:

  • 물리적으로 정확함: 코드가 실제 물리 법칙을 강제하기 때문에 물체들은 충돌하고, 떨어지고, 튀는 방식이 정확해야 할 대로 이루어집니다.
  • 수리 가능함: 무언가 잘못되면 코드를 살펴봐서 실수를 찾고 수정할 수 있습니다. 물리 법칙이 잘못된 비디오를 쉽게 '수정'할 수는 없습니다. 그냥 다시 그려야 합니다.
  • 복잡한 작업에 대한 신뢰성: 팀은 로봇이 사무실을 이동하는 것, 군용 차량이 험한 지형을 주행하는 것, 그리고 물 위 떠 있는 다리를 자동차가 지나가는 것 (고체와 액체 물리의 복잡한 혼합) 으로 테스트했습니다.

결과

그들은 'WorldModelBench'라는 벤치마크를 사용하여 고급 비디오 생성 모델과 그들의 '코딩 에이전트' 방식을 비교했을 때, 그들의 방식이 다음에서 더 높은 점수를 받았습니다:

  • 지시 따르기 정확도: 요청한 대로 정확히 수행했나요? (네, 코드가 요청한 것을 명시적으로 구축하기 때문입니다.)
  • 물리 법칙: 자동차가 바닥을 통과해 떨어졌나요? (아니요, 코드가 이를 방지하기 때문입니다.)

단점

이 논문은 이 시스템이 아직 완벽하지 않다고 인정합니다. 코드를 작성하고, 실행하고, 점검하고, 수정하는 과정을 반복해야 하므로 속도가 느리고 (컴퓨터 성능 측면에서) 비용이 많이 듭니다. 또한, AI 의 라이브러리에 특정 물체의 3D 모델이 없다면 단순한 형태로 근사화해야 합니다.

요약하자면: 이 논문은 AI 에게 현실적인 세상이 어떻게 보이는지 추측하도록 하는 대신, 코드를 사용하여 현실적인 세상을 구축하도록 가르칩니다. 이를 통해 물리 법칙이 단순한 환상이 아니라 실제가 되도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →