← 최신 논문
🤖 AI

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

이 논문은 사용자의 질의로부터 상호작용 가능한 3D 오픈 월드를 자율적으로 구축하는 멀티모달 에이전트의 능력을 평가하고 향상시키기 위해 VWE-BENCH 벤치마크와 VibeWorlding-Gym 강화 학습 훈련 환경으로 구성된 통합 프레임워크인 VibeWorlding을 소개하며, 강화 학습이 오픈 소스 모델로 하여금 이 복잡한 과업에서 프런티어 폐쇄형 시스템을 능가할 수 있게 함을 입증한다.

원저자: Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu, Xingyi Li, Weidong Zhang, Hao Liu

게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu, Xingyi Li, Weidong Zhang, Hao Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

텅 빈 디지털 방에 서서, 당신이 보고 싶은 것을 설명하기만 하면 컴퓨터가 북적이는 도시 거리, 조용한 숲속 공터, 혹은 미래형 우주 정거장을 만들어내는 모습을 상상해 보십시오. 이것이 바로 기계가 인간처럼 3차원 공간과 상호작용하고 이를 구축하는 법을 배우는 분야인 '체화된 인공지능(embodied artificial intelligence)'의 약속입니다. 수년 동안 연구자들은 컴퓨터에게 텍文本 지침에 따라 가구, 나무, 건물과 같은 디지털 객체를 배치하도록 가르치려 노력해 왔습니다. 그러나 이전의 대부분의 시도는 "여기에 의자를 놓아줘"와 같은 단순하고 이상적인 요청만을 다루었습니다. 사용자가 특정 조명과 분위기를 가진 "아늑하고 약간 어수선한 서재"를 요구하는 것처럼, 복잡하고 개방적인 실제 인간의 대화에 직면했을 때 그들은 어려움을 겪었습니다. 더욱이, 이러한 세계를 구축하는 도구들이 흩어져 있고 테스트 방법이 일관되지 않았기 때문에, 인공지능이 정말로 요청을 이해하고 있는 것인지 아니면 단순히 추측하고 있는 것인지 알기가 어려웠습니다.

한 연구팀이 이제 '바이브월딩(VibeWorlding)'이라는 새로운 프레임워크를 통해 이 과제에 도전했습니다. 그들은 인공 에이전트가 사용자의 설명을 듣는 것뿐만 아니라, 능동적으로 계획을 세우고, 적절한 디지털 객체를 검색하고, 3D 공간에 배치한 다음, 그 결과를 살펴보고 그것이 비전에 부합하는지 확인하는 종합적인 시스템을 만들었습니다. 연구진은 작은 소품부터 큰 건물에 이르기까지 2,600개 이상의 고품질 3D 객체를 포함하는 거대한 테스트 환경을 구축했으며, 이를 사용하여 수백 개의 복잡한 장면을 생성했습니다. 그런 다음, 정밀한 지침이 담긴 요청과 모호하고 개방적인 욕구가 담긴 요청을 모두 포함하는 수천 개의 독특한 사용자 요청을 생성하여, 서로 다른 인공지능들이 이 작업을 얼마나 잘 수행할 수 있는지 테스트했습니다. 이 시스템은 단순히 객체가 올바른 위치에 있는지를 확인하는 것을 넘어, 물리적으로 타당한지를 검사하는 엄격한 심판 역할을 합니다. 예를 들어, 테이블이 공중에 떠 있거나 나무가 벽 안에 자라고 있지 않은지 확인하는 식입니다.

연구진이 주요 기술 기업들의 모델을 포함하여 오늘날 사용 가능한 가장 진보된 인공지능 모델들을 테스트했을 때, 현재의 역량과 자동으로 이러한 세계를 구축하는 목표 사이에는 상당한 격차가 있음을 발견했습니다. 코드를 작성하고 복잡한 질문에 답할 수 있는 가장 강력한 모델들조차도, 요청된 장면을 성공적으로 구축하는 데 있어 60% 이상의 실패율을 보였습니다. 이러한 실패의 주요 원인은 사용자의 말을 이해하지 못해서가 아니라, 3차원 세계를 편집하는 정밀한 물리적 행위의 어려움 때문이었습니다. 모델들은 사용자가 책장을 옮기기를 원한다는 점은 이해했지만, 거리를 잘못 계산하거나 물체를 엉뚱한 방향으로 움직여 다른 아이템과 충돌하게 하거나 비현실적으로 띄우곤 했습니다.

이 간극을 메우기 위해, 연구팀은 아이가 블록 쌓기를 배우는 것과 유사하게 시행착오를 통해 인공지능을 가르치는 특화된 훈련 방법을 개발했습니다. 이 시스템은 에이전트가 장면을 구축하도록 하고, 물리 법칙과 사용자의 의도에 대한 엄격한 규칙에 따라 결과를 확인한 다음, 정확히 해냈을 때만 에이전트에게 보상을 줍니다. '강화 학습(reinforcement learning)'이라고 알려진 이 과정은 연구진이 언젠가 최고의 폐쇄형 모델을 능가할 수 있는 오픈 소스 모델을 훈련할 수 있게 해주었습니다. 300억 개의 파라미터를 기반으로 시작한 그들의 최고 훈련 모델은 테스트된 모든 시스템 중 가장 높은 성공률을 달고 기록했습니다. 이 모델은 올바른 객체를 검색하고, 충돌 없이 배치하며, 환경의 물리적 제약을 준수하는 법을 배웠으며, 결과적으로 사용자가 만들고자 했던 세계의 '바이브(vibe, 분위기)'를 효과적으로 숙달했습니다.

이 연구는 또한 이러한 모델들이 거시적인 구조를 이해하는 능력은 향상되고 있지만, 가장 어려운 부분은 여전히 미세한 세부 사항에 대한 공간적 추론임을 밝혔습니다. 에이전트들은 물체를 정확히 7미터 앞으로 이동시키지 못하고 지나치거나 미달하는 것과 같은 정밀한 측정에서 여전히 어려움을 겪습니다. 그러나 연구진은 이 훈련 방법이 에이전트의 3차원 공간에 대한 추론 능력을 크게 개선하여, 주요 약점을 강점으로 바꾸어 놓았다는 것을 발견했습니다. 연구진은 자신들의 데이터, 도구, 그리고 훈련된 모델을 공개함으로써, 언젠가 게임, 시뮬레이션, 가상 현실을 위한 인터랙티브 3D 세계를 인간 디자이너만큼 쉽고 창의적으로 구축할 수 있는 시스템의 발전을 가속화하기를 희망하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →