VGI-Bench: Probing Visual Intelligence in Video Generation Models
이 논문은 비디오 생성 모델의 시각적 추론 능력을 엄격하게 평가하기 위해 설계된 27개의 태스크와 810개의 인스턴스로 구성된 종합적인 벤치마크인 VGI-Bench를 소개하며, Seedance 2.0과 같은 최첨단 시스템조차 단 51.0%의 정확도만을 달성하고 생성 과정 중 신뢰할 수 있는 자기 수정에 어려움을 겪는다는 점을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
세상을 단순히 관찰하는 것을 넘어, 세상이 어떻게 변할지 상상할 수 있는 컴퓨터를 상상해 보십시오. 수년 동안 인공지능은 매트 위에 앉아 있는 고양이, 길가에 주차된 자동차와 같이 정지된 이미지를 인식하도록 훈련받아 왔습니다. 최근에는 이러한 시스템들이 영상을 생성하는 법을 배워, 놀라울 정도로 실감 나는 움직이는 그림을 만들어내고 있습니다. 과학자들은 이제 이 영상 생성기들이 단순히 움직임을 흉내 내는 것 이상의 무언가를 하고 있는 것은 아닌지 궁금해하고 있습니다. 그들은 기계가 물리 세계의 법칙(중력, 인과관계, 물체의 상호작용 방식 등)을 이해하기 시작하여, 결과를 보여주기 전에 일련의 사건들을 머릿속으로 "생각"해낼 수 있는지 묻고 있습니다. 이 질문은 비디오 생성 AI가 진정으로 추론할 수 있는 것인지, 아니면 단지 그럴듯한 결말이 무엇일지 추측하고 있는 것인지를 측정하려는 새로운 노력의 핵심에 자리 잡고 있습니다.
한 연구팀은 이 질문에 답하기 위해 VGI-Bench라는 새로운 테스트 환경을 구축했습니다. 연구진은 AI에게 단순한 선으로 그려진 추상적인 퍼즐을 풀게 하는 대신, 일상적인 장면이 담긴 사실적인 사진을 입력하고 특정 논리적 규칙을 따르는 영상을 생성하도록 요청했습니다. 과제들은 도전적이면서도 실행 가능한 수준으로 설계되었으며, 기계가 과정을 단계별로 시뮬레이션하도록 요구했습니다. 예를 들어, AI에게 미로 입구에 놓인 장난감 자동차 사진을 보여주고 벽에 부딪히지 않고 출구까지 운전해 나가는 영상을 생성하도록 요청할 수 있습니다. 또 다른 과제로는 펼쳐진 평평한 종이 상자를 보여주고, 이 상자가 스스로 접혀 3D 입체 모양이 되는 과정을 애니메이션화하도록 할 수 있습니다. 연구진은 단순히 최종 이미지만을 본 것이 아니라, 영상 전체를 면밀히 조사하여 기계가 매 순간 규칙을 준-수했는지 확인했습니다. 물체가 벽을 통과하거나, 자동차가 순간 이동하거나, 물체가 사라졌다가 다시 나타나는 현상 등을 체크했습니다.
현재 사용 가능한 가장 진보된 영상 생성 모델들을 테스트했을 때, 결과는 가능성과 한계가 공존했습니다. 가장 우수한 성능을 보인 'Seedance 2.0'이라는 모델조차 이러한 엄격한 조건 하에서 과제의 약 절반 정도만을 올바르게 해결했습니다. AI는 종종 대략적인 개념은 잘 파악했지만, 일관된 이야기를 유지하는 데는 자주 실패했습니다. 많은 영상에서 물리 법칙이 무너졌는데, 예를 들어 기울어진 노트북 위에 놓인 컵이 아래로 굴러떨어지지 않거나, 자동차가 단단한 벽을 그대로 뚫고 지나가는 식이었습니다. 또한 기계들은 규칙을 지키는 데 어려움을 겪었으며, 때로는 필요한 단계를 건너뛰거나 영상 중간에 물체의 정체성을 바꾸기도 했습니다. 최종 결과물이 올바르게 보이더라도 그 과정은 불가능한 움직임들로 가득 차 있었는데, 이는 모델들이 최종 상태를 예측하는 데는 능숙하지만 그곳에 도달하기 위한 여정을 시뮬레이션하는 데는 서투르다는 것을 시사합니다.
연구진은 이러한 실패가 왜 발생하는지 이해하기 위해 더 깊이 파고들었습니다. 그들은 입력 이미지의 스타일이 매우 중요하다는 것을 발견했습니다. AI에게 사실적인 사진을 주었을 때 단순한 선화를 주었을 때보다 더 높은 성능을 보였는데, 이는 모델들이 실제 세계의 이미지로 훈련되었으며 시각적 스타일이 변할 때 어려움을 겪는다는 것을 나타냅니다. 또한 연구진은 AI가 영상을 생성할 때 단계별로 어떻게 "생각"하는지도 살펴보았습니다. 그들은 모델들이 진행 과정에서 자신의 실수를 실제로 수정하지 않는다는 사실을 발견했습니다. 만약 AI가 영상 생성 초기 단계에서 오류를 범하면, 이를 바로잡기보다는 잘못된 아이디어를 계속 다듬는 경향이 있었습니다. 즉, 기계는 초기에 하나의 가설을 확정 지어 버리고, 설령 그 가설이 물리 법칙이나 과제의 규칙에 어긋나더라도 그것을 계속 정교하게 다듬는 것입니다.
이 연구는 영상 생성 모델들이 시각적 콘텐츠를 만드는 강력한 도구가 되고 있기는 하지만, 인간이 세상을 항해할 때 사용하는 것과 같은 신뢰할 수 있는 단계별 추론 능력은 아직 갖추지 못했음을 시사합니다. 이들은 외형과 단순한 움직임은 시뮬레이션할 수 있지만, 시간이 흐름에 따라 사물이 실제로 어떻게 작동하는지에 대한 깊고 일관된 이해는 부족합니다. 새로운 벤치마크는 이러한 격차를 측정하는 명확한 방법을 제공하며, 현재의 시스템들이 진정한 시각적 추론기에 도달하기에는 아직 멀었다는 점을 보여줍니다. 모델이 물체를 추적하는지, 규칙을 따르는지, 혹은 오류를 수정하는지 등 정확히 어느 부분에서 실패하는지를 밝혀냄으로써, 이 연구는 미래를 진정으로 상상할 수 있는 차세대 인공지능을 구축하기 위한 로드맵을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.