← 최신 논문
🤖 machine learning

MOSH-WM: Mask-Grounded Soft-Hamiltonian Dynamics for Object-Centric World Models

MOSH-WM은 슬롯 소유 이미지 마스크의 공간 모멘트를 사용하여 객체 역학을 명시적으로 제약하는 마스크 기반 소프트 해밀토니안(soft-Hamiltonian) 월드 모델을 도입하며, 이를 통해 OBJ3D 및 CLEVRER 데이터셋에서 기존 객체 중심 베이스라인 대비 장기 비디오 예측 정확도와 오차 누적 측면에서 상당한 개선을 달성한다.

원저자: Zhekai Wang, Haoxiang Huang, Xiang Liu, Zhikang Chen, Yueqing Sun, Qi Gu, Shiji Zhou, Miao Liu, Sen Cui

게시일 2026-08-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhekai Wang, Haoxiang Huang, Xiang Liu, Zhikang Chen, Yueqing Sun, Qi Gu, Shiji Zhou, Miao Liu, Sen Cui

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 세상을 보는 법을 어떻게 배울 수 있는지 이해하려면, 먼저 컴퓨터가 현재 이를 수행하는 데 있어 어떤 어려움을 겪고 있는지부터 이해해야 합니다. 인공지능이 영상을 시청할 때, 그것은 종종 장면을 시간에 따라 변하는 하나의 평면적인 이미지로 취급합니다. 이는 마치 아이가 단어의 리듬을 들으며 문장을 완성하는 법을 배우는 것처럼, 픽셀의 패턴을 포착하여 다음 프레임을 예측하는 방식으로 학습합니다. 그러나 이러한 방식은 장면이 복잡해지거나 컴퓨터가 훨씬 더 먼 미래를 예측해야 할 때 종종 실패합니다. 시스템은 구르는 공이 갑자기 다른 색으로 변하거나 사라질 것이라고 예측할 수도 있는데, 이는 컴퓨터가 물체가 어떻게 움직이고 상호작용하는지에 대한 규칙을 진정으로 학습하지 못했기 때문입니다. 시스템은 표면은 보지만 구조는 놓치고 있는 것입니다. 더 신뢰할 수 있는 시각 능력을 구축하기 위해, 연구자들은 장면을 빨간 공, 파란 상자, 초록색 탁자와 같이 별개의 뚜렷한 개별 요소들로 분해하고 각각을 개별적으로 추적하도록 컴퓨터를 가르치는 방법인 '객체 중심(object-centric)' 학습에 주목하고 있습니다. 목표는 컴퓨터가 단순히 다음 그림을 추측하는 것이 아니라, 물리 법칙에 따라 이러한 개별 객체들을 진화시킴으로써 미래의 사건을 상상할 수 있게 하는 정신적 시뮬레이션인 '세계 모델(world model)'을 만드는 것입니다.

한 연구팀은 이러한 객체 기반 모델들의 특정 약점을 해결하고자 하는 MOSH-WM이라는 새로운 시스템을 선보였습니다. 기존의 시스템들은 객체를 추적할 수는 있었지만, 종종 객체의 물리적 위치와 시각적 외형을 혼동하곤 했습니다. 자동차의 움직임을 묘사할 때 오직 자동차의 도색만을 보고 설명하려고 하는 상황을 상상해 보십시오. 만약 도색이 바뀐다면, 시스템은 자동차 자체가 움직였거나 모양이 변했다고 생각할 수 있습니다. 이 새로운 모델은 이 두 가지 개념을 완전히 분리합니다. 이 모델은 각 객체에 대해 오직 객체가 어디에 있고 얼마나 빨리 움직이는지만을 추적하며, 객체가 어떻게 보이는지는 무시하는 별도의 '물리적 상태(physical state)'를 생성합니다. 이 물리적 상태는 비디오의 어떤 픽셀이 특정 객체에 속하는지를 정확히 보여주는 디지털 윤곽선인 '마스크(mask)'에 근거합니다. 이 윤곽선을 사용하여 위치와 속도를 계산함으로써, 시스템은 색상이나 질감의 변화에 혼동되지 않는 안정적인 기하학적 이해를 구축합니다.

연구진은 움직이는 객체들이 담긴 영상을 통해 이 접근 방식을 테스트했으며, 컴퓨터에게 6프레임의 짧은 시퀀스를 시청하게 한 뒤 그다음 30프레임을 예측하도록 요청했습니다. 이 테스트에서 새로운 시스템은 기존의 가장 우수한 방법들을 크게 앞질렀습니다. 예측된 이미지가 실제 미래 프레임과 얼마나 일치하는지를 측정했을 때, 새 모델은 시각적 오류를 25% 줄였고 객체의 물리적 배치 오류를 33% 줄였습니다. 이러한 개선은 일시적인 성공이 아니었습니다. 기존 모델들은 예측이 진행됨에 따라 객체의 형태를 잃거나 색상이 변하는 등 오차가 발생하기 시작한 반면, 이 시스템은 30프레임 전체 시퀀스 동안 정확도를 유지했습니다. 이 안정성의 핵심은 물리에서 영감을 얻은 기술로, 시스템이 수학적 규칙과 학습된 패턴을 결 \합하여 객체가 현실적인 방식으로 움직이도록 '소프트(soft)'한 가이드를 사용하는 것입니다. 이 가이드는 마치 부드러운 손길처럼, 영상에 불완전한 세부 사항이 포함되어 있더라도 엄격한 공식에 의해 깨지지 않도록 예측을 운동 법칙 쪽으로 살짝 밀어주는 역할을 합니다.

결정적으로, 이 시스템은 시각적 세부 사항을 움직임 계산으로부터 분리하여 유지합니다. 컴퓨터가 객체가 어디에 있을지를 예측하고 나면, 과거의 외형들이 담긴 별도의 메모리 뱅크를 사용하여 세부 사항을 채워 넣음으로써 빨간 공은 계속 빨갛게, 파란 상자는 계속 파랗게 유지되도록 합니다. 이 두 단계의 과정 덕분에 모델은 물리적으로 정확하면서도 시각적으로 풍부할 수 있습니다. 연구진은 물리적 가이드나 시각적 메모리 중 하나라도 제거하면 시스템이 실패한다는 것을 발견했으며, 이는 모델이 작동하기 위해 두 부분이 모두 필요함을 입증합니다. 충돌과 복잡한 상호작용이 포함된 테스트에서도 모델은 성능을 유지했으며, 이는 객체의 '어디'에 있는지를 '무엇'처럼 보이는지와 분리하는 방식이 기계에게 물리적 세계를 이해하도록 가르치는 견고한 방법임을 시사합니다. 이 연구는 비디오 예측의 모든 문제를 해결했다고 주장하는 것은 아니지만, 컴퓨터의 움직임에 대한 이해를 단순히 시각적 특징이 아닌 실제 객체의 형태에 근거하게 함으로써, 우리가 훨씬 더 안정적이고 신뢰할 수 있는 시뮬레이션을 만들 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →