LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?
이 논문은 기초적인 과업과 조립 계획을 통해 멀티모달 거대 언어 모델(MLLM)의 다단계 공간 추론 능력을 평가하는 벤치마크인 LEGO-Puzzles를 소개하며, 가장 강력한 모델들조차 인간에 비해 현저히 낮은 성능을 보이고 계획의 복잡성이 증가함에 따라 정확도를 유지하는 데 어려움을 겪는다는 점을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 블록으로 복잡한 성을 쌓는 법을 가르치려 한다고 상상해 보세요. 하지만 당신은 오직 말로 설명하거나 사진을 보여주는 방식으로만 로봇과 소통할 수 있습니다. 이것이 바로 **멀티모달 거대 언 언어 모델(Multimodal Large Language Models, MLLMs)**의 세계입니다. 이 모델들을 텍ming과 이미지를 보고 이해하며 인간처럼 세상을 이해하려고 노력하는 아주 똑똑한 디지털 두뇌라고 생각하면 됩니다. 어떤 두뇌에게든 배우기 가장 어려운 것 중 하나는 공간 추론(spatial reasoning), 즉 물체가 3D 공간에서 어떻게 서로 맞물리는지, 어떤 블록이 위에 올라가야 하는지, 어떤 것을 돌려야 하는지, 그리고 부품을 추가함에 따라 전체 구조가 어떻게 변하는지를 이해하는 능력입니다. 이러한 AI 모델들이 대화를 나누거나 사진을 묘사하는 능력은 점점 좋아지고 있지만, 과학자들은 여전히 한 가지 의문을 품고 있습니다. 과연 이들이 무언가를 만들기 위해 일련의 움직임을 '계획'할 수 있을 것인가 하는 점입니다. 완성된 탑을 보고 "높다"라고 말하는 것과, 그것을 처음부터 만들기 위해 정확히 50단계의 순서를 파악하는 것은 전혀 다른 차원의 문제입니다. 만약 로봇이 우리의 자동차를 수리하거나 가구 조립을 돕기를 원한다면, 그들은 반드시 이런 단계별 사고 능력을 마스터해야 합니다.
여기에 연구자들이 바로 이 기술을 테스트하기 위해 설계한 새로운 "시험"인 LEGO-Puzzles가 등장했습니다. 연구자들은 실제 플라스틱 브릭 대신 레고 조립 설명서를 활용한 거대한 디지털 놀이터를 만들어, 세계에서 가장 똑똑한 AI 모델들이 공간 퍼즐을 얼마나 잘 다루는지 확인했습니다. 그들은 이 테스트를 두 가지 주요 단계로 나누었습니다. 첫 번째 단계인 **초급 세트(Elementary Set)**는 워밍업과 같습니다. 이 단계는 단일 사진에 대한 간단한 질문을 던집니다. "어느 블록이 더 높은가?", "이 두 조각이 서로 맞닿아 있는가?", 혹은 "이 부품을 돌리면 옆면에서 보았을 때 어떤 모양이 되는가?"와 같은 질문들입니다. 이는 기본적인 "공간 이해력"을 테스트합니다. 두 번째 단계인 **계획 세트(Planning Set)**는 진정한 보스전입니다. 여기서 AI는 단순히 질문에 답하는 것을 넘어, 숙련된 조립 전문가처럼 행동해야 합니다. AI에게는 시작 시점의 블록 더미와 최종 목표가 담긴 사진이 주어지며, AI는 그곳에 도달하기 위한 단계별 계획을 생성해야 합니다. 연구자들은 GPT-5나 제미나이(Gemini)와 같은 가장 유명한 이름들을 포함하여 29개의 가장 진보된 AI 모델들을 테스트했으며, 심지어 인간 전문가들에게도 동일한 테스트를 수행하게 했습니다.
결과는 AI 업계에 다소 냉혹한 현실을 보여주었습니다. 가장 강력한 모델들조차 기초적인 부분에서 고전했습니다. 초급 질문에서 가장 뛰어난 AI 모델들도 인간의 성과보다 최소 20% 뒤처졌습니다. 예를 들어, 3D 공간에서 블록의 높이를 판단하라는 요청을 받았을 때, 많은 모델이 화면상의 평면적인 2D 사진만을 보고 실제 3D 형상을 상상하지 못해 혼란을 겪었습니다. 하지만 문제는 단계가 길어질수록 훨씬 심각해졌습니다. AI가 객관식 질문을 통해 일련의 단계를 계획해야 할 때, 계획이 3단계를 넘어서면 정확도가 급격히 떨어져 50% 미만으로 내려갔습니다. 계획에 8단계가 필요해지자, 최고의 모델들의 정확도는 **0%**로 떨어졌습니다. 반면, 인간 참가자들은 계획의 길이가 아무리 길더라도 모든 계획 과제를 완벽하게 해결했습니다.
연구자들은 한 단계 더 나아가, AI에게 단순히 단계를 묘사하는 것을 넘어 중간 과정의 사진을 직접 그려보도록 요청했습니다. 그들은 AI가 1단계, 2단계를 거치며 성이 어떻게 변하는지 시각적으로 상상할 수 있는지 알고 싶었습니다. 결과는 극명했습니다. 단 3단계의 짧은 계획에 대해서도, 모델들은 올바른 시각적 순서를 생성하는 데 완전히 실패했습니다. 모델들은 가끔 레고 브릭처럼 보이는 그림을 그려낼 수는 있었지만, 그것을 올바른 위치에 놓거나 방향을 정확히 맞추지는 못했습니다. 논문은 모델들이 단 3단계의 이미지 생성에서도 처참하게 실패했기 때문에, 이 특정 작업에 대해서는 더 긴 호흡의 테스트를 진행하지 않았다고 명시했습니다. 이는 모델들이 패턴을 인식하는 데는 뛰어나지만, 자신의 행동이 가져올 결과를 "상상"하는 능력은 부족하다는 것을 시사합니다 합니다. 즉, 머릿속에 조립 과정을 위한 정신적 지도를 유지하지 못하면 길을 잃게 된다는 것입니다.
요약하자면, LEGO-Puzzles는 현재의 AI 모델들이 인상적이기는 하지만, 진정한 공간 지능을 갖추기에는 아직 매우 멀리 있다는 것을 보여줍니다. 이들은 신뢰할 수 있는 다단계 조립 계획을 세울 수 없으며, 사물의 미래 상태를 시각화하는 데 있어서는 처참하게 실패합니다. 이 논문은 AI가 물리적 세계를 이해하여 스스로 무언가를 만들거나, 고장 난 물건을 고치거나, 복잡한 환경을 스스로 탐색하도록 돕기까지는 갈 길이 매우 멀다고 결론짓습니다. 물리적 세계를 대하는 인간의 직관과 기계적 계산 사이의 간극은 여전히 넓으며, 이 새로운 벤치마크는 모델들이 어디에서 비틀거리고 있는지에 대한 명확한 지도를 제공합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.