PolyComp: A Polycube-based Benchmark for Compositional 3D Spatial Reasoning in Multimodal Models
이 논문은 멀티모달 모델의 구성적 3D 공간 추론 능력을 평가하기 위해 설계된 120개의 문제로 구성된 절차적 생성 벤치마크인 PolyComp을 소개하며, GPT-5.6 Sol과 같은 고급 모델들은 중간 정도의 정확도(50%)를 달성하는 반면, 다른 모델들은 비용과 제시 형식이 다양함에도 불구하고 무작위 추측 수준 근처에서 어려움을 겪는다는 점을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인간의 정신은 복잡한 형태를 분해하고 그것들이 어떻게 다시 결합되는지 상상하는 조용하면서도 거의 본능적인 재능을 지니고 있습니다. 우리는 퍼즐 조각, 부서진 장난감, 또는 쌓여 있는 상자를 보고 모든 표면을 볼 수 없는 상태에서도 그 부품들이 전체와 어떻게 연관되는지를 즉각적으로 시각화할 수 있습니다. 공간 추론이라고 알려진 이 능력은 우리가 물리적 세계를 탐색하는 방식의 초석입니다. 수십 년 동안 과학자들은 이미지를 보고 텍스트를 읽을 수 있는 새로운 세대의 인공지능이 이와 동일한 내부적 공간감을 발달시켰는지 궁금해해 왔습니다. 이 기계들은 사진 속의 고양이를 인식하거나 기사를 요약하는 데는 뛰어나지만, 물체의 3차원 기하학적 구조를 진정으로 이해하고 있는지, 아니면 단순히 이전에 보았던 패턴에 기반해 추측하고 있는 것인지는 여전히 불분명합니다.
한 새로운 연구는 단순한 이미지 인식을 넘어 기계가 형태와 조립에 대해 어떻게 생각하는지를 조사하기 위해 설계된 엄격한 테스트를 도입하여 이 질문을 해결하고자 합니다. 연구진은 블록 형태의 큐브 기반 구조로 만들어진 120개의 시각적 퍼즐 모음인 폴리콤프(PolyComp)라는 벤치마크를 제작했습니다. 각 퍼즐에서 인공지능은 여러 개의 연결된 큐브로 만들어진 대상 물체를 두 가지 다른 각도에서 보여줍니다. 그런 다음 인공지능은 네 가지 가능한 작은 조각 쌍 중 하나를 제시받고, 어떤 쌍이 회전하고 이동했을 때 원래의 대상을 완벽하게 재현할 수 있는지 식별하도록 요청받습니다. 이 작업은 모델이 조각들의 3D 표현을 정신적으로 구축하고, 조각들이 공간에서 어떻게 회전할지 시뮬레이션하며, 틈이나 겹침 없이 잘 맞는지 확인하는 것을 요구합니다. 이것은 기억력이나 언어 능력에 대한 테스트가 아니라, 순수한 기하학적 논리 테스트입니다.
이 연구는 가장 발전된 세 가지 인공지능 시스템인 GPT-5.6 Sol, Claude Fable 5, Gemini 3.1 Pro Preview를 테스트에 투입했습니다. 각 시스템은 동일한 120개의 퍼즐을 풀도록 요청받았으나, 이미지 형식이 추론에 도움이 되는지 혹은 방해가 되는지 확인하기 위해 퍼즐은 세 가지 다른 방식으로 제시되었습니다. 때로는 대상과 선택지들이 하나의 이미지에 함께 나타났고, 다른 경우에는 대상이 하나의 이미지에 나타나고 네 개의 선택지가 일반적인 라벨이나 설명적인 이름과 함께 네 개의 별도 이미지로 나뉘어 제시되었습니다. 목표는 정보를 더 작은 단위로 나누는 것이 작업을 더 쉽게 만드는지, 아니면 정보가 어떻게 표시되든 상관없이 모델이 어려움을 겪는지 확인하는 것이었습니다.
결과는 인간 수준의 직관과 현재 기계 능력 사이의 상당한 격차를 드러냈습니다. 가장 성능이 좋은 모델인 GPT-5.6 Sol은 퍼즐의 절반만을 올바르게 풀어내어 50퍼센트의 정확도를 기록했습니다. 두 번째 모델인 Claude Fable 5는 약 39퍼센트를 해결했으며, 세 번째 모델인 Gemini 3.1 Pro Preview는 무작위 추측 수준인 27.5퍼센트의 정답률을 보였습니다. 모든 퍼즐에는 네 개의 선택지가 있었으므로, 컴퓨터가 맹목적으로 추측한다면 25퍼센트의 정답을 얻을 것으로 예상됩니다. 이는 가장 진보된 모델들도 겨우 확률보다 조금 나은 수준이었으며, 가장 낮은 성능의 모델은 사실상 추측하고 있었음을 의미합니다. 또한 연구는 형태의 유형이 이미지가 제시되는 방식보다 더 중요하다는 것을 발견했습니다. 모델들은 조각들이 고리 모양의 구조를 형성하는 직사각형 루프가 포함된 퍼즐에서 가장 어려움을 겪었지만, 단순한 블록이 분리되거나 결합되는 것처럼 보이는 퍼즐에서는 약간 더 나은 성능을 보였습니다.
흥lik하게도, 퍼즐이 보여지는 방식은 결과에 극적인 차이를 만들지 않았습니다. 이미지를 별도의 파일로 나누거나 설명적인 라벨을 추가하는 것이 모델들의 점수를 크게 높이지는 못했습니다. 이는 문제의 원인이 모델이 이미지를 명확하게 보는 능력에 있는 것이 아니라, 물체의 안정적인 내부 3D 모델을 구축하고 그것의 움직임을 시뮬레이션하는 능력에 있음을 시사합니다. 연구진은 모델이 성공했을 때, 그것은 종-종 조각들이 매우 명확한 전체적인 형태를 가졌거나 매칭하기 쉬운 큰 평면을 가지고 있었기 때문이라고 언급했습니다. 퍼즐이 작은 숨겨진 모서리를 추적하거나 빈 공간 안에 조각이 어떻게 들어맞는지 파악해야 할 때, 모델들은 일관되게 실패했습니다.
이 연구는 이러한 종류의 깊은 추론에 따르는 비용 또한 강조했습니다. 총 360개의 질문(세 가지 방식으로 제시된 120개의 퍼즐)을 해결하기 위해, 가장 유능한 모델은 표준 가격을 기준으로 질문당 거의 1달러에 달하는 막대한 컴퓨팅 자원을 소비했습니다. 능력이 떨어지는 모델들은 실행 비용은 더 저렴했지만 정확도 또한 낮았습니다. 이러한 트레이드오프는 우리가 사용 가능한 가장 강력한 시스템에 비용을 지불하더라도, 그들이 인간이 자연스럽게 발달시키는 근본적인 공간 지능을 여전히 결여하고 있음을 시사합니다. 연구진은 향후 모델들을 이 동일한 기준으로 테스트할 수 있도록 120개의 퍼즐과 이를 생성하는 데 사용된 코드를 모두 공개했습니다.
궁극적으로 이 작업은 인공지능이 언어를 이해하고 사물을 인식하는 데 엄청난 발전을 이루었지만, 아직 3차원 공간을 정신적으로 조작하는 능력은 마스터하지 못했음을 보여주는 명확한 진단 도구 역할을 합니다. 모델들은 큐브를 설명하거나 형태를 식별할 수는 있지만, 두 개의 분리된 조각이 공중에서 회전하고 돌려졌을 때 어떻게 서로 맞물릴지 신뢰성 있게 상상하지는 못합니다. 기계가 이러한 내부 3D 지도를 구축하고 그 안에서 변형을 시뮬레이션할 수 있게 될 때까지, 그들의 공간 추론은 취약하고 오류가 발생하기 쉬울 것이며, 이는 인간 어린이가 쉽게 해결할 수 있는 문제일 것입니다. 이 연구는 이러한 능력을 기계가 학습하는 것이 불가능하다고 주장하는 것이 아니라, 현재의 시스템이 아직 이를 달성하지 못했음을 확고히 입증함으로써, 그 간극을 메우기 위한 미래 연구의 명확한 경로를 제시하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.