← 최신 논문
🤖 machine learning

SpaRRTa: A Synthetic Benchmark for Evaluating Spatial Intelligence in Visual Foundation Models

이 논문은 시각적 기초 모델(Visual Foundation Models)의 공간 추론 능력을 평가하기 위해 설계된 합성 벤치마크인 SpaRRTa를 소개하며, 이는 객체의 상대적 위치를 식별하는 능력을 테스트함으로써 현재 모델들의 공간 인지력에 나타나는 상당한 격차를 드러내고 향후 발전을 안내한다.

원저자: Turhan Can Kargin, Wojciech Jasiński, Adam Pardyl, Bartosz Zieliński, Marcin Przewięźlikowski

게시일 2026-08-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Turhan Can Kargin, Wojciech Jasiński, Adam Pardyl, Bartosz Zieliński, Marcin Przewięźlikowski

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 어질러진 방을 지나가는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇에게 의자 위에 앉아 있는 고양이와 그 옆에 있는 램프가 찍힌 사진을 보여줍니다. 똑똑한 로봇는 두 가지를 알아야 합니다. 즉, 그것들이 '무엇'인지(고양이, 의자, 램프)와 그것들이 서로에 대해 '어디에' 있는지(고양이는 램프의 왼쪽에 있다)입니다. 오랫동안 컴퓨터는 첫 번째 부분, 즉 사진 속의 물체를 식별하는 데 매우 능숙해졌습니다. 하지만 두 번째 부분인 3D 레이아웃과 방향을 이해하는 것은, 마치 평면적인 그림을 보고 공이 어디에 있는지 눈을 가린 채 추측하려는 사람과 같았습니다.

이것이 바로 "시각 기초 모델(Visual Foundation Models)"의 세계입니다. 이들은 수백만 장의 사진을 읽고 패턴을 학습한 초지능형 AI 뇌라고 생각하면 됩니다. 이들은 현대적인 이미지 도구들의 엔진 역할을 합니다. 그러나 연구자들은 이 뇌들이 가진 결함을 발견했습니다. 이들은 "저것은 나무다!"라고 말하는 데는 뛰어나지만, "나무가 자동차의 왼쪽에 있나, 오른쪽에 있나?"라는 질문에는 종종 비틀거립니다. 이는 우리가 집 안을 돌아다니거나 자동차를 운전하고 싶을 때, 단순히 라벨을 붙이는 것이 아니라 공간을 이해해야 하기 때문에 매우 중요합니다. 큰 질문은 이것입니다. 이 AI 뇌들이 실제로 3D 세상을 "보는" 것일까요, 아니면 특정 수학 문제의 정답을 맞히기 위해 속임수를 암기하고 있는 것일까요?

이 미스터리를 해결하기 위해, 연구팀은 SpaRRTa(공간 관계 인식 작업)라는 새로운 테스트를 만들었습니다. SpaRRTa는 AI에게 정확한 거리를 측정하거나 3D 지도를 그리는 것과 같은 복잡한 수학을 요구하는 대신, 더 단순하고 근본적인 질문을 던집니다. "이 특정 관점에서 볼 때, 물체 A는 물체 B의 왼쪽, 오른쪽, 앞, 또는 뒤 중 어디에 있는가?"

이 테스트를 공정하고 매우 정밀하게 만들기 위해, 연구자들은 인터넷에서 가져온 실제 사진을 사용하지 않았습니다. 대신 그들은 하이엔드 게임 엔진(Unreal Engine 5)을 사용하여 가상 세계를 구축했습니다. 그들은 숲, 사막, 눈 내리는 마을, 다리, 번화한 도시와 같은 극사실적인 장면을 만들고 자동차, 나무, 개와 같은 물체들을 배치했습니다. 그들은 카메라를 움직이거나, 심지어 '관점'을 장면 속의 한 사람으로 설정하여, AI에게 단순히 카메라의 시선이 아닌 그 사람의 눈으로 세상을 상상하도록 요청할 수 있었습니다. 이것은 "내가 자동차 뒤에 서 있다면, 나무가 나의 왼쪽에 있을까, 오른쪽에 있을까?"라고 묻는 것과 같습니다.

연구자들은 사진만 보고 학습한 모델부터 3D 기하학을 구체적으로 학습한 모델까지 다양한 종류의 AI 뇌들을 테스트했습니다. 그들은 "프로빙(probing)"이라는 영리한 기술을 사용했습니다. AI의 뇌를 정보가 담긴 잠긴 상자라고 상상해 보세요. 전체 상자를 다시 훈련시키는 대신, 그 안에 공간 정보가 이미 들어있는지 확인하기 위해 작고 단순한 열쇠(프로브)를 만들었습니다. 그들은 세 가지 다른 열쇠를 시도했습니다. 전체 이미지를 한 번에 보는 단순한 열쇠, 중요한 지점을 골라낼 수 있는 더 똑똑한 열쇠, 그리고 여러 특정 대상에 동시에 집중할 수 있는 초지능형 열쇠입니다.

그 결과는 다음과 같으며, 이는 다소 놀랍습니다. 첫째, 단순한 열쇠는 자주 실패했습니다. AI의 "전역적(global)" 시야(이미지를 하나의 커다란 덩어리로 보는 것)가 실제로 공간적 세부 사항을 숨겨버린다는 것이 밝혀졌습니다. 사물의 위치에 대한 정보는 이미지의 작은 국소적 패치들, 즉 개별 퍼즐 조각들 안에 저장되어 있습니다. 이 조각들을 하나의 요약본으로 뭉쳐버리면 방향 정보는 사라지게 됩니다. 그러나 더 똑똑하고 집중된 열쇠를 사용했을 때, AI 뇌들은 훨씬 더 나은 성능을 보였습니다.

이 연구는 이러한 모델들이 공간 인지 능력을 갖추고 있기는 하지만, 그 능력이 아주 세밀한 디테일 속에 숨겨져 있다는 것을 시사합니다. 3D 데이터(예를 들어 정확히 얼마나 떨어져 있는지 아는 것)로 특별히 훈련된 모델들이 가장 좋은 성과를 냈지만, 평면적인 2D 사진만 본 모델들조차 올바른 방식으로 질문한다면 방향을 이해할 수 있음을 보여주었습니다. 흥고하게도, AI는 카메라의 시점에서 보는 것보다 장면 속 인물의 관점(알로센트릭/allocentric 뷰)을 취하는 것을 훨씬 더 어려워했습니다. 이것은 우리가 사진을 보고 "나무가 자동차의 왼쪽에 있다"라고 말하는 것은 쉽지만, "우리가 자동차 뒤에 서 있다면 나무가 나의 오른쪽에 있다"라고 상상하는 것은 훨씬 더 어렵다는 것과 같습니다.

연구자들은 꽃이나 비행기를 잘 식별하는 것이 공간을 잘 이해하는 것과 관련이 있는지도 확인했습니다. 답은 '아니오'였습니다. AI는 사물의 이름을 맞히는 데는 달인이 될 수 있지만, 그것들이 어디에 있는지는 전혀 모를 수 있습니다. 이는 SpaRRTa가 단순히 물체 인식과는 완전히 다른 기술을 측정하고 있음을 증명합니다.

요약하자면, 이 논문은 현대의 AI 뇌들이 공간에 대해 "눈먼" 것이 아니라, 공간 지식을 큰 그림의 요약본이 아닌 이미지의 미세한 디테일 속에 숨기고 있다는 점을 시사합니다. 로봇이 우리 세상 속을 실제로 항해할 수 있게 만들려면, 단순히 물체를 인식하도록 요구하는 것을 넘어, SpaRRTa와 같은 도구를 사용하여 물체 사이의 관계를 이해하도록 가르쳐야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →