← 최신 논문
🤖 AI

SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning

이 논문은 상태 유지형 코드 실행 인터페이스를 활용하여 에이전트가 지각 연산을 유연하게 구성하고 모델별 적응 없이 20개의 벤치마크에서 최첨단 성능을 달성할 수 있게 함으로써, 시각-언어 모델의 개방형 3D/4D 공간 추론 능력을 향상시키는 학습이 필요 없는 프레임워크인 SpatialClaw를 소개한다.

원저자: Seokju Cho, Ryo Hachiuma, Abhishek Badki, Hang Su, Byung-Kwan Lee, Chan Hee Song, Sifei Liu, Subhashree Radhakrishnan, Seungryong Kim, Yu-Chiang Frank Wang, Min-Hung Chen

게시일 2026-06-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Seokju Cho, Ryo Hachiuma, Abhishek Badki, Hang Su, Byung-Kwan Lee, Chan Hee Song, Sifei Liu, Subhashree Radhakrishnan, Seungryong Kim, Yu-Chiang Frank Wang, Min-Hung Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 몇 장의 사진이나 영상을 보고, 3D 공간 속에서 히터가 문으로부터 정확히 얼마나 떨어져 있는지와 같은 복잡한 퍼즐을 풀려고 노력하고 있다고 상상해 보십시오.

오랫동안 AI 모델(Vision-Language Models라고 불리는)은 사진 속에 무엇이 있는지(예: "저것은 히터다")를 인식하는 데는 뛰어났지만, 사물이 3D 공간의 어디에 있는지, 그리고 서로 얼마나 떨어져 있는지 파악하는 데는 어려움을 겪었습니다. 이들은 모든 물체의 이름은 다 알지만, 거리감과 기하학적 감각은 엉망인 사람과 같습니다.

이를 해결하기 위해 연구자들은 AI 모델에게 "도구"(줄자나 3D 스캐너 같은 것)를 쥐여주려 노력했습니다. 하지만 그 도구들을 사용하는 방식이 투박했습니다. 이 논문인 SpatialClaw는 문제가 도구 자체에 있었던 것이 아니라, AI가 도움을 요청할 때 사용하는 사용 설명서(인터페이스)에 있었다고 주장합니다.

다음은 AI가 이 퍼즐을 해결하려고 시도했던 세 가지 방식을 쉬운 비유를 통해 설명한 것입니다.

1. "단판 승부" 도박꾼 (Single-Pass Code)

당신이 수학 문제를 풀어야 하는 게임을 하고 있는데, 답을 확인하기 전에 단 한 문장의 지시사항만 적을 수 있다고 상상해 보십시오.

  • 작동 방식: AI는 거리를 측정하기 위해 한 번에 전체 컴퓨터 프로그램을 작성해야 했습니다. 첫 번째 단계(예: 히터 찾기)가 실제로 제대로 작동하는지 확인하기도 전에 전체 전략을 미리 추측해서 써 내려가야 했습니다.
  • 문제점: 만약 AI가 첫 단계에서 아주 작은 실수라도 했다면, 전체 프로그램은 실패했습니다. AI는 "잠깐, 히터를 찾긴 했는데 마스크(영역 표시)가 잘못되었어. 거리를 재기 전에 이걸 먼저 수정하자"라고 말할 수 없었습니다. 이는 마치 자신의 전 재산을 단 한 번의 주사위 던지기에 전부 거는 것과 같았습니다.

2. "정해진 메뉴" 식당 (Structured Tool-Call)

당신이 레스토랑에 있는데, 웨이터가 오직 미리 인쇄된 작은 메뉴판에서만 주문하도록 허용한다고 상상해 보십시오. 당신은 "거리 측정 도구를 원합니다"라고 말하거나, "히터 찾기 도구를 원합니다"라고 말할 수 있습니다.

  • 작동 방식: AI는 목록에서 도구를 고를 수는 있었지만, 그것들을 창의적으로 조합할 수는 없었습니다. 만약 문제가 메뉴에 없는 기발한 도구의 조합을 필요로 한다면, AI는 꼼짝도 할 수 없었습니다. 이는 커스텀 샌드위치를 만들고 싶지만, 진열대에 놓인 완제품 중 하나만 골라야 하는 상황과 같았습니다.
  • 문제점: 현실 세계의 공간 문제는 매우 복잡합니다. 때로는 메뉴가 예상하지 못한 방식으로 도구를 결합해야 할 때가 있습니다.

3. "마스터 셰프" (SpatialClaw)

이제 당신에게 식재료가 가득한 주방(지속적인 Python 컴퓨터 프로그램)을 주고 이렇게 말한다고 상상해 보십시오. "당신은 셰프입니다. 어떤 재료든 집어 들고, 섞고, 맛을 보고, 만약 맛이 없다면 버리고 새로운 레시피를 시도하십시오. 요리가 완벽해질 때까지 단계별로 계속 요리할 수 있습니다."

  • 작동 방식:
    • 주방: AI는 이미지, 3D 지도, 마스크 같은 모든 재료를 안전하게 보관할 수 있는 "지속적인 주방"을 가집니다.
    • 단계별 진행: 한 번에 전체 레시피를 쓰는 것이 아닙니다. 하나의 작은 지시(예: "히터를 찾아라")를 쓰고, 그 결과(예: "오, 엉뚱한 물체를 찾았네!")를 확인한 뒤, 이를 수정하기 위한 다음 지시를 작성합니다.
    • 맛보기: AI는 자신의 작업물을 보고(시각적 피드백) "이 측정값은 좀 이상해 보이니, 다른 수학적 기법을 써보자"라고 말할 수 있습니다.
    • 자유도: AI는 정해진 메뉴에 얽매이지 않고, 원할 때마다 표준 수학 도구(계산기나 자 같은 것)를 사용할 수 있습니다.

결과

연구자들은 이 "마스터 셰프" 접근 방식(SpatialClaw)을 3D 거리, 움직이는 물체, 다양한 카메라 각도가 포함된 20가지의 서로 다른 퍼즐에 대해 테스트했습니다. 이들은 소형 모델부터 거대 모델까지 다양한 AI "두뇌"와 함께 이를 사용했습니다.

  • 성적: SpatialClaw는 평균 **59.9%**의 점수를 기록하며, 이전의 최고 성능을 가진 "AI 셰프"를 상당한 차이(11.2 포인트)로 앞질렀습니다.
  • 비결: 가장 큰 개선은 가장 어려운 퍼즐들—예를 들어 영상 속에서 사물이 어떻게 움직이는지 파악하거나, 다양한 각도에서 거리를 측정하는 문제—에서 나타났습니다. 이는 이러한 작업들이 AI로 하여금 끊임없이 자신의 작업을 확인하고, 실수를 바로잡으며, 도구를 새로운 방식으로 조합하도록 요구하기 때문이며, 오직 "마스터 셰프" 방식만이 이를 가능하게 합니다.

이것이 왜 중요한가 (논문에 따른 분석)

이 논문은 가장 큰 돌파구가 AI에게 새로운 도구를 주거나 AI를 더 똑똑하게 만든 것이 아니라고 주장합니다. 그것은 단순히 AI가 인간이 까다로운 공간 문제를 풀 때처럼, 루프(loop) 안에서 생각하고, 행동하고, 확인하고, 스스로 수정할 수 있도록 인터페이스를 변경한 것이었습니다.

이는 집을 짓기 위해서 더 좋은 망치가 필요한 것이 아니라, 건축가가 벽을 멈춰 서서 바라보고, 벽이 기울어진 것을 깨달은 뒤, 다음 단계로 넘어가기 전에 그것을 바로잡을 수 있게 해주는 것이 필요하다는 사실을 깨달은 것과 같습니다. SpatialClaw는 AI에게 멈추고, 확인하고, 수정할 수 있는 권한을 부여합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →