← 최신 논문
🤖 AI

Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models

이 논문은 시각-언어 모델이 관찰되지 않은 공간적 구성을 외재화함으로써 공간 추론 능력을 향상시킬 수 있도록 하는 중간 지각 표현인 상상적 지각 토큰(Imaginative Perception Tokens, IPT)을 소개하며, 이를 통해 관점 취하기, 경로 추적, 다각도 계수와 같은 작업에서 텍스트 기반의 사고 사슬(chain-of-thought) 방식보다 뛰어난 성능을 입증한다.

원저자: Mahtab Bigverdi, Lindsey Li, Weikai Huang, Yiming Liu, Jaemin Cho, Jieyu Zhang, Tuhin Kundu, Chris Dangjoo Kim, Zelun Luo, Linda Shapiro, Ranjay Krishna

게시일 2026-06-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mahtab Bigverdi, Lindsey Li, Weikai Huang, Yiming Liu, Jaemin Cho, Jieyu Zhang, Tuhin Kundu, Chris Dangjoo Kim, Zelun Luo, Linda Shapiro, Ranjay Krishna

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: AI에게 보이지 않는 것을 "상상"하도록 가르치기

비디오 게임을 하고 있다고 상상해 보세요. 당신은 방 안에 서서 문을 바라보고 있습니다. 게임이 당신에게 묻습니다. "만약 저 문을 지나 왼쪽으로 돌면, 당신의 오른쪽에는 무엇이 보일까요?"

현재의 AI 모델(시각-언어 모델)은 자신의 "눈" 바로 앞에 있는 것을 묘사하는 데는 매우 뛰어납니다. 하지만 이 질문에는 어려움을 겪습니다. 왜냐하면 정답이 지금 보고 있는 사진 속에 들어있지 않기 때문입니다. AI는 아직 보지 못한 새로운 장면을 머릿속으로 시뮬레이션해야 합니다.

이 논문은 이러한 "공간 추론" 퍼즐을 해결하기 위해, AI가 인간처럼 퍼즐의 빠진 조각들을 상상하는 법을 배워야 한다고 주장합니다. 저자들은 이 새로운 도구를 **상상적 지각 토큰(Imaginative Perception Tokens, IPTs)**이라고 부릅니다.

문제점: AI는 "만약 ~라면?"에 약하다

현재의 AI를 모든 책의 내용을 완벽하게 설명할 수 있는 아주 똑똑한 사서라고 생각해 보세요. 하지만 만약 당신이 *"만약 우리가 책장을 뒷벽으로 옮긴다면 도서관 모습이 어떻게 바뀔까요?"*라고 묻는다면, 그 사서는 막히게 됩니다. 사서는 현재 눈에 보이는 것만을 설명할 수 있기 때문입니다.

이를 해결하려는 이전의 시도들은 AI에게 자신의 생각을 글로 쓰도록 요청하는 방식(예: '생각의 사슬', Chain of Thought)이었습니다. 저자들은 AI에게 3D 회전이나 숨겨진 경로를 언어로 설명하도록 강요하는 것이, 복잡한 춤 동작을 오직 문자 메시지로만 설명하려고 애쓰는 것과 같다는 것을 발견했습니다. 이는 투박하고 혼란스러우며, 종종 실수를 유발합니다.

해결책: "정신적 스케치북"

저자들은 **상상적 지각 토큰(IPTs)**을 도입했습니다. AI에게 새로운 시점의 모습을 긴 글로 묘사하라고 요구하는 대신, 자신이 무엇을 볼 것인지에 대한 빠른 스케치를 그리도록 가르치는 것입니다.

  • 비유: 당신이 건축가라고 상상해 보세요. 새로운 벽이 잘 맞는지 확인하기 위해 단순히 말로 설명하는 것이 아니라, 새로운 배치의 청사진을 빠르게 그립니다.
  • 작동 원原理: AI는 실제로 보지 못한 시점을 나타내는 중간 이미지(스케치)를 생성하도록 훈련받습니다.
    • 예시: 질문이 복도를 따라 걷는 것에 관한 것이라면, AI는 지도와 시작/끝 사진만 가지고 있음에도 불구하고 복도 중간에서 보이는 모습인 "측면도" 스케치를 그립니다.
    • 예시: 만약 세 가지 각도에서 찍은 어지러운 방 안의 의자 개수를 세는 문제라면, AI는 중복 계산 없이 모든 의자를 확인하기 위해 "조감도(위에서 내려다본 지도)"를 그립니다.

AI가 이 "정신적 스케치"를 한 번 그리고 나면, 그 그림을 보고 최종 질문에 답하게 됩니다.

세 가지 "상상력 훈련소" 과제

연구진은 AI가 상상하는 연습을 할 수 있도록 세 가지 구체적인 훈련 게임(데이터셋)을 만들었습니다.

  1. 관점 파악 ( "텔레포트" 게임):

    • 설정: 한 각도에서 본 방의 모습이 보입니다.
    • 과제: "당신이 표시된 지점으로 텔레포트하여 90도 회전한다면, 소파는 당신의 왼쪽에 있습니까, 오른쪽에 있습니까?"
    • 상상: AI는 정답을 맞히기 위해 그 새로운 지점에서의 방 모습을 사진으로 생성해야 합니다.
  2. 경로 추적 ( "눈 감고 걷기" 게임):

    • 설정: 경로가 표시된 탑다운(Top-down) 지도와 시작 및 끝 지점의 사진이 있습니다.
    • 과제: "이 경로를 따라 걷는 동안, 중간 지점에서 당신의 왼쪽에 있는 물체는 무엇입니까?"
    • 상상: AI는 한 번도 본 적 없는 경로의 중간 지점에 대한 "1인칭 시점 뷰"를 생성해야 합니다.
  3. 다각도 카운팅 ( "퍼즐" 게임):

    • 설정: 서로 다른 구석에서 찍은 방의 사진 세 장을 보여줍니다.
    • 과제: "이 방에는 총 몇 개의 의자가 있습니까?" (어떤 의자는 한 사진에서는 보이지만 다른 사진에서는 가려져 있을 수 있습니다.)
    • 상상: AI는 정확한 계산을 위해 세 가지 뷰를 하나의 완전한 그림으로 결합한 단일 "조감도"를 생성해야 합니다.

연구 결과

연구진은 이러한 "정신적 스케치"를 교육 도구로 사용하여 강력한 AI 모델인 BAGEL을 훈련시켰습니다. 결과는 다음과 같습니다.

  • 그리기가 글쓰기보다 낫다: AI가 스케치를 그려서 "생각"하도록 했을 때(IPT), 글로 "생각"하도록 했을 때(Text Chain-of-Thought)보다 공간 관련 질문에 훨씬 더 잘 답했습니다. 사실, 글쓰기는 3D 공간을 설명하기에 부적절한 방식이기 때문에 때로는 AI의 성능을 오히려 떨어뜨리기도 했습니다.
  • 훈련의 마법: 나중에 AI를 테스트할 때 스케치를 그리는 기능 없이(정답만 말하도록) 테스트했음에도 불구하고, AI는 여전히 더 높은 성능을 보였습니다. 이는 훈련 중에 "그리기"를 연습하는 과정이 AI의 뇌 속에 더 강력한 내부 지도를 구축했음을 시사합니다.
  • 최고의 모델을 넘어서: 일부 과제에서 이 방식은 보통 이러한 벤치마크를 독점하는 매우 비싸고 폐쇄적인 모델(예: GPT-5)과 경쟁할 수 있는 수준까지 오픈 소스 모델을 끌어올렸습니다.

결론

이 논문은 AI가 공간과 내비게이션을 이해하게 하려면 단순히 말로 "더 깊이 생각하라"고 요구해서는 안 된다는 것을 보여줍니다. 대신, 보이지 않는 것을 시각화하도록 가르쳐야 합니다. AI에게 "정신적 스케치북"을 주어 새로운 관점을 상상하는 연습을 하게 함으로써, 우리는 AI가 3D 세계를 이해하는 능력을 강화하고, 이전에는 불가능했던 퍼즐들을 풀 수 있게 도와줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →