← 최신 논문
🤖 AI

The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space

본 논문은 현재 멀티모달 대형 언어 모델의 '카르테시안 단축키' 취약점을 드러내기 위해 시각 추론 작업을 극좌표로 재구성한 벤치마크인 Polaris-Bench 를 소개하며, 이러한 모델들이 표준 격자 기반 벤치마크에서 높은 성능을 보이는 것은 견고하고 위상 불변인 시각적 이해가 아니라 텍스트 좌표 패턴을 악용한 데서 비롯됨을 밝힙니다.

원저자: Xia Hu, Zhenrui Yue, Brian Potetz, Howard Zhou, Leonidas Guibas, Chun-Ta Lu, Zhicheng Wang

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xia Hu, Zhenrui Yue, Brian Potetz, Howard Zhou, Leonidas Guibas, Chun-Ta Lu, Zhicheng Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "데카르트식 단축키: 극좌표 공간에서의 비전 추론 재평가"라는 논문에 대한 설명을 쉬운 일상 언어와 비유로 번역한 것입니다.

핵심 아이디어: AI 모델은 실제로 "보고" 있는 걸까, 아니면 단순히 "읽고" 있는 걸까?

수학 시험을 치른다고 상상해 보세요. 한 버전에서는 숫자들이 깔끔한 사각형 격자 (스프레드시트처럼) 로 배열되어 있고, 다른 버전에서는 숫자들이 피자의 조각처럼 원형으로 배열되어 있습니다.

구글 딥마인드와 스탠퍼드 대학교의 연구원들은 전 세계 최고의 AI 비전 모델들이 사각형 격자를 위한 트릭을 암기한 학생들처럼 행동하지만, 실제로는 수학을 이해하지 못한다는 사실을 발견했습니다. 시험을 피자 모양으로 바꾸자 그들은 처참하게 실패했습니다.

연구원들은 이 트릭을 "데카르트식 단축키 (Cartesian Shortcut)"라고 부릅니다.

"데카르트식 단축키" 설명

대부분의 AI 를 위한 시각적 추론 테스트는 "데카르트 좌표"를 사용합니다. 이는 단순히 "행과 열" (체스판이나 스프레드시트처럼) 을 의미하는 화려한 표현일 뿐입니다.

  • 1 행, 2 열.
  • 3 행, 5 열.

이 논문은 AI 모델들이 이러한 사각형 격자를 볼 때 실제로 이미지를 "보는" 것이 아니라, 대신 자신의 "뇌" (연쇄 사고 과정) 에서 이미지를 텍스트 좌표 목록으로 빠르게 변환한다는 사실을 발견했습니다. 그들은 시각적 형태를 보지 않고 인간이 지도를 읽듯이 텍스트 논리를 사용하여 문제를 해결하기 시작합니다.

비유:
사각형 격자에서 시험을 치르는 AI 를 생각해 보세요. 마치 미로를 해결하기 위해 *"3 단계 아래로 내려가, 오른쪽으로 돌아, 2 단계 가라"*는 지시 목록을 읽는 사람과 같습니다. 그들은 미로를 시각화하는 것이 아니라 텍스트 지시사항을 따르고 있을 뿐입니다.

실험: "피자" 테스트

AI 가 이 텍스트 트릭을 사용하여 속이고 있음을 증명하기 위해 연구원들은 "폴라리스 벤치 (Polari s-Bench)"라는 새로운 벤치마크를 만들었습니다.

그들은 53 가지 다른 시각 퍼즐 (수도, 미로, 패턴 매칭 등) 을 사각형 격자에서 "극좌표" 형태로 변환했습니다.

  • 극좌표는 다트판이나 피자처럼 생겼습니다. "행과 열" 대신 "링" (중심으로부터의 거리) 과 "조각" (각도) 을 사용합니다.

결과:

  • 사각형 격자 (데카르트) 에서: 최상위 AI 모델들은 놀라운 점수 (70%~83%) 를 기록했습니다. 그들은 천재처럼 보였습니다.
  • 피자 격자 (극좌표) 에서: 점수는 무너졌습니다. 동일한 모델들의 점수가 31%~39% 로 떨어졌습니다.

숫자가 스프레드시트에 있을 때 수학 시험을 완벽하게 통과한 학생이, 숫자가 원형으로 쓰여진 똑같은 수학 시험을 갑자기 실패한 것과 같습니다.

왜 이런 일이 일어났을까요?

연구원들은 AI 모델들이 실패한 이유가 피자 모양이 "더 어렵기" 때문이 아니라고 주장합니다. 퍼즐의 논리는 정확히 동일합니다. 그들이 실패한 이유는 다음과 같습니다.

  1. 그들은 격자에 의존합니다: 모델들은 문제를 해결하기 위해 사각형 이미지를 (행 1, 열 2 와 같은) 텍스트 목록으로 변환하는 법을 배웠습니다.
  2. 원형에서는 같은 일을 할 수 없습니다: 이미지가 원형일 때, AI 는 그것을 간단한 "행/열" 텍스트 목록으로 쉽게 변환할 수 없습니다. "단축키"가 고장 난 것입니다.
  3. 그들은 위상수학을 "볼" 수 없습니다: 모델들은 "위상 불변 추론"이 부족합니다. 이는 사각형 격자와 원형 격자가 동일한 지도를 그리는 두 가지 다른 방식일 뿐이라는 것을 이해하지 못한다는 화려한 표현입니다. 그들은 격자의 특정 모양에 갇혀 있습니다.

간단한 용어로 정리한 주요 발견 사항

  • "텍스트" 지팡이: AI 모델들은 시각적 문제를 해결하기 위해 텍스트 기반 추론을 크게 의존했습니다. 시각적 레이아웃이 텍스트 목록에 맞지 않는 형태로 바뀌자 모델들은 길을 잃었습니다.
  • 생각하는 것이 도움이 되지 않음: 연구원들이 AI 에게 "더 깊이 생각하라" (고추론 모드 사용) 고 말했음에도 불구하고 문제가 해결되지 않았습니다. AI 는 실제로 이미지를 이해하는 대신 잘못된 것 (격자 구조) 에 대해 더 많이 생각했을 뿐입니다.
  • 보편적인 문제: 이는 특정 AI 의 문제만이 아니었습니다. 구글, 오픈AI, 앤스로픽 등 14 가지 최첨단 모델을 테스트한 결과, 모두 동일한 트릭에 속았습니다.
  • "미로" 예외: 논문은 흥미로운 한 가지 예외를 지적했습니다. 미로 안에 방 번호 (1 번 방, 2 번 방 등) 가 적혀 있다면, AI 는 원형 버전에서도 잘 수행합니다. 왜냐하면 숫자들이 새로운 "텍스트 단축키" 역할을 하기 때문입니다. AI 는 모양을 무시하고 숫자만 따릅니다. 하지만 미로에 숫자가 없으면 AI 는 실패합니다.

결론

이 논문은 현재의 AI 모델들이 우리가 생각했던 것처럼 시각적 추론에 능숙하지 않다고 결론 내립니다. 표준 테스트에서 높은 점수를 받은 것은 그러한 테스트가 사각형 격자를 사용하기 때문에 발생한 착시 현상입니다. 모델들은 시각적 세계를 진정으로 이해하기보다는 격자 구조를 악용하여 속이고 있습니다.

진정으로 똑똑한 AI 를 구축하려면 사각형 격자에서 테스트하는 것을 멈추고, 실제로 "보고" 추론하게 하되 단순히 좌표를 읽게 하는 것이 아니라 모양을 강제하는 테스트를 시작해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →