← 최신 논문
🤖 machine learning

From Pixels to BFS: High Maze Accuracy Does Not Imply Visual Planning

이 논문은 다중 모달 모델이 미로 해결에서 높은 정확도를 보이지만, 이는 진정한 시각적 계획이 아닌 이미지-그리드 변환과 토큰 수준의 탐색 (BFS) 을 통한 결과임을 \textsc{MazeBench} 벤치마크를 통해 입증합니다.

원저자: Alberto G. Rodriguez Salgado

게시일 2026-03-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Alberto G. Rodriguez Salgado

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"AI 가 미로를 잘 풀면, 정말로 지능이 있는 걸까?"**라는 아주 흥미로운 질문에서 시작합니다.

저자는 최신 AI 모델들이 미로 찾기 문제를 얼마나 잘 해결하는지 테스트했지만, 놀라운 사실을 발견했습니다. **"성적표 (정답률) 가 좋다고 해서, 인간처럼 생각하는 건 아니다"**라는 것이죠.

이 복잡한 내용을 일상적인 비유로 쉽게 설명해 드릴게요.


🕵️‍♂️ 핵심 비유: "지도 그리기 vs 눈으로 찾기"

상상해 보세요. 거대한 미로가 있고, 당신은 그곳에서 보물을 찾아야 합니다.

  • 인간의 방식: 미로 그림을 한 번 쓱 보자마자, 눈으로 길을 따라가며 "여기는 막혔네, 저기로 가자"라고 직관적으로 길을 찾습니다. 몇 초면 끝납니다.
  • AI 의 방식 (이 논문에서 발견한 것): AI 는 그림을 보자마자, **"일단 이 그림을 종이에 글자로 옮겨 적어야겠다"**라고 생각합니다.
    1. 그림 속 벽과 길을 하나하나 읽어와서 텍스트로 된 표 (그리드) 를 만듭니다.
    2. 그 텍스트 표를 보고, "왼쪽으로 가자, 아! 벽이네. 다시 돌아서 위로 가자"라고 글자 하나하나를 세어가며 모든 가능한 길을 하나하나 시도해 봅니다.
    3. 결국 정답을 찾지만, 이 과정이 **엄청나게 많은 말 (토큰)**을 필요로 합니다.

📊 주요 발견 3 가지

1. "정답을 맞췄지만, 비효율적인 방법" (고득점의 함정)

가장 똑똑해 보이는 AI(예: GPT-5.4) 는 미로 100 개 중 91 개를 맞췄습니다. 하지만 그 비결은 '지혜'가 아니라 **'무작위 시전 (Brute-force)'**이었습니다.

  • 비유: 시험 문제를 풀 때, 문제를 이해해서 풀지 않고 모든 보기를 하나하나 지워가며 정답을 찾아내는 학생과 같습니다. 정답은 맞지만, 시간이 너무 오래 걸리고 지칩니다.
  • 이 AI 들은 미로가 너무 크면 (20x20), "말할 수 있는 분량 (토큰) 이 다 떨어졌어!"라고 포기하고 틀린 답을 내놓습니다. 인간은 큰 미로도 눈으로 한 번에 훑어보는데 말입니다.

2. "눈이 나쁘면, 아무리 똑똑해도 소용없다" (클로드 모델의 사례)

클로드 (Claude) 라는 AI 모델은 미로를 풀 때 그림을 텍스트로 바꾸는 과정에서 실수를 많이 했습니다.

  • 비유: 미로 지도를 읽는 사람이 "벽의 위치를 잘못 보고, 지도를 엉뚱하게 그려서" 길을 찾다가 헤매는 상황입니다.
  • 실험: 연구자들은 AI 에게 그림 대신 이미 정확한 텍스트 지도를 주었습니다. 그랬더니, 그 AI 의 실적이 6% 에서 **80%**로 폭풍상승했습니다.
  • 결론: 이 AI 의 '두뇌 (추론 능력)'는 나쁘지 않았는데, '눈 (이미지 인식)'이 나빠서 지도를 잘못 읽은 것이었습니다.

3. "크기가 크다고 똑똑한 건 아니다"

AI 모델의 크기가 아무리 커도 (Opus 같은 거대 모델), 미로 찾기 능력은 작은 모델 (Haiku) 과 비슷했습니다.

  • 비유: 키가 2 미터인 거인이라고 해서 미로를 빨리 찾지는 못합니다. 거인도 여전히 "글자로 된 지도를 하나하나 읽어가며" 헤매고 있었습니다. 모델이 크다고 해서 '공간 감각'이 저절로 생기는 것은 아닙니다.

💡 이 연구가 우리에게 주는 교훈

이 논문은 우리에게 중요한 경고를 보냅니다.

"AI 가 어떤 문제를 잘 푼다고 해서, 우리가 생각하는 것처럼 '이해'하고 있는 건 아닙니다."

AI 는 우리가 원하는 정답을 내기 위해, 인간과는 완전히 다른 (그리고 훨씬 비싼) 방법을 쓰고 있을 뿐입니다. 마치 정답을 맞히기 위해 모든 단어를 다 써보는 기계처럼요.

한 줄 요약:

AI 가 미로를 잘 풀었다는 건, 그림을 텍스트로 바꿔서 글자 수를 다 써가며 정답을 찾아낸 것일 뿐, 인간처럼 눈으로 길을 보고 직관적으로 해결한 게 아닙니다.

이 연구는 앞으로 AI 를 평가할 때, 단순히 "정답을 맞췄나?"만 보는 게 아니라, **"어떻게, 얼마나 효율적으로 풀었나?"**를 봐야 한다고 말합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →