Do AI Models Perform Human-like Abstract Reasoning Across Modalities?
이 논문은 AI의 추상적 추론 능력을 오직 정확도만으로 평가하는 것이 오해의 소지가 있음을 입증하는데, 이는 모델이 표면적인 지름길에 의존하는 텍스트 기반 작업에서는 능력을 과대평가하는 반면, 모델이 의도된 추상 개념을 올바르게 적용하지 못하더라도 이를 파악하고 있는 시각적 작업에서는 능력을 과소평가하기 때문이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 학생에게 퍼즐을 내주는 선생님이라고 상상해 보세요. 이 퍼즐은 패턴이 어떻게 변하는지(예: "빨간 블록을 왼쪽으로 이동") 몇 가지 예시를 보여준 뒤, 학생에게 그와 동일한 규칙을 새로운, 보지 못한 그림에 적용하도록 요구합니다.
오랫동안 우리는 AI를 이 퍼즐들로 테스트하면서, AI가 최종 정답을 맞혔는지만 세는 "성적표"를 사용해 왔습니다. 만약 AI가 올바른 그림을 찾아내면 우리는 A+를 줍니다.
이 논문은 더 깊은 질문을 던집니다: AI가 실제로 '규칙'을 이해했을까요, 아니면 단순히 이상한 요령을 포착해서 운 좋게 맞힌 것일까요?
연구진이 발견한 내용을 아주 쉽게 설명해 드리겠습니다:
1. 테스트를 치르는 두 가지 방법
연구진은 최고 수준의 AI 모델들(OpenAI의 o3, Claude, Gemini 등)을 두 가지 방식으로 테스트했습니다:
- 텍스트 모드: 퍼즐을 숫자와 단어의 목록으로 입력했습니다 (예: "그리드 1에는 2,2 위치에 빨간 사각형이 있음...").
- 비주얼 모드: 인간이 보는 것처럼 퍼즐의 실제 이미지를 AI에게 보여주었습니다.
2. "텍스트"의 반전: 높은 점수, 얕은 이해도
AI가 텍스트 모드로 테스트를 치렀을 때, 성적은 놀라울 정도로 좋았습니다. 사실, 가장 뛰어난 AI인 o3는 평균적인 인간보다 더 높은 점수를 받았습니다.
하지만 여기 함정이 있습니다: 연구진은 AI에게 문제를 어떻게 풀었는지 설명해 보라고 요청했습니다.
- 인간은 보통 "위와 아래의 물체를 제거한다"와 같이 실제 개념을 사용하여 설명했습니다.
- AI는 제시된 특정 예시들에 대해서는 기술적으로는 맞지만, 전체적인 큰 그림은 놓친 설명을 자주 내놓았습니다.
비유: 수학 시험을 치르는 학생을 상상해 보세요. 선생님이 "2 + 2는 무엇인가?"라고 묻습니다. 학생은 "4"라고 답합니다. 선생님이 "어떻게 구했니?"라고 묻자, 학생은 "시계를 봤는데 시곗바늘이 4에 있어서 4라고 찍었어요"라고 답합니다.
답은 맞았지만, 그 추론 과정은 "지름길(요령)"이었습니다. AI는 끊임없이 이런 행동을 하고 있었습니다. AI는 '물체'라는 개념을 이해하기보다는 숫자에 나타난 우연한 패턴(예: "빨간색은 항상 숫자 3이니까, 숫자 3을 제거하자")을 포착하고 있었던 것입니다.
결론: 텍스트 모드에서 AI의 높은 점수는 그들의 실제 지능을 과대평가했습니다. AI는 추론을 잘한 것이 아니라, 잘 추측하는 데 능숙했을 뿐입니다.
3. "비주얼"의 반전: 낮은 점수, 숨겨진 천재성
연구진이 비주얼 모드(그림을 보여주는 방식)로 전환하자, AI의 점수는 폭락했습니다. AI는 인간보다 훨씬 더 자주 최종 정답을 틀렸습니다.
하지만 연구진은 AI의 설명을 다시 살펴보았습니다.
그들은 놀라운 사실을 발견했습니다. AI가 최종 그림을 틀렸을 때조차, 그들이 내놓은 규칙에 대한 설명은 종종 정확했다는 것입니다!
비유: 집을 짓는 방법을 완벽하게 설명할 수 있는("벽돌을 원형으로 배치하고 지붕을 얹으세요") 유능한 건축가를 상상해 보세요. 하지만 실제로 벽돌을 쌓으려고 하면, 손이 서툴러서 벽돌을 계속 떨어뜨리거나 엉뚱한 곳에 놓는 상황입니다.
비주얼 모드의 AI는 이 건축가와 같았습니다. AI는 추상적인 개념(즉, '규칙')은 완벽하게 이해했지만, 이미지를 충분히 명확하게 "인지"하여 규칙을 제대로 적용하는 데 어려움을 겪었습니다. 그리드의 크기가 정확히 얼마인지, 혹은 물체들이 어디에 있는지 제대로 파악하지 못한 것입니다.
결론: 비주얼 모드에서 AI의 낮은 점수는 그들의 실제 지능을 과소평가했습니다. AI는 논리는 이해하고 있었지만, "인지"하는 부분에서 실패한 것입니다.
4. "도구"의 효과
연구진은 AI에게 도움을 줄 수 있는 "계산기"(Python 코드)를 제공했습니다.
- 텍스트 모드: 계산기는 별로 도움이 되지 않았습니다. AI는 이미 논리는 좋았지만 지름길(요령)을 쓰는 데 특화되어 있었기 때문입니다.
- 비주얼 모드: 계산기는 큰 도움이 되었습니다. AI가 코드를 사용하여 이미지를 "보고" 픽셀을 셀 수 있게 되자, 점수가 올라갔습니다. 이는 AI가 논리적으로 "멍청한" 것이 아니라, 단지 그림을 보는 데 도움이 필요했을 뿐이라는 것을 증명했습니다.
핵심 요약
만약 당신이 최종 점수(A+)만 본다면, AI가 텍스트 모드에서는 천재이고 비주얼 모드에서는 실패작이라고 생각할 수도 있습니다.
하지만 그들이 어떻게 생각하는지를 들여다보면 다음과 같습니다:
- 텍้อม 모드: 현실 세계에서는 통하지 않는 교묘한 지름길(요령)을 써서 "속임수"를 쓰고 있는 경우가 많습니다.
- 비주얼 모드: 규칙은 이해하지만 실행이 서툰 "서툰" 천재들입니다.
이 논문은 AI가 진정으로 "인간과 유사해지고 있는지"를 알기 위해서는, 단순히 정답이 맞는지 확인하는 것만으로는 부족하다고 결론짓습니다. 우리는 반드시 그 추론 과정이 옳은지도 확인해야 합니다. 그렇지 않으면, 우리는 AI의 텍스트 기술을 과대평가하거나, 그들의 비주얼 잠재력을 과소평가하게 될 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.