← 최신 논문
🤖 AI

Human-Level Reasoning: A Comparative Study of Large Language Models on Logical and Abstract Reasoning

이 연구는 8개의 맞춤 설계된 질문을 사용하여 9개의 저명한 거대 언어 모델의 논리적 및 추상적 추론 능력을 인간의 수행 능력과 비교 및 평가하며, 모델들의 연역적 능력에서 나타나는 상당한 격차를 밝혀낸다.

원저자: Benjamin Grando Moreira

게시일 2026-06-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Benjamin Grando Moreira

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신의 방 안에 믿기지 않을 정도로 재능 있는 사서들이 가득 차 있습니다. 이 사서들(대규모 언어 모델, 즉 LLM)은 세상의 거의 모든 책을 읽었습니다. 그들은 사실을 암송하고, 시를 쓰고, 누구보다 빠르게 언어를 번역할 수 있습니다. 하지만 이 논문이 던지는 질문은 이것입니다: 그들이 읽고 있는 내용을 실제로 '이해'하고 있는 것일까요, 아니면 그저 문장에서 다음에 올 단어를 아주 잘 추측하고 있는 것뿐일까요?

이 사실을 알아내기 위해 저자인 벤자민 그란도 모레이라(Benjamin Grando Moreira)는 "로직 체육관(logic gym)"을 세우고, 15명의 디지털 사서들을 한 그룹의 인간 학생 및 교수진과 경쟁하도록 초대했습니다.

다음은 일상적인 비유를 사용한 이 실험의 간단한 요약입니다.

테스트: 퀴즈가 아닌 퍼즐 상자

연구자는 모델들에게 "첫 번째 대통령은 누구인가요?"(기억력을 통해 답할 수 있는 질문)라고 묻는 대신, 8개의 까다로운 퍼즐을 주었습니다. 이 퍼즐들은 단순한 사실 회상이 아니라, 숨겨진 규칙을 찾아내야 하는 수수께끼와 같았습니다.

이렇게 생각하면 쉽습니다:

  • 인간의 뇌는 단서를 찾고, 점들을 연결하며, "아하! 패턴이 보이네!"라고 말하는 탐정과 같습니다.
  • AI의 뇌는 "이 단어를 전에 본 적이 있으니, 보통 뒤에 오는 단어를 바탕으로 다음 단어를 예측하자"라고 말하는 초고속 패턴 매칭 기계와 같습니다.

8가지 도전 과제 ("장애물 코스")

논문은 다음과 같은 내용으로 모델들을 테스트했습니다:

  1. 요일 수수께끼: 만약 "SUN + 1 = MON"이라면, "TUE + 2"는 무엇일까요? (대부분의 모델이 맞혔지만, 일부는 약어 때문에 혼란을 겪었습니다.)
  2. 코끼리 노래: 코끼리의 숫자가 홀수인지 짝수인지에 따라 "bother"라는 단어를 말하는 횟수가 변하는 우스꽝스러운 패턴입니다. 인간은 패턴을 쉽게 파악했지만, 많은 AI는 반복되는 문구 때문에 막혔습니다.
  3. 비밀 코드: 단순한 알파벳 이동(예: A가 B가 됨). 대부분의 모델이 이를 풀어냈지만, 일부는 대소문자 표기를 틀렸습니다.
  4. 함정 수학 문제: "3 + 3 x 5는 무엇인가?" 정답은 18입니다. 하지만 테스트에서는 16, 20, 30, 45와 같은 선택지를 제시했습니다. 18은 선택지에 없었습니다!
    • 반전: 많은 모델(그리고 일부 인간도)이 혼란스러워했습니다. 그들은 수학 계산은 맞았지만 선택지가 틀렸다는 것을 보고도, "잠깐, 이 중에 맞는 게 없는데?"라고 말하는 대신 그냥 가장 가까운 오답을 골랐습니다.
  5. 달(Month)의 미스터리: 이것은 가장 어려운 문제였습니다. "May"라는 달에 대한 숨겨진 코드를 찾는 문제였습니다. 코드는 달의 숫자(5의 제곱 = 25)와 "May"라는 단어의 글자 수(4글자)를 구한 뒤, 두 숫자를 붙여서 254를 만드는 것이었습니다.
    • 결과: 인간은 이 문제를 어느 정도 해냈지만, AI는 대부분 실패했습니다. AI들은 단순히 "숫자를 붙이는" 트릭을 보기보다는, 맞지 않는 복잡한 수학 공식을 적용하려고 애썼습니다.
  6. 언어 전환: 포르투갈어 달의 약어를 스페인어 이름과 매칭하는 것입니다. 스페인어를 모르는 인간은 어려워했지만, 다양한 언어를 아는 AI들은 이 문제를 완벽히 해냈습니다.
  7. 이중 언어의 날: 영어와 포르투갈어 요일이 섞여 있고, 언제 언어를 바꿀지에 대한 숨겨진 규칙이 있는 문제입니다. 인간과 AI 모두 까다로워했습니다.
  8. 이진법 코드: 10진수처럼 보이는 숫자(예: 1000)를 더하는 문제입니다. 가장 똑똑한 모델들만이 "잠깐, 이것들은 일반적인 숫자가 아니야!"라고 깨닫고 이진법(base-2)으로 풀어냈습니다.

점수판: 누가 이겼나?

연구자는 다음과 같이 점수를 부여했습니다:

  • 10점: 정답을 맞힌 경우.
  • 5점: 최종 숫자는 틀렸더라도 논리는 맞힌 경우.
  • 0점: 틀리거나 포기한 경우.

결과:

  • 인간: 교수진(전문가)이 특히 까다로운 퍼즐에서 가장 좋은 성적을 거두며 전반적으로 가장 우수했습니다. 학생들은 잘 해냈지만 추상적인 수수께끼에서는 더 어려움을 겪었습니다.
  • AI: 평균적으로 AI는 100점 만점에 약 73점을 기록했고, 인간은 약 70점을 기록했습니다.
    • 잠깐, AI가 이긴 건가요? 네, 근소하게 앞섰습니다! 하지만 여기에는 함정이 있습니다. AI는 쉬운 문제(다른 언어로 된 달 이름 맞히기 등)에는 매우 뛰어났지만, 이상하고 추상적인 문제(코끼리 노래나 숨겨진 숫자 코드 등)에는 매우 형편없었습니다.
    • GPT-4o나 Claude 같은 최고의 AI 모델들은 거의 완벽한 점수를 받았지만, Sabiá 3와 같은 약한 모델들은 매우 낮은 점수를 받았습니다.

핵심 결론

이 논문은 이 AI 모델들이 천재적인 앵무새와 같다고 결론짓습니다. 그들은 인간의 대화를 흉내 내고 표준적인 문제를 완벽하게 해결할 수 있습니다. 하지만 질문이 함정이거나 규칙이 특이하거나, 혹은 상자 밖에서 생각해야 할 때, 그들은 자주 비틀거립니다.

  • 인간은 새로운 규칙을 즉석에서 파악하는 "유동적 지능(fluid intelligence)"에 더 강합니다.
  • AI는 이미 암기한 방대한 데이터를 사용하는 "결정적 지능(crystallized intelligence)"에 더 강합니다.

이 연구는 AI가 대화하는 능력은 무서울 정도로 좋아졌지만, 여부전히 인간처럼 생각하는 법, 특히 게임의 규칙이 숨겨져 있거나 특이할 때의 사고 방식은 아직 완전히 마스터하지 못했음을 보여줍니다. AI는 여전히 논리의 이면을 진정으로 이해하기보다는, 이전에 보았던 것을 바탕으로 추측하고 있을 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →