← 최신 논문
🤖 AI

A criterion for Artificial General Intelligence: hypothetic-deductive reasoning, tested on ChatGPT

이 논문은 가설-연역적 추론을 인공일반지능의 근본적인 기준으로 제안하며, 테스트를 통해 챗GPT와 같은 현재의 모델들이 복잡한 맥락에서 이러한 유형의 추론에 대해 제한된 능력만을 보유하고 있음을 입증한다.

원저자: Louis Vervoort, Vitaliy Mizyakov, Anastasia Ugleva

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Louis Vervoort, Vitaliy Mizyakov, Anastasia Ugleva

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 질문: AI는 정말로 "생각"하고 있는가?

도서관의 모든 책을 다 읽은 학생이 있다고 상상해 보세요. 그 학생은 사실을 암송하고, 수학 문제를 풀며, 믿기지 않을 정도로 똑똑해 보이는 에세이를 쓸 수 있습니다. 하지만 여러분이 "그걸 어떻게 알아냈니?" 또는 "왜 그런 현상이 일어나니?"라고 묻는다면, 그 학생은 머뭇거릴지도 모릅니다. 단어의 패턴을 보고 추측하여 정답을 맞힐 수는 있겠지만, 정답 뒤에 숨겨진 실제 '규칙'을 이해하고 있는 것은 아닐 수도 있기 때문입니다.

이 논문은 다음과 같은 질문을 던집니다. ChatGPT는 정말로 "생각"하는 것일까요, 아니면 그저 매우 뛰어난 추측기(guesser)에 불과한 것일까요?

저자인 루이 베르보르트(Louis Vervoort)와 그의 팀은, 진정한 "생각하는 기계"(인공 일반 지능, AGI라고 불리는)로 간로 인정받기 위해서는 AI가 **가설-연역적 추론(Hypothetic-Deductive Reasoning)**이라는 특정 기술을 숙달해야 한다고 주장합니다.

두 가지 핵심 기술

이 논문은 "사고(thinking)"를 두 가지 주요 능력으로 나눕니다.

1. 인과 관계 추론 (도미노 테스트)

  • 정의: 첫 번째 도미노를 밀면 마지막 도미노가 쓰러진다는 것을 이해하는 것입니다. 무엇이 무엇을 일으키는지(원인과 결과)를 아는 것입니다.
  • 논문의 테스트: 연구진은 "뉴런 다이어그램"(복잡한 도미노 흐름도와 같은 형태)을 사용했습니다. 그들은 AI에게 물었습니다. "만약 내가 이 레버를 당기면, 어떤 다른 레버들이 움직이고 어떤 것들은 움직이지 않을까?"
  • 결과: AI는 단순한 연결 구조에서는 괜찮은 모습을 보였지만, 도미노가 복잡하게 얽히거나(어떤 레버가 다른 레버를 막는 경우 등) 하면 혼란을 겪었습니다. AI는 종종 근본 원인을 놓치거나 순서를 틀리곤 했습니다. 이는 마치 '원인'이라는 단어는 알지만, 어지러운 방 안에서 떨어지는 도미노의 경로를 실제로 추적하지 못하는 사람과 같았습니다.

2. 가설-연역적 추론 (레시피 테스트)

  • 정의: 이것은 "과학자" 방식의 사고법입니다. 여기에는 두 단계가 포함됩니다.
    1. 가설 설정: 문제에 적합한 규칙집(이론)을 선택합니다.
    2. 연역: 그 규칙집의 단계들을 따라가며 답을 얻습니다.
  • 논문의 테스트: 연구진은 AI에게 물리 및 논리 퍼즐을 제시했습니다 (예: "만약 얼음으로 만들어진 큐브가 섞여 있는 큐브 줄을 밀면, 방이 뜨거워질 때 어떤 일이 벌어질까?").
  • 비밀 병기: 연구진은 단순히 정답만을 요구하지 않았습니다. 그들은 AI에게 그 답을 얻기 위해 사용한 규칙(가설)들을 나열하라고 요청했습니다.
    • 비유: 요리사에게 "이 수프를 어떻게 만드셨나요?"라고 묻는다고 상상해 보세요. 만약 요리사가 "그냥 이것저것 넣었어요"라고 답한다면, 그들은 운이 좋았던 것일 뿐입니다. 하지만 "소금이 뜨거운 물에 녹는다는 규칙과 양파가 당근보다 빨리 익는다는 규칙을 사용했어요"라고 답한다면, 그들은 실제로 생각하고 있는 것입니다.

ChatGPT를 테스트했을 때 어떤 일이 일어났나?

연구진은 구 버전(ChatGPT-3.5)과 더 똑똑해진 신 버전(ChatGPT-4)을 모두 테스트했습니다.

  • "정답은 맞지만, 이유는 틀린" 문제:
    ChatGPT-4는 퍼즐에 대해 정확한 답을 내놓는 경우가 많았습니다. 매우 인상적이었습니다! 하지만 사용된 규칙들을 나열하라고 요청했을 때, AI는 자주 이야기를 지어내곤 했습니다.

    • 예시: 한 테스트에서 AI는 물 양동이가 쏟아질 것이라고 정확히 예측했습니다. 하지만 그런지에 대해 묻자, 실제 물리 상황과는 아무런 관련이 없는 "절연 셔츠(insulating shirts)"라는 가짜 규칙을 만들어냈습니다.
    • 메타포: 이는 수학 문제를 맞혔지만, 풀이 과정을 보여달라고 하면 즉석에서 지어낸 공식을 써 내려가는 학생과 같습니다.
  • 결론:
    이 논문은 ChatGPT가 인간의 대화를 흉내 내고 간단한 문제를 해결하는 데는 놀라운 능력을 갖추고 있지만, 현재로서는 진정한 이해가 결여되어 있다고 결론짓습니다.

    • 그것은 "하늘은 파랗다"라고 완벽하게 말할 수 있지만, 왜 하늘이 파란지 혹은 "파랗다"는 것이 물리적으로 무엇을 의미하는지 이해하지 못하는 앵무새와 같습니다.
    • 문제가 약간만 복잡해져도(여러 아이디어가 결합될 때), AI는 실패하기 시작했습니다. AI는 올바른 규칙을 올바른 답과 일관되게 연결하지 못했습니다.

"AGI"의 기준

저자들은 무엇이 "인공 일반 지능(AGI)"에 해당하는지에 대해 높은 기준을 설정했습니다. 그들은 AI가 다음을 수행할 수 있을 때까지는 진정으로 "생각하는 것"이 아니라고 주장합니다.

  1. 문제를 해결한다.
  2. 문제를 해결하기 위해 사용한 규칙과 이론을 명시적으로 나열한다.
  3. 이를 단 하나의 문제가 아니라, 다양한 유형의 문제들에 걸쳐 일관되게 수행한다.

결론:
현재 ChatGPT는 뛰어난 즉흥 연기자입니다. 똑똑해 보이게끔 "임기응변"을 발휘할 수 있습니다. 하지만 아직 세상이 어떻게 돌아가는지에 대한 깊은 논리적 지도를 가지고 있다는 것을 증명하지 못했습니다. 진정한 "생각하는 기계"가 되기 위해서, AI는 단순히 다음 단어를 추측하는 것을 넘어, 실제 규칙을 사용하여 왜 그 단어가 정답인지 단계별로 증명해 내야 합니다.

AI가 이러한 "규칙 나열" 테스트를 일관되게 통과하기 전까지, 이 논문은 AI가 아직 진정한 AGI가 아니라고 말합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →