← 최신 논문
💬 NLP

Presupposition and Reasoning in Conditionals: A Theory-Based Study of Humans and LLMs

본 연구는 대규모 언어 모델이 조건문 내 전제 투영에서 인간 평가와 때때로 일치할 수 있지만, 그 성능은 진정한 화용론적 추론이 아닌 표면적 패턴 매칭에서 비롯되는 경우가 많음을 밝혀 통계적 정합성과 진정한 언어 능력 사이의 괴리를 드러낸다.

원저자: Tara Azin, Yongan Yu, Raj Singh, Olessia Jouravlev

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tara Azin, Yongan Yu, Raj Singh, Olessia Jouravlev

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 간단한 언어와 창의적인 비유를 사용하여 설명합니다.

핵심 아이디어: "만약-그러면" 퍼즐

친구와 논리 게임을 한다고 상상해 보세요. 당신이 말합니다: "존이 스쿠버 다이버라면, 그는 웨트슈트를 가져올 것이다."

친구가 묻습니다: "존이 실제로 웨트슈트를 가지고 있나요?"

  • 사람의 답변: 대부분의 사람들은 "아직은 아닐 것이다. 그가 다이빙을 한다면 웨트슈트를 가질 뿐이다"라고 말합니다. 웨트슈트는 조건에 묶여 있습니다.
  • 다른 사람의 답변: 이제 당신이 말합니다: "존이 런던으로 비행기를 탄다면, 그의 여동생이 그를 마중할 것이다."
  • 사람의 답변: 여기서 사람들은 "그래, 존은 확실히 여동생이 있다"고 말합니다. 여동생이 있다는 사실은 비행 여부에 의존하지 않습니다. 그것은 존에 관한 사실일 뿐입니다.

이 차이는 **"보류 문제 (Proviso Problem)"**라고 불립니다. 이는 숨겨진 사실 (전제) 이 항상 참인지, 아니면 "만약" 부분이 발생할 때만 참인지 우리가 어떻게 결정하는지에 관한 언어학의 까다로운 퍼즐입니다.

실험: 인간 vs 인공지능

연구자들은 챗봇 (지금 당신과 대화하는 것) 의 두뇌 역할을 하는 대규모 언어 모델 (LLM) 이 인간과 같은 방식으로 이 퍼즐을 해결할 수 있는지 확인하고자 했습니다.

그들은 두 그룹을 대상으로 한 "맛보기 테스트"를 설정했습니다:

  1. 120 명의 인간: 실제 사람들이 문장을 읽고 숨겨진 사실이 참일 확률을 0 에서 7 사이의 척도로 평가했습니다.
  2. 4 개의 AI 모델: GPT-5, Gemini, Llama, Qwen 과 같은 다양한 AI 버전들이 정확히 같은 작업을 수행했습니다.

그들은 두 가지 방식으로 AI 를 테스트했습니다:

  • "그냥" 테스트: 문장만 제공 (예: "존이 다이버라면...").
  • "맥락" 테스트: 문장에 약간의 배경 정보 추가 (예: "존은 오타와 출신이다. 존이 다이버라면...").

결과: "가짜" AI

그들이 발견한 바를 간단한 비유로 정리해 보면 다음과 같습니다:

1. 인간은 직관적인 탐정입니다

인간은 이 분야에서 뛰어납니다. 그들은 논리와 상식을 섞습니다. "만약" 부분이 숨겨진 사실을 더 그럴듯하게 만든다면 (다이버가 웨트슈트가 필요하다는 점처럼), 그들은 점수를 낮춥니다. "만약" 부분이 사실과 무관하다면 (런던 비행과 여동생 존재처럼), 점수를 높게 유지합니다. 그들은 문장의 두 부분이 서로 얼마나 관련이 있는지에 민감합니다.

2. AI 는 답변을 "모방"하지만, 추론은 하지 않습니다

이 부분이 가장 놀랍습니다.

  • 작은 AI (Qwen): 이 모델은 인간과 매우 유사한 답변을 내놓았습니다. 인간이 "7"이라고 하면 AI 는 "6.8"이라고 답했습니다. 훌륭한 모방자였습니다.
  • 큰 AI (GPT-5, Gemini): 이 모델들은 인간과 덜 유사한 답변을 내놓았습니다. 그들은 종종 너무 높거나 너무 낮았으며, 인간이 보인 미묘한 변화를 놓쳤습니다.

반전: 연구자들이 AI 들에게 왜 그런 답변을 했는지 설명해 달라고 요청했을 때 (학생에게 수학 풀이 과정을 보여달라고 하는 것처럼), 이상한 패턴이 나타났습니다:

  • **가장 인간다운 답변을 낸 작은 AI (Qwen)**는 실제로 추론 능력이 형편없었습니다. 논리를 제대로 설명할 수 없었습니다. 그것은 마치 의미도 모르고 자주 듣는 문구를 반복하는 앵무새처럼, 학습 데이터에서 본 패턴을 기반으로 단순히 추측했을 뿐입니다.
  • **인간다운 답변이 더 나빴던 큰 AI (GPT-5)**는 실제로 추론 능력이 더 좋았습니다. 논리 규칙을 잘 설명할 수 있었지만, 최종 숫자에 관해서는 인간과 비교해 틀렸습니다.

"체크리스트" 비유

이를 파악하기 위해 연구자들은 체크리스트를 가진 "심판 AI" (판정자) 를 사용했습니다. 마치 선생님이 학생의 에세이를 채점한다고 상상해 보세요.

  • 체크리스트: "트리거를 식별했는가? 맥락이 중요한지 확인했는가? 논리를 설명했는가?"
  • 결과: "큰 AI"는 체크리스트를 통과했습니다 (좋은 에세이를 썼습니다). "작은 AI"는 체크리스트에 실패했습니다 (에세이가 엉망이었습니다).
  • 패러독스: "작은 AI"가 논리 테스트에 실패했음에도 불구하고, 최종 점수는 인간 평균에 더 가까웠습니다.

결론: 패턴 매칭 vs 이해

이 논문은 AI 모델이 인간처럼 언어를 실제로 "이해"하지 않는다고 결론 내립니다.

  • 인간은 사실의 진위를 결정할 때 논리, 세계 지식, 관련성을 섞어 사용합니다.
  • AI표면적인 패턴 매칭을 수행하는 것으로 보입니다. "존이 다이버라면"과 "웨트슈트"라는 단어를 보고, 학습 데이터에서 이 두 단어가 자주 함께 등장함을 보아 숫자를 추측합니다. 웨트슈트가 다이빙에 조건부라는 것을 진정으로 "알고" 있는 것은 아닙니다.

교훈: AI 가 (답안지를 외운 학생처럼) 옳아 보이는 답변을 준다고 해서, 그것이 그 수업을 이해한다는 뜻은 아닙니다. 사실, 가장 "인간다운" 답변을 낸 AI 가 실제로는 진정한 논리에 가장 덜 의존하고 있었습니다.

이 논문이 말하지 않는 것

  • AI 가 무용하다는 말은 하지 않습니다.
  • AI 가 결코 언어를 이해하지 못할 것이라고 말하지 않습니다.
  • 이를 의료 진단이나 법적 조언에 사용하라고 권하지 않습니다.
  • 단순히 이렇게 말합니다: 지금 당장, 이 특정 유형의 까다로운 논리 퍼즐에 관해서는 AI 가 스스로 생각하는 것보다 더 잘 속이고 있으며, 가장 "똑똑해 보이는" 답변이 가장 피상적일 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →