← 최신 논문
💬 NLP

Tracing the ongoing emergence of human-like reasoning in Large Language Models

본 논문은 대규모 언어 모델이 의미론적 논리에서 높은 정확도를 보이지만, 인간이 문맥에 의존하는 의미를 조건문에 부여할 수 있게 하는 화용론적 추론을 일반적으로 재현하지 못함을 밝히며, 이는 모델 아키텍처나 훈련 방향과 관계없이 여전히 진화 중인 능력임을 보여줍니다.

원저자: Paolo Morosi, Nikoleta Pantelidou, Fritz Günther, Elena Pagliarini, Evelina Leivada

게시일 2026-05-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Paolo Morosi, Nikoleta Pantelidou, Fritz Günther, Elena Pagliarini, Evelina Leivada

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 인간의 대화를 이해하도록 가르친다고 상상해 보세요. 로봇이 단어의 정의를 아는 초고속 사전에 불과한지, 아니면 인간이 실제로 어떻게 말하고 생각하는지에 대한 '암묵적인 규칙'을 진정으로 배웠는지 알고 싶어 합니다.

이 논문은 인간과 유사한 추론에 대한 특정 시험에서 25 개의 서로 다른 AI 모델 (대형 언어 모델, LLM) 에 대한 성적표와 같습니다. 여기서는 간단한 비유를 사용하여 그들이 발견한 내용을 자세히 설명합니다.

시험: "만약" 게임

연구진은 "만약" 문장을 포함한 고전적인 논리 퍼즐을 사용했습니다. 인간의 대화에서 "만약" 문장은 상황에 따라 매우 다른 두 가지 의미를 가질 수 있습니다.

  1. 거래 (표준 조건문):
    • 예시: "네가 잔디를 깎으면, 내가 너에게 50 달러를 줄게."
    • 인간의 논리: 우리는 이를 엄격한 거래로 이해합니다. 잔디를 깎은 경우에만 돈을 받습니다. 잔디를 깎지 않으면 돈을 받지 못합니다. 우리는 숨겨진 규칙을 추가합니다: "잔디를 깎지 않으면 = 돈을 받지 못함."
  2. 주의 (비스킷 조건문):
    • 예시: "배고프다면 오븐에 피자가 있어."
    • 인간의 논리: 우리는 이를 도움이 되는 팁으로 이해합니다. 피자는 네가 배고픈지 여부와 상관없이 거기에 있습니다. "만약"은 피자가 존재하는 조건이 아니라, 네가 그것을 필요로 하는지 확인하는 방법일 뿐입니다.

도전 과제: 연구진은 인간과 AI 모델에게 까다로운 상황에서 문장의 두 번째 부분 (결과) 이 참인지 판단하도록 요청했습니다.

  • 상황: 당신은 잔디를 깎지 않았습니다. 돈을 받았나요? (인간은 거래 때문에 "아니오"라고 말합니다).
  • 상황: 당신은 배고프지 않습니다. 오븐에 피자가 있나요? (인간은 피자는 어쨌든 거기에 있으므로 "예"라고 말합니다).

결과: "문자 그대로" 대 "유연함"

이 연구는 인간과 AI 가 이러한 시험을 처리하는 방식 사이에 명확한 분열이 있음을 발견했습니다.

1. 인간은 "맥락 탐정"입니다
인간은 행간을 읽는 데 뛰어납니다. 우리는 잔디 깎기에 대한 약속은 엄격한 거래이지만, 피자에 대한 언급은 단지 도움이 되는 사실임을 압니다. 우리는 상황에 따라 자동으로 이해를 조정합니다.

2. AI 모델은 "문자 그대로의 로봇"입니다
AI 모델들은 일반적으로 인간 같은 탐정처럼 행동하지 못했습니다. 그들은 두 가지 주요 함정에 빠졌습니다.

  • 함정 A: "엄격한 회계사"
    일부 모델은 경직된 컴퓨터 프로그램처럼 행동했습니다. 그들은 "네가 잔디를 깎으면 내가 너에게 돈을 줄게"라는 문장을 보고 "좋아, 논리적으로 네가 깎지 않았다면, 조건이 충족되지 않았기 때문에 그 진술은 기술적으로 여전히 참이다"라고 말했습니다. 그들은 암시된 거래를 놓쳤습니다. 그들은 엄격한 논리에 너무 집중하여 인간의 의미를 무시했습니다.
  • 함정 B: "과도한 수정자"
    다른 모델들은 너무 똑똑해지려고 했습니다. 그들은 모든 "만약" 문장이 엄격한 거래라고 결정했습니다. 그래서 "배고프다면 오븐에 피자가 있어"라는 말을 들었을 때, "아, 그렇다면 배고프지 않다면 피자가 전혀 없다는 뜻이군"이라고 생각했습니다. 그들은 "잔디 깎기" 규칙을 피자 문장에 적용했는데, 이는 잘못되었습니다.

결론: AI 모델들은 "만약"의 사전적 정의 (논리) 를 아는 데는 뛰어나지만, 사회적 맥락 (화용론) 을 이해하는 데는 형편없습니다. 그들은 대본을 완벽하게 암기한 배우처럼 보이지만, 캐릭터의 감정을 이해하지 못합니다.

AI 의 "유형"이 중요했을까요?

연구진은 AI 의 "성격"이나 "구조"가 결과를 바꿀지 궁금해했습니다. 그들은 다음을 확인했습니다.

  • 오픈 소스 대 클로즈드 소스: 공개된 코드를 가진 모델 (오픈) 이 비밀스러운 모델 (클로즈드) 보다 더 잘했을까요? 아니요.
  • 전문화 대 일반화: "추론"을 위해 특별히 제작된 모델이 일반 채팅봇보다 더 잘했을까요? 아니요.
  • 아키텍처: 특정 내부 설계 (전문가 혼합, Mixture-of-Experts) 를 가진 모델이 표준 모델보다 더 잘했을까요? 아니요.

얼음 위를 더 잘 운전하는 차가 어느 브랜드인지 확인하기 위해 다양한 브랜드의 차를 테스트하는 것과 같았습니다. 놀랍게도 페라리인지 토요타인지 여부는 중요하지 않았습니다; 모두 같은 방식으로 미끄러졌습니다. 이러한 "암묵적인 규칙"을 이해하는 능력은 더 크거나 복잡한 모델이 되면 자동으로 생기는 것이 아니었습니다. 그것은 일부 모델이 우연히 가지고 있고 다른 모델은 그렇지 않은 특정, 등장하는 기술처럼 보였지만, 모델의 사양만 보고는 예측할 수 없었습니다.

"맥락 제거 편향"

저자들은 이 문제를 **"맥락 제거 편향 (Decontextualization Bias)"**이라고 부릅니다.

수업지에서는 수학 문제를 잘 풀지만, 친구와 저녁 식사 비용을 나누는 데 수학을 적용하라고 요청하면 실패하는 학생을 상상해 보세요. AI 는 수학 (논리) 을 아는 학생이지만, 그것을 실생활 (맥락) 에 적용하는 법을 배우지 못한 학생과 같습니다. AI 는 텍스트로 훈련되었지만 실제로 실생활에 살아있지 않기 때문에, 때로는 "만약"이 거래를 의미하고 때로는 "그런데"를 의미한다는 것을 이해하는 데 어려움을 겪습니다.

요약

  • 인간은 자연스럽게 엄격한 논리와 사회적 맥락 사이를 전환합니다.
  • AI는 하나의 경직된 규칙 (항상 엄격하거나 항상 느슨함) 에 머무르는 경향이 있으며 뉘앙스를 놓칩니다.
  • 원인: 모델의 크기나 오픈 소스인지 여부가 아닙니다. AI 는 현재 약속과 조언의 차이를 이해하는 데 도움이 되는 "실제 세계 기반"이 부족합니다.

이 논문은 AI 가 논리에는 점점 더 나아지고 있지만, 분위기를 읽고 암시된 의미를 이해하는 "인간 같은" 능력은 여전히 진행 중인 작업이라고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →