← 최신 논문
💬 NLP

Evaluating Pragmatic Reasoning in Large Language Models: Evidence from Scalar Diversity

본 연구는 스칼라 다양성을 통해 평가된 대규모 언어 모델의 화용론적 추론이 안정적인 역량이 아니라 내부 확률적 표현과 작업 유도 프롬프팅 행동 간의 가변적 상호작용임을 보여주며, 이는 모델 능력 해석에 평가 설계의 결정적 영향을 강조한다.

원저자: Ye-eun Cho

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ye-eun Cho

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 로봇 친구가 인간의 대화를 진정으로 이해하는지, 아니면 올바른 질문을 받을 때만 잘 따라 하는지 파악하려고 상상해 보세요. 이는 바로 Ye-eun Cho 의 논문 "대규모 언어 모델의 화용론적 추론 평가"가 다루는 내용입니다.

이 연구의 이야기를 간단한 용어와 유용한 비유로 풀어보겠습니다.

핵심 질문: 로봇은 똑똑한가, 아니면 연기만 잘하는가?

대규모 언어 모델 (LLM) 은 인터넷에 있는 거의 모든 것을 읽은 매우 잘 읽은 학생과 같습니다. 문법과 사실에 대해서는 뛰어납니다. 하지만 사람들이 말하는 것의 숨겨진 의미를 이해할 수 있을까요?

인간 대화에서 우리는 종종 "어떤 쿠키들이 먹혔다"라고 말합니다. 우리는 단순히 "적어도 하나"를 의미하는 것이 아니라, 보통 "전부는 아니다"를 암시합니다. 이를 **스칼라 함축 (scalar implicature)**이라고 합니다. 이는 미묘한 사회적 규칙입니다: 내가 "어떤 (some)"이라고 말한다면, "전부 (all)"라고 말하지 않은 것은 "전부"가 사실이 아니기 때문이라는 것을 암시하는 것입니다.

연구자들이 던진 핵심 질문은 다음과 같습니다: 이러한 AI 모델들은 실제로 이 숨겨진 의미를 "이해"하는 것일까, 아니면 우리가 정중하게 질문할 때만 이해하는 척하는 것일까?

로봇을 테스트하는 두 가지 방법

이를 답하기 위해 연구자들은 모델을 테스트하는 두 가지 다른 방식을 사용했는데, 이는 학생의 지식을 테스트하는 두 가지 다른 방식과 비슷합니다:

  1. "내면의 직관 점검" (직접 확률):
    로봇에게 소리 내어 말하지 않고 문장의 다음 단어를 예측하도록 요청한다고 상상해 보세요. 로봇이 실제로 무엇을 가장 가능성 있다고 생각하는지 확인하기 위해 그 내부의 수학을 살펴봅니다.

    • 비유: 이는 시험을 치르는 동안 학생의 뇌파를 살펴보는 것과 같습니다. 이는 그들이 대답하기 전에 본능적으로 무엇을 알고 있는지를 보여줍니다.
  2. "구두 시험" (메타언어적 프롬핑):
    이는 로봇에게 직접 묻는 것입니다: "내가 '어떤 쿠키들이 먹혔다'라고 한다면, 이는 '모든 쿠키가 먹히지 않았다'는 뜻인가? 예 또는 아니오로 답해 주세요."

    • 비유: 이는 학생에게 손을 들어 소리로 설명하도록 요청하는 것과 같습니다. 이는 그들이 무엇을 알고 있다고 말하는지를 보여주며, 이는 질문 방식의 영향을 받을 수 있습니다.

실험: 60 가지 다른 "어떤 (some)"의 메뉴

연구자들은 한 문장만 테스트하지 않았습니다. 그들은 (some/all, warm/hot, good/excellent 와 같은) 60 가지 다른 단어 쌍의 "메뉴"를 사용했습니다.

  • 일부 쌍은 인간이 추론하기 쉽습니다 (예: 'some'은 'not all'을 함축함).
  • 일부 쌍은 더 어렵거나 약합니다 (예: 'warm'은 항상 'not hot'을 함축하지는 않음).
    이러한 다양성을 **스칼라 다양성 (Scalar Diversity)**이라고 합니다. 이는 요리사가 스테이크를 얼마나 잘 요리하는지뿐만 아니라, 섬세한 허브부터 단단한 뿌리까지 60 가지 다른 재료를 어떻게 다루는지 테스트하는 것과 같습니다.

발견한 것: 반전

결과는 놀라웠으며, 이러한 모델들이 얼마나 똑똑한지에 대한 단일한 "진실"은 없다는 것을 보여주었습니다.

1. "내면의 직관 점검"과 "구두 시험"이 불일치함
종종 로봇의 내부 수학 (직관 점검) 과 구두 답변 (구두 시험) 은 완전히 다른 이야기를 했습니다.

  • 때로는 로봇의 내부 수학이 "나는 이것을 잘 이해하지 못한다"고 말했지만, 정중하게 질문받으면 "네, 이해합니다!"라고 말했습니다.
  • 다른 때는 내부 수학이 자신감 있었지만, 구두 답변은 혼란스러웠습니다.
  • 교훈: 로봇이 "유능한지" 알기 위해 한 가지 방법만 보면 안 됩니다. 이는 머릿속에서는 답을 알고 있지만 말하라고 하면 얼어붙는 학생, 혹은 그 반대의 경우와 같습니다.

2. "연기"는 대본에 달려 있음
연구자들이 질문하는 방식이 매우 중요했습니다.

  • 간단한 질문을 하면 로봇은 "아니오"라고 말할 수 있습니다.
  • "당신은 도움이 되는 조수입니다, 알려주세요..."와 같은 정중한 인사를 추가하면 로봇은 갑자기 "네"라고 말할 수 있습니다.
  • 교훈: 로봇의 "성적"은 대본에 따라 변합니다. 로봇이 무언가를 새로 배운 것은 아니며, 단지 질문의 스타일에 반응하는 것입니다.

3. 다른 로봇, 다른 성격
이 연구는 Flan-T5 와 Qwen 의 두 가지 다른 유형의 AI 모델을 테스트했습니다.

  • Flan-T5는 조금 더 일관성이 있었습니다. 그 내부 수학과 구두 답변은 서로 더 가까웠습니다.
  • Qwen은 매우 극적이었습니다. 그 내부 수학은 종종 매우 낮았습니다 (답을 "알고" 있는 것처럼 보이지 않음), 하지만 직접 질문받으면 거의 연기하듯 완벽한 답변을 주었습니다.
  • 교훈: 하나의 AI 모델이 똑똑하게 행동한다고 해서 모든 AI 모델이 같은 방식으로 작동하는 것은 아닙니다.

4. "비교" 트릭
연구자들이 로봇에게 두 가지 옵션을 나란히 비교하도록 요청했을 때 ("어떤 것이 더 나은가: A 또는 B?"), 로봇은 단일 문장만 판단하도록 요청받았을 때보다 훨씬 더 잘 수행했습니다.

  • 교훈: 로봇은 처음부터 답을 생성해야 할 때보다 선택을 할 때 올바른 답을 고르는 것이 더 쉽습니다.

최종 판결

이 논문은 "이 AI 는 화용론적 추론을 한다"거나 "이 AI 는 그렇지 않다"고 말할 수 없다고 결론지었습니다.

대신, AI 의 화용론적 추론은 두 명의 파트너가 추는 춤과 같습니다:

  1. 로봇의 내부 지식 (실제로 배운 것).
  2. 우리가 질문하는 방식 (프롬프트).

춤 파트너 (프롬프트) 나 음악 (작업) 을 바꾸면 춤도 변합니다. 로봇은 인간적인 의미에서 반드시 "거짓말"을 하거나 "알고" 있는 것이 아니라, 단지 처한 특정 상황에 반응할 뿐입니다.

간단히 말해: AI 가 인간의 뉘앙스를 이해하는지 이해하려면, 단순히 한 가지 질문을 하고 그 답변을 있는 그대로 받아들이면 안 됩니다. 다양한 상황에서 어떻게 행동하는지 살펴봐야 합니다. 왜냐하면 그 "유능함"은 고정된 특성이 아니라, 그것이 아는 것과 당신이 어떻게 질문하는지의 혼합물이기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →