← 최신 논문
💬 NLP

Measuring Form and Function in Language Models

본 논문은 영어 관사의 형식적 구문 및 기능적 담화 속성을 정량적으로 평가하기 위한 문맥적 대안 선택 (CAC) 지표를 제시하며, 일부 매우 대규모 모델이 두 가지 벤치마크 모두에서 인간 아동의 수행 수준과 일치할 수는 있으나, 현재 비교 가능한 데이터로 훈련된 어떤 모델도 이를 동시에 달성하지는 못한다는 사실을 밝혀냈다.

원저자: Héctor Javier Vázquez Martínez, Charles Yang

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Héctor Javier Vázquez Martínez, Charles Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간처럼 말하도록 로봇을 가르치려 한다고 상상해 보세요. 그것이 제대로 작동하는지 확인하는 두 가지 방법이 있습니다:

  1. 문법 테스트: "Cat the" 대신 "The cat"이라고 말하나요? (올바른 형태)
  2. 대화 테스트: 상대방이 방금 한 말에 따라 "The cat"과 "A cat" 중 언제 어떤 것을 말해야 하는지 알고 있나요? (올바른 기능)

이 논문은 실제 아이들이 말을 배우는 방식을 살펴봄으로써 언어 모델 (LLM) 을 평가하는 더 나은 테스트를 개발하는 것에 관한 것입니다. 펜실베이니아 대학교의 연구자들인 저자들은 우리가 인공지능을 너무 문법 퀴즈처럼 평가하고, 실제 대화처럼 평가하는 것은 부족하다고 주장합니다.

다음은 그들의 연구를 간단한 비유로 정리한 내용입니다:

1. 문제: "객관식" 함정

오늘날 대부분의 인공지능 테스트는 객관식 시험과 같습니다. 인공지능에게 두 문장을 보여주고,

  • "The dog barked."
  • "Dog the barked."
    이 중 어느 것이 맞는지 물어봅니다.

인공지능은 보통 이를 맞춥니다. 하지만 저자들은 이는 아이에게 개 그림과 고양이 그림 중 하나를 가리키게 하는 것과 같다고 말합니다. 이는 아이가 실제 이야기 속에서 그 단어를 어떻게 사용하는지 이해하는지 증명하지 못합니다. 실제 아이들은 객관식 시험을 치르지 않고, 그냥 대화합니다. 인공지능이 인간처럼 "배우고" 있는지 진정으로 알기 위해서는, 실제 대화의 복잡하고 오가는 흐름을 어떻게 처리하는지 살펴봐야 합니다.

2. 새로운 도구: "문맥적 대안 선택" (CAC)

저자들은 CAC라고 불리는 인공지능을 평가하는 새로운 방법을 고안했습니다. 빈칸 채우기 게임과 비슷하지만, 약간의 twist 가 있습니다.

  • 준비: 2 세 아이와 대화하는 어머니의 실제 녹음 자료를 사용합니다.
  • 게임: 아이가 사용한 단어 (보통 "the"나 "a" 같은 작은 단어) 를 숨기고 인공지능에게 묻습니다: "방금 어머니가 한 말을 고려할 때, 여기에 어떤 단어가 들어가야 하나요?"
  • 목표: 단순히 인공지능이 올바른 단어를 고르는 것을 원하는 것이 아닙니다. 인공지능의 선택 패턴이 아이의 패턴과 일치하는지 보고자 합니다.

3. 두 가지 벤치마크 (점수판)

저자들은 인공지능이 인간 아이처럼 행동하는지 확인하기 위해 두 가지 구체적인 점수판을 만들었습니다.

점수판 A: "섞고 맞추기" 테스트 (형식적 생산성)

  • 개념: 똑똑한 아이는 "the"와 "a"가 거의 어떤 명사와도 결합할 수 있다는 것을 압니다. 그들은 단순히 "the dog"와 "a cat"을 외우는 것이 아니라, 규칙을 알고 있습니다.
  • 테스트: 연구자들은 인공지능이 "the"와 "a"와 함께 얼마나 많은 다른 명사를 사용하는지 살펴봅니다. 인공지능이 외운 특정 단어들과만 "the"를 사용한다면 실패입니다. 다양한 단어들과 자유롭게 섞어 사용한다면 통과입니다.
  • 결과: 많은 인공지능 모델이 이 테스트를 통과했습니다. 그들은 "섞고 맞추기" 규칙을 학습했습니다.

점수판 B: "대화 흐름" 테스트 (담화 기능)

  • 개념: 이것이 어려운 부분입니다. 실제 대화에서 어머니가 "저기 the 개를 봐"라고 말하면, 아이는 보통 "The 개는 크네"라고 답합니다. 하지만 어머니가 "나 a 개를 봤어"라고 말하면, 아이는 "A 개가 뛰고 있네"라고 말할 수 있습니다.
    • 때로는 같은 단어를 유지합니다 ("the" -> "the").
    • 때로는 바꿉니다 ("a" -> "the").
    • 이 전환은 이야기의 문맥에 전적으로 달려 있습니다.
  • 테스트: 연구자들은 인공지능이 단어를 전환하는 빈도와 실제 인간이 단어를 전환하는 빈도를 비교하여 측정했습니다.
  • 결과: 대부분의 인공지능이 여기서 실패했습니다. 심지어 크고 똑똑한 모델들도 동전 던지기처럼 단어를 무작위로 전환하는 경향이 있었습니다. 그들은 단어 뒤에 숨은 이야기를 이해하지 못한 것 같습니다. 문법은 알았지만, 대화의 사회적 규칙은 알지 못했습니다.

4. 큰 놀라움

저자들은 45 개의 서로 다른 인공지능 모델을 테스트했습니다.

  • "작은" 모델: 2 세 아이와 비슷한 양의 데이터 (1000 만~2000 만 단어) 로 훈련된 모델들은 일반적으로 두 가지 테스트 모두에서 실패했습니다. 아직 충분히 배우지 못했습니다.
  • "큰" 모델: 수십억 개의 단어 (전체 인터넷 규모와 비슷) 로 훈련된 거대 모델들은 훨씬 더 잘했습니다.
    • 두 개의 모델이 두 가지 테스트 모두를 통과했습니다. 문법과 대화 흐름 모두에서 인간처럼 들렸습니다.
    • 한 개의 모델은 대화 테스트는 통과했지만 문법 테스트는 실패했습니다.
    • 많은 다른 모델들은 문법 테스트는 통과했지만 대화 테스트는 실패했습니다.

5. 교훈

이 논문은 크기가 중요하지만, 전부는 아니다라고 결론 내립니다.

인공지능이 문법 퀴즈를 맞출 수 있다고 해서 인간처럼 언어를 이해한다는 뜻은 아닙니다. 단순히 패턴을 외우고 있을 뿐일 수 있습니다. 진정한 인간 학습의 "인지 모델"이 되려면, 인공지능은 우리가 이야기하는 내용에 따라 왜 특정 단어를 선택하는지 이해함을 보여주는 "대화 흐름" 테스트를 통과해야 합니다.

현재, 가장 거대한 모델들만이 인간과 같은 이해를 보이기 시작하고 있지만, 그들조차 아직 일관성이 없습니다. 저자들은 우리가 더 나은 인공지능을 만들고자 한다면, 시험을 치르는 학생처럼 대하는 것을 멈추고 대화하는 유아처럼 대해야 한다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →