← 최신 논문
💬 NLP

Blackbird Language Matrices: A Framework to Investigate the Linguistic Competence of Language Models

이 논문은 지능 검사에서 영감을 받아 개발된 '블랙버드 언어 행렬 (BLM)' 과제를 소개하며, 이를 통해 대규모 언어 모델이 문법적 객체를 인식하고 체계적인 패턴을 활용하는지, 그리고 언어적 오류와 추론 오류가 어떻게 상호작용하는지 등 언어 모델의 언어 능력을 다각도로 규명할 수 있음을 보여줍니다.

원저자: Paola Merlo, Chunyang Jiang, Giuseppe Samo, Vivi Nastase

게시일 2026-02-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Paola Merlo, Chunyang Jiang, Giuseppe Samo, Vivi Nastase

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 핵심 비유: "지능 검사 (IQ Test) 의 언어 버전"

이 연구의 핵심 아이디어는 고전적인 **레이븐의 점진적 행렬 (Raven's Progressive Matrices)**이라는 지능 검사에서 영감을 받았습니다.

  • 기존 지능 검사: 그림이 3x3 격자에 있고, 마지막 칸이 비어있습니다. "이 그림의 규칙 (예: 빨간 점이 시계 방향으로 이동함) 을 찾아서 빈칸에 들어갈 그림을 고르세요"라는 문제입니다.
  • 이 연구의 BLM: 그림 대신 문장을 사용합니다. "이 문장들의 규칙 (예: 주어와 동사의 단복수 일치, 혹은 동사의 의미 변화 규칙) 을 찾아서 빈칸에 들어갈 올바른 문장을 고르세요"라는 문제입니다.

왜 중요한가요?
기존 AI 평가는 "이 문장이 자연스러운가?" (예: "고양이가 소파를 탔다" vs "고양이가 소파를 먹었다") 처럼 단순한 맞/틀을 묻는 경우가 많았습니다. 하지만 BLM 은 복잡한 논리 퍼즐입니다. AI 가 단순히 문장을 외웠는지, 아니면 문장 사이의 숨겨진 **규칙 (논리)**을 찾아내서 새로운 상황에 적용할 수 있는지 테스트하는 것입니다.

2. 실험 내용: AI 는 어떻게 문제를 풀까?

연구진은 AI 에게 다양한 언어 (영어, 프랑스어, 이탈리아어 등) 로 된 이 퍼즐을 풀게 했습니다. 문제는 크게 두 가지 유형으로 나뉩니다.

A. "스프레이/로드 (Spray/Load)" 퍼즐 (동사의 변신)

  • 상황: "화분을 흙으로 채우다"와 "흙을 화분에 채우다"는 같은 의미지만 문장 구조가 다릅니다.
  • 질문: AI 는 이 두 문장이 사실은 같은 사건을 설명한다는 규칙을 깨닫고, 새로운 동사 (예: '칠하다') 에도 똑같이 적용할 수 있을까요?
  • 결과: AI 는 문법적으로 맞는 문장은 만들 수 있었지만, 규칙을 완전히 이해해서 새로운 상황에 적용하는 데는 여전히 약점이 있었습니다. 마치 레고 블록을 조립하는 법은 알지만, 새로운 디자인을 창조하는 데는 서툰 아이 같습니다.

B. "주어 - 동사 일치 (Agreement)" 퍼즐 (긴장감 있는 문장)

  • 상황: "컴퓨터 (단수) 와 프로그램 (복수) 은 고장 났다" vs "컴퓨터 (단수) 와 프로그램들 (복수) 은 고장 났다".
  • 질문: 문장 중간에 긴 설명이 끼어 있어도, AI 는 **가장 먼 곳에 있는 주어 (컴퓨터)**와 동사가 단수/복수를 맞춰야 한다는 규칙을 기억할 수 있을까요?
  • 결과: AI 는 대부분의 경우 정답을 맞췄지만, 규칙을 단순히 '이웃한 단어'끼리 맞추는 습관 (국소적 패턴) 에 의존하는 경향이 있었습니다.

3. 연구의 발견: AI 의 '내면'을 들여다보다

연구진은 AI 가 정답을 맞출 때, 그 내부에서 어떤 일이 일어나는지 분석했습니다.

  • 문장 조각 (Chunks) 인식: AI 가 문장을 단어 단위로만 보는 게 아니라, "주어 덩어리", "동사 덩어리"처럼 의미 있는 블록으로 인식하고 있다는 것을 발견했습니다.
  • 규칙의 부재: 하지만 이 블록들을 어떻게 연결해야 하는지 논리적 규칙을 완벽하게 이해하지는 못했습니다. AI 는 "이런 패턴은 A, 저런 패턴은 B"라고 암기하는 데는 능숙하지만, "왜 A 가 B 가 되는지"라는 이유를 추론하는 데는 아직 인간처럼 유연하지 못합니다.

4. 결론: AI 는 '유창한 모방자'일 뿐일까?

이 논문의 결론은 다음과 같습니다.

"대형 언어 모델 (LLM) 은 놀라울 정도로 유창하게 말을 하지만, 그 이면에는 인간처럼 언어의 구조와 규칙을 추상화하고 일반화하는 능력이 아직 부족합니다. 그들은 거대한 데이터베이스에서 패턴을 찾아내는 '천재 모방자'이지만, 새로운 퍼즐을 풀기 위해 규칙을 스스로 만들어내는 '창조적인 문제 해결사'가 되려면 더 많은 연구가 필요합니다."

한 줄 요약:
이 연구는 AI 에게 **"단순히 문장을 외우는 게 아니라, 언어의 숨겨진 규칙을 찾아내는 퍼즐"**을 풀게 함으로써, AI 가 진짜로 언어를 이해하는지, 아니면 그저 통계적 확률로 답을 맞추고 있는지 확인하는 정교한 지능 검사를 개발했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →