← 최신 논문
💬 NLP

Recursive numeral systems are highly regular and easy to process

이 논문은 최소 기술 길이(MDL) 프레임워크를 통해 규칙성과 처리 복잡성을 통합하는 것이 재귀적 수 체계의 구조를 더 잘 설명하며, 이전의 효율성 기반 모델들이 임의로 부과해야 했던 제약 조건들을 자연스럽게 설명해 준다고 주장한다.

원저자: Ponrawee Prasertsom, Andrea Silvi, Jennifer Culbertson, Moa Johansson, Devdatt Dubhashi, Kenny Smith

게시일 2026-02-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ponrawee Prasertsom, Andrea Silvi, Jennifer Culbertson, Moa Johansson, Devdatt Dubhashi, Kenny Smith

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 숫자를 세는 데 있어 궁극의 사용 설명서를 설계하려고 한다고 상상해 보십시오. 이 설명서는 주머니에 들어갈 정도로 충분히 짧아야 하지만(효율성), 동시에 누구나 당신이 의도한 숫자가 무엇인지 정확히 이해할 수 있을 만큼 명확해야 합니다(정보성).

오랫동안 언어학자들은 인간의 언어가 왜 지금과 같은 방식으로 숫자를 세는지에 대한 비결이 단순히 필요한 단어의 수(어휘 크기)와 문장의 길이(복잡성) 사이의 균형에 있다고 생각했습니다. 그들은 언어가 이 두 가지 사이의 "최적의 지점"을 찾기 위해 진화했다고 믿었습니다.

하지만 이 새로운 논문은 기존의 관점이 중요한 요소 하나를 놓치고 있다고 주장합니다. 바로 **규칙성(Regularity)**입니다.

다음은 이들의 논거를 쉬운 비유를 사용하여 정리한 내용입니다.

1. "레고" 대 "마법 상자"

인간의 언어(예: 영어 또는 중국어)를 레고 블록이라고 생각해 보십시오.

  • 당신에게는 작은 기본 블록들(1, 2, 3... 10)이 있습니다.
  • 그리고 이 블록들을 결합하는 몇 가지 규칙(더하기, 곱하기)이 있습니다.
  • 숫자 43을 만들기 위해, 당신은 "4" 블록, "10" 블록, 그리고 "3" 블록을 서로 끼워 맞추기만 하면 됩니다. 이는 예측 가능한 패턴입니다.

이제, 이전의 수학적 모델들이 그만큼 훌륭하다고 제안했던 "이론적으로 최적화된" 시스템을 상상해 보십시오. 이 시스템은 마법 상자와 같습니다.

  • 숫자 18에 대해, 상자는 "10 + 8"이라고 말합니다.
  • 숫자 19에 대해, 상자는 "25 - 7"이라고 말합니다.
  • 숫자 20에 대해, 상자는 "5 × 4"라고 말합니다.
  • 숫자 21에 대해, 상자는 "3 × 7"이라고 말합니다.

수학적으로 이 마법 상자는 레고 시스템보다 더 적은 총 단어 수나 더 짧은 평균 문장 길이를 사용할 수 있습니다. 하지만 이 시스템은 혼란스럽습니다. 패턴이 없습니다. 숫자 21을 안다고 해서 숫자 22를 어떻게 말해야 할지 예측할 수 없습니다. 당신은 모든 숫자를 각각의 독특하고 기묘한 코드로 일일이 암기해야만 합니다.

저자들은 마법 상자가 겉보기에는 효율적으로 보일지 몰라도, 규칙성이 결여되어 있기 때문에 실패한다고 주장합니다. 인간은 마법 상자를 싫어합니다. 배우기도 어렵고 처리하기도 어렵기 때문입니다.

2. 새로운 측정 기준: "압축성(Compressibility)"

연구진은 컴퓨터 과학에서 사용하는 **최소 기술 길이(Minimum Description Length, MDL)**라는 개념을 사용했습니다. 이것을 **압축 파일(zip file)**이라고 생각해 보십시오.

  • 규칙적인 시스템(레고와 같은 경우)은 압축률이 매우 높습니다. 당신은 아주 작은 규칙 책을 쓸 수 있습니다: "10~99 사이의 숫자를 만들려면, 한 자릿수를 가져와 10을 곱하고 다른 한 자릿수를 더하라." 이 "압축 파일"은 매우 작습니다.
  • 불규칙한 시스템(마법 상자와 같은 경우)은 압축할 수 없습니다. 패턴을 이용할 수 없기 때문에 모든 숫자를 개별적으로 나열해야 합니다. 이 "압축 파일"은 매우 거대합니다.

이 논문은 자연 언어가 단순히 짧기 때문이 아니라, 매우 압축 가능하기 때문에 "최적"이라고 주장합니다. 즉, 우리 뇌가 "압축"(저장)하고 "압축 해제"(처리)하기 쉽다는 것입니다.

3. 이론 검증

저자들은 대규모 시뮬레이션을 실행했습니다.

  • 그들은 128개의 실제 인간 언어(영어, 중국어, 프랑스어 등)를 가져왔습니다.
  • 그리고 10,000개의 무작위 인공 언어(이전의 수학 모델들이 "완벽하다"고 했던 마법 상자 유형을 포함하여)를 생성했습니다.

결과:
인간의 언어는 인공 언어보다 일관되게 더 규칙적이었으며 처리하기 쉬웠습니다. 심지어 인공 언어에 인간의 언어와 동일한 구성 요소(숫자 및 곱셈 규칙)를 강제로 부여했을 때도, 인간의 시스템이 승리했습니다. 인간의 시스템은 그 구성 요소들을 더 예측 가능한 패턴으로 조직하는 데 훨씬 뛰어났습니다.

4. "가중치" 문제

이전 연구들은 작은 숫자(1, 2, 3)를 큰 숫자(90, 99)보다 훨씬 더 자주 사용한다고 가정했기에, 계산 시 작은 숫자에 많은 "가중치"를 부여했습니다. 그들은 "작은 숫자에만 집중한다면 마법 상자도 괜찮다"라고 생각했습니다.

저자들은 모든 숫자를 동일하게 취급하는 방식("균등 사전 확률", uniform prior)으로 규칙을 바꾸어 이 이론을 테스트했습니다.

  • 놀라운 사실: 모든 숫자의 가치가 동일할 때조차, 인간의 언어는 인공 언어보다 훨씬 더 효율적이고 규칙적인 모습을 보였습니다.
  • 결론: "마법 상자" 시스템이 효율적으로 보였던 이유는 수학이 크고 복잡한 숫자들을 무시했기 때문입니다. 전체 그림을 살펴보면, 구조를 갖춘 인간의 언어가 명백한 승자입니다.

핵심 요약

이 논문은 규칙성이 언어 진화의 근본적인 압력이라고 결론짓습니다. 그것은 단순히 공간을 절약하거나 정보를 전달하는 것의 문제가 아닙니다. 우리의 뇌가 수백만 개의 무작위 코드를 암기하지 않아도 되도록, 규칙을 따르는 시스템을 만드는 것에 관한 문제입니다.

자연 언어는 단순히 "효율적"인 것이 아니라 예측 가능합니다. 그것은 마치 모든 책의 위치를 일일이 외워야 하는 혼란스러운 책더미가 아니라, 단순한 체계를 따라 원하는 책을 찾을 수 있는 잘 정리된 도서관와 같습니다. 이러한 예측 가능성이 바로 언어를 배우기 쉽고, 사용하기 쉽게 만들며, 언어가 지금과 같은 모습으로 존재하게 만드는 원동력입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →