Entropy of Ukrainian
본 논문은 184 명의 자원자를 대상으로 클로드 섀넌의 1951 년 문자 예측 실험을 재현하여 우크라이나어 엔트로피를 추정하는 최초의 연구로, 문자당 약 1.201 비트의 상한치를 도출하고 이 결과를 최신 대규모 언어 모델과 비교한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
친구와 "다음 글자 맞추기" 게임을 한다고 상상해 보세요. 중간에 끊긴 문장을 보여줍니다. 예를 들어: "고양이는... 위에 앉았다"
친구는 다음 글자를 맞춰야 합니다.
- 만약 **"m"**을 맞춘다면 (매트), 정답입니다. 쉬웠죠.
- 만약 **"z"**를 맞춘다면, 틀렸습니다. 다시 맞춰야 합니다.
- 만약 **"p"**를 맞춘다면 (베개), 정답입니다.
이 게임은 엔트로피라는 것을 측정합니다. 언어 세계에서는 엔트로피가 열이나 무질서와 관련된 것이 아니라, 놀라움의 척도입니다.
- 높은 엔트로피: 다음 글자는 완전히 예상치 못합니다. 정답을 맞출 때까지 여러 번 맞춰야 합니다. 언어가 혼란스럽고 예측 불가능하게 느껴집니다.
- 낮은 엔트로피: 다음 글자는 명백합니다. 즉시 맞춥니다. 언어가 예측 가능하고 반복적으로 느껴집니다.
실험: 우크라이나어 맞추기
수십 년 동안 과학자들은 영어로 이 맞추기 게임을 해왔습니다. 1951 년, 클로드 섀넌이라는 남성이 사람들에게 영어 문장의 다음 글자를 맞추게 했습니다. 그는 영어가 매우 예측 가능하다는 것을 발견했습니다. 다음 글자를 맞추는 데 평균 약 1.2 번의 시도가 필요할 뿐입니다.
하지만 지금까지는 우크라이나어로 이 게임을 해본 사람이 아무도 없었습니다.
우크라이나의 세 명의 연구자 (안톤, 미키타, 마르키안) 가 이 실험을 처음으로 진행하기로 결정했습니다. 그들이 어떻게 진행했는지 간단히 설명해 드리겠습니다.
1. 플레이어 (자원봉사자)
전문가를 고용하는 대신, 그들은 주로 텔레그램과 같은 소셜 미디어에서 일반 사람들에게 게임 참여를 요청했습니다.
- 준비: 자원봉사자들에게 뉴스 기사에서 발췌한 문장을 제공했습니다.
- 전개: 사람들의 관심을 끌기 위해 문장의 맨 처음부터 시작하지 않았습니다. 처음 70 자 (짧은 문장 길이 정도) 를 보여주고 "다음에 무엇이 올까요?"라고 물었습니다.
- 게임: 자원봉사자가 글자를 입력합니다. 틀리면 빨간색으로 변하고 다시 시도합니다. 맞으면 다음 글자로 넘어갑니다.
- 목표: 사람들이 정답을 맞출 때까지 몇 번의 "틀린 시도"가 필요했는지 확인하고 싶었습니다.
2. 결과: 우크라이나어는 얼마나 예측 가능한가?
184 명의 자원봉사자가 17,000 회 이상의 추측을 통해 데이터를 수집한 후, 연구자들은 숫자를 분석했습니다.
- 점수: 그들은 우크라이나어의 "놀라움 수준 (엔트로피)"이 문자당 약 1.201 비트임을 발견했습니다.
- 그게 무슨 뜻일까요? 이는 우크라이나어가 예측 가능성 측면에서 영어와 매우 유사하다는 뜻입니다. 영어와 마찬가지로, 이전 글자를 알면 우크라이나어의 다음 글자는 보통 매우 명확합니다.
- 중복성: 언어가 매우 예측 가능하기 때문에, 우크라이나어 문장의 약 **76%**의 글자는 "중복"됩니다. 실제로 텍스트의 상당 부분을 제거해도 원어민은 여전히 누락된 부분을 완벽하게 맞출 수 있습니다.
3. "부정" 문제
연구자들은 신중해야 했습니다. 온라인 게임이었기 때문에, 일부 사람들은 다음과 같은 행동을 했을 수 있습니다.
- 온라인에서 전체 문장을 찾아보았을 수 있습니다.
- 무작위로 추측하다가 운 좋게 맞출 수 있었습니다.
- 흥미를 잃고 게임 중간에 그만둘 수 있었습니다.
이를 해결하기 위해 그들은 엄격한 심판처럼 행동했습니다. 성실하지 않게 플레이한 사람들 (노력이 부족했을 수 있는) 과 너무 완벽하게 플레이한 사람들 (부정을 했을 수 있는) 의 결과를 폐기했습니다. 매우 엄격하게 많은 데이터를 제거한 후에도, 결과는 여전히 1.20 부근에 머물렀습니다.
4. AI 비교: 인간 대 로봇
연구자들은 최신 AI 모델 (대형 언어 모델) 에게도 같은 게임을 하도록 요청했습니다.
- AI 의 장점: AI 모델은 인간보다 훨씬 뛰어났습니다. 일부 최상위 AI 모델은 약 0.7의 점수로 다음 글자를 맞출 수 있었습니다.
- 주의점: 연구자들은 AI 가 다른 방식으로 "부정"했을 수 있다고 경고합니다. AI 가 게임에 사용된 문장과 유사한 방대한 양의 뉴스 데이터로 훈련되었기 때문에, 언어를 진정으로 이해한 것이 아니라 특정 문장을 암기했을 수 있습니다. 수학 공부를 하지 않고 정답지만 외운 학생과 같습니다.
- 결론: AI 는 매우 뛰어나지만, "완벽한" 점수에 너무 가까워서 우크라이나어를 진정으로 이해하는 것인지, 아니면 사용된 특정 뉴스 기사에 과도하게 적합화된 것인지 구분하기 어렵습니다.
주요 교훈
이 논문은 우크라이나어의 예측 가능성을 수치화한 첫 번째 사례입니다.
- 우크라이나어는 혼란스럽지 않습니다. 영어와 마찬가지로 매우 구조화되어 있고 예측 가능합니다.
- 인간은 잘합니다. 일반 사람들은 약 1.2 번의 시도로 다음 글자를 맞출 수 있습니다.
- AI 는 더 좋지만, 너무 좋을 수도 있습니다. AI 모델은 더 빠르게 맞출 수 있지만, "암기"와 "지능"을 혼동하지 않도록 주의해야 합니다.
연구자들은 그들의 연구가 완벽하지 않았음을 인정합니다 (참여자 수가 부족했고, 문장들이 모두 뉴스 기사에서 발췌되었습니다). 하지만 이전보다 훨씬 더 나은 출발점을 제공합니다. 그들은 향후 다른 사람들이 게임을 개선할 수 있도록 코드와 데이터를 공유하기도 했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.