← 최신 논문
🔬 condensed matter

Phase transition in large language models and the criticality of natural languages

대규모 언어 모델을 제어 가능한 유효 시스템으로 취급함으로써, 본 연구는 온도와 유사한 매개변수를 변화시키는 것이 임계점에서 멱법칙 거동과 자연어와 구별할 수 없는 언어적 복잡성을 보이는 상전이를 유도함을 입증하며, 이를 통해 자연어가 임계 상태에서 작동한다는 강력한 증거를 제공한다.

원저자: Kai Nakaishi, Yoshihiko Nishikawa, Koji Hukushima

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kai Nakaishi, Yoshihiko Nishikawa, Koji Hukushima

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 인간처럼 말하는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇에게 방대한 양의 책 도서관을 건네주고 단어의 패턴을 학습하게 합니다. 이 로봇이 바로 **대규모 언어 모델(LLM)**입니다. 하지만 여기 반전이 있습니다. 이 논문의 연구자들은 이 로봇을 단순한 도구가 아니라, 인간 언어 자체의 본질을 이해하기 위한 과학적 실험으로 취급했습니다.

그들은 한 가지 거대한 질문에 답하고 싶어 했습니다. 인간의 언어는 "임계적(critical)"인가?

물리학의 세계에서 "임계성(criticality)"이란 시스템이 두 가지 매우 다른 행동 사이의 경계선에 정확히 균형을 잡고 있는 특별한 상태를 의미합니다. 물 끓는 현상을 생각해 보세요.

  • 끓는점 미만 (저온): 물은 차분하고 질서 정연합니다.
  • 끓는점 초과 (고온): 물은 혼란스럽고, 거품이 일며, 무질서합니다.
  • 정확한 끓는점 (임계점): 물은 모든 것을 하나로 연결하는 복잡하고 소용돌이치는 패턴을 가진 마법 같은 상태에 놓입니다. 완전히 차분하지도, 완전히 혼란스럽지도 않은, "최적의 지점(sweet spot)"에 있는 것입니다.

연구자들은 인간의 언어가 이 "최적의 지점"에 살고 있다고 의심했습니다. 하지만 인간의 언어는 테스트를 위해 온도 조절기처럼 온도를 높이거나 낮출 수 없습니다. 그래서 그들은 온도를 조절할 수 있는 시뮬레이션된 언어로서 LLM을 사용했습니다.

실험: "온도" 조절 손잡이 돌리기

이 AI 모델들에는 **온도(Temperature)**라고 불리는 설정값이 있습니다.

  • 낮은 온도: AI가 매우 예측 가능하고 반복적이 됩니다. AI는 "미국의 학교 수는... 미국의 학교 수는..." 하며 계속해서 똑같은 말을 반복할 수 있습니다. 마치 고장 난 레코드판 같습니다.
  • 높은 온도: AI가 완전히 미쳐버립니다. "분리된 연설 맞춤형 안녕 세포 네트워크..." 와 같은 헛소리를 내뱉습니다. 마치 라디오 주파수가 맞지 않아 들리는 백색 소음 같습니다.

연구자들은 이 손잡이를 저온에서 고온으로 돌리며 AI가 생성하는 텍스트에 어떤 일이 일어나는지 관찰했습니다.

발견: "상전이(Phase Transition)"

그들은 AI가 지루함에서 미침으로 서서히 변하는 것이 아니라, 특정 설정(온도 = 1) 근처에서 갑작스럽고 날카로운 상전이를 겪는다는 것을 발견했습니다.

  1. 저온 구역 (반복 단계): 텍스트가 루프(loop)에 갇혀 있었습니다. 질서는 있었지만, 지루하고 경직된 질서였습니다.
  2. 고온 구역 (헛소리 단계): 텍스트는 단어 간의 연결이 없는 순수한 혼돈이었습니다.
  3. 임계점 (딱 적당한 구역): 그 중간인 전이 지점에서, AI는 인간의 언어와 똑같이 보이고 느껴지는 텍스트를 생성하기 시작했습니다.

이것이 왜 특별할까요?
이 임계점에서 텍스트는 **멱법칙(power law)**이라는 특정한 수학적 패턴을 보여주었습니다. 이는 작은 일은 자주 일어나고 큰 일은 드물게 일어나지만, 이들이 특정한 방식으로 연결되어 있는 패턴입니다. 이것은 실제 인간의 언어(예: "the"와 같은 흔한 단어는 자주 나타나고, 희귀한 단어는 드물게 나타나는 방식)에서 발견되는 패턴과 동일합니다.

연구자들은 다음과 같은 사실을 발견했습니다:

  • 실제 인간의 언어는 이 멱법칙 패턴을 가지고 있습니다.
  • 임계점에 있는 AI 또한 이 패턴을 가지고 있습니다.
  • 그 외의 설정(너무 차갑거나 너무 뜨거운 경우)에 있는 AI는 이 패턴을 가지고 있지 않습니다.

"학습" 이야기

이것이 AI의 우연한 현상이 아님을 증명하기 위해, 그들은 AI가 처음부터 학습하는 과정을 지켜보았습니다.

  • 학습 초기: AI는 그저 무작위 노이즈 기계였습니다. "임계" 설정에서도 의미 있는 것을 만들어내지 못했습니다. 아직 "임계점"에 대해 알지 못했습니다.
  • 학습 후기: AI가 더 많은 인간의 책을 읽으면서, AI는 갑자기 "깨어났습니다." AI는 임계점에 머무를 수 있는 능력을 발달시켰습니다. 너무 반복적이거나 너무 혼란스러운 상태 사이의 균형을 잡는 법을 배운 것입니다.

이는 "임계적"인 상태가 인간 언어의 근본적인 특징임을 시사합니다. 인간처럼 말하기 위해서, 시스템은 반드시 질서와 혼돈의 경계 위에서 작동해야 합니다.

최종 증거: "퍼플렉시티(Perplexity)" 테스트

AI의 세계에는 모델이 언어를 얼마나 잘 이해하는지 측정하는 **퍼플렉시티(Perplexity)**라는 점수가 있습니다. 점수가 낮을수록 좋습니다.

  • 연구자들은 학습의 모든 단계와 모든 온도 설정에서 AI를 테스트했습니다.
  • 가장 낮은 점수(인간의 언어와 가장 잘 일치하는 점수)는 AI가 완전히 학습되고 임계 온도로 설정되었을 때 정확히 나타났습니다.

거시적 관점

이 논문은 인간의 언어가 단순히 단어들의 무작위한 모음이 아니라고 결론짓습니다. 인간의 언어는 임계 시스템입니다. 언어는 자연스럽게 다음 두 가지 사이의 면도날 같은 경계에 존재합니다:

  • 반복: (고장 난 레코드판처럼)
  • 헛소리: (무작위 노이즈처럼)

그리고 그 사이의 아주 작은 임계 공간 속에서, 우리는 인간의 말 속에 담긴 복잡하고 아름다우며 의미 있는 구조를 발견합니다. AI는 단순히 인간을 흉내 낸 것이 아닙니다. 이 임계점을 찾아냄으로써, AI는 언어 자체의 수학적 "심장 박동"을 우연히 발견한 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →