Repeated Sequences Reveal Gaps between Large Language Models and Natural Language
본 논문은 반복되는 부분 시퀀스와 렌지 엔트로피를 기반으로 한 새로운 평가 프레임워크를 제시하여, 자연어는 안정적인 장기 구조적 조직을 보이는 것과 달리 최첨단 대규모 언어 모델은 엔트로피 성장 패턴에서 체계적이고 규모에 의존적인 편차를 보임을 입증함으로써, 표면적 유창성을 넘어 텍스트의 깊은 통계적 구조를 포착하는 방식에 근본적인 격차가 있음을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 글은 이 논문을 쉬운 언어와 창의적인 비유를 사용하여 설명한 것입니다.
핵심 아이디어: 유창함 대 구조
두 사람이 이야기를 들려준다고 상상해 보세요.
- A 사람은 완벽하게 말합니다. 모든 문장이 매끄럽게 흐르고, 문법은 정확하며, 결코 더듬지 않습니다.
- B 사람 또한 완벽하게 말하지만, 비밀이 하나 있습니다. 사실 그들은 몇 가지 구절만 반복해서 말하거나, 새로운 모양을 만들어 내는 일 없이 미리 만들어진 작은 레고 블록들을 이어 붙여 이야기를 구성하고 있을 뿐입니다.
오랫동안 우리는 GPT 와 같은 대규모 언어 모델 (LLM) 이 인간과 똑같이 들릴 정도로 매우 발전했다고 생각했습니다. 하지만 이 논문은 더 깊은 질문을 던집니다. 과연 그들이 내부에서부터 긴 이야기를 어떻게 구축하는지 실제로 이해하고 있는 것일까요, 아니면 단순히 단기적으로는 매끄럽게 들리는 데만 매우 능숙한 것일까요?
저자 다나카 이시이 쿄미코는 문법적으로 의미가 있는지 확인하는 것이 아니라, 긴 거리를 두고 자신의 단어와 패턴을 어떻게 재사용하는지를 살펴봄으로써 이러한 이야기들을 '듣는' 새로운 방식을 개발했습니다.
도구: '메아리' 감지기
차이를 찾기 위해 저자는 **반복되는 부분열 (Repeated Subsequences)**이라는 개념을 사용합니다.
텍스트를 긴 복도로 생각해보세요.
- 자연어 (인간): 인간이 소설을 쓸 때, 초반에 씨앗을 심습니다. 등장인물, 주제, 또는 특정 구절을 소개합니다. 이야기가 진행됨에 따라 그들은 그 씨앗들을 다시 찾아와 물을 주고 새로운 가지를 키워냅니다. 이야기가 스스로에게 '메아리'를 치는 것입니다. 새로운 의미를 만들어내기 위해 오래된 구조들을 재사용합니다.
- LLM(인공지능): 저자는 AI 모델들이 종종 고장 난 레코드나 미로 같은 거울방처럼 행동한다고 발견했습니다. 그들은 무언가를 반복할 수는 있지만, 이야기의 오래된 부분들이 새로운 부분을 지지하기 위해 능동적으로 재구성되는那种 깊은 구조적 '메아리'는 없는 것처럼 보입니다.
이 논문은 문서의 후반부에 작은 텍스트 덩어리 (예: 5 글자 또는 10 글자 시퀀스) 가 몇 번이나 다시 나타나는지 세어 이를 측정합니다.
두 가지 성장 유형: 정원 대 공장
이 논문은 텍스트가 길어짐에 따라 '정보'가 어떻게 성장하는지 비교합니다. 이는 두 가지 주요 방식으로 발생할 수 있음을 밝힙니다.
멱법칙 정원 (자연어):
새로운 고유한 꽃들을 계속 심되, 같은 트레일리스와 울타리를 계속 재사용하여 그들을 지지하는 정원을 상상해 보세요. 정원이 커짐에 따라 꽃의 다양성은 증가하지만, 구조 (울타리와 트레일리스) 는 계속해서 재사용됩니다.
이 논문은 인간의 글쓰기가 이와 같이 행동한다고 발견했습니다. 이는 '로그 - 멱 (Log-Power)' 패턴을 따릅니다. 이는 텍스트가 자신의 구조적 DNA 를 끊임없이 재활용한다는 것을 의미합니다. 이는 효율적이고 깊이 있게 상호 연결되어 있습니다.공장 라인 (AI 모델):
공장이 계속해서 제품을 쏟아내는 상황을 상상해 보세요. 공장이 더 오래 가동될수록 약간 다른 제품들을 계속 만들어내지만, 내부 설계도 자체를 깊이 있고 재귀적으로 재사용하는那种 특성은 없는 것처럼 보입니다.
이 논문은 AI 모델, 특히 이전 버전이나 작은 모델들이 다르게 행동한다고 발견했습니다. 그들은 인간 글쓰기에서 발견되는那种 깊은 효율적 재사용 없이 끊임없이 새로운 구조적 복잡성을 생성한다는 것을 시사하는 '멱법칙 (Power-Law)' 패턴을 보입니다.
실험: '셔플' 테스트
저자는 다음을 대상으로 이를 테스트했습니다.
- 인간이 쓴 소설 (프로젝트 구텐베르크에서 가져온 것).
- AI 가 생성한 이야기 (GPT-3.5, GPT-4 및 최신 모델이 생성한 것).
비교가 공정하도록 길이를 맞췄습니다. 그런 다음 텍스트가 스스로를 어떻게 재사용하는지 보기 위해 수학적 '메아리 테스트' ( 레니 엔트로피 사용) 를 수행했습니다.
결과:
- 인간: 책의 길이가 어떻든 상관없이 '메아리' 패턴은 안정적으로 유지되었습니다. 인간은 예측 가능하고 효율적인 방식으로 자신의 구조적 패턴을 일관되게 재사용했습니다.
- AI: AI 의 패턴은 모델의 '크기'에 따라 달라졌습니다.
- 작은 AI 모델들은 구조를 재사용 (또는 재사용하지 못함) 하는 방식에서 매우 혼란스러웠습니다.
- AI 모델이 커질수록 (GPT-5 와 같이) 인간과 더 비슷해지기 시작했지만, 여전히 체계적인 차이가 있었습니다. 그들은 '메아리'를 모방하는 데는 더 능숙해지고 있었지만, 이야기를 구축하는 방식의 근본적인 수학은 인간 작가와 여전히 구별되었습니다.
'최대 반복' 함정
이 논문은 텍스트에서 가장 긴 반복 구절 (예: 두 번 나타나는 가장 긴 문장 찾기) 도 살펴보았습니다.
- 이전 연구들은 이러한 '극단적' 반복에 초점을 맞췄습니다.
- 저자는 이는 가장 높은 나무만 보고 숲을 이해하려는 것과 같다고 주장합니다. 이는 불안정하고 오해의 소지가 있습니다.
- 대신, 모든 반복된 덩어리 ( '분포') 를 살펴보는 것이 텍스트의 진정한 구조에 대해 훨씬 더 명확하고 안정적인 그림을 제공합니다.
결론
이 논문은 AI 가 '나쁘다'거나 좋은 이야기를 쓸 수 없다고 말하지 않습니다. AI 와 인간은 이야기를 구축하는 방식이 다르다고 말합니다.
- 인간은 자신의 과거 단어와 구조를 끊임없이 참조하고 재결합하여 쓰며, 이는 특정한 수학적 방식 (로그 - 멱) 으로 성장하는 밀집되고 효율적인 의미의 그물을 만들어냅니다.
- AI는 다음 단어를 예측하여 쓰며, 이는 다른 종류의 성장 패턴 (멱법칙에 더 가까움) 을 만들어냅니다. 가장 똑똑한 AI 모델조차도 긴 거리를 두고 구조를 재활용하는 인간의 예술을 완전히 마스터하지는 못했습니다.
저자는 우리가 AI 를 측정하기 위한 새로운 도구가 필요하다고 결론지었습니다. 우리는 단순히 "시험에 통과했는가?" 또는 "유창한가?"라고 물을 수 없습니다. 우리는 "인간이 세상을 구축하는 방식으로 세상을 구축하는가?"라고 물어야 합니다. 그리고 지금 당장의 답은 다음과 같습니다. 아직은 아닙니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.