← 최신 논문
💬 NLP

Literary Non-Style in LLM-Generated Text

이 논문은 LLM 생성 텍스트의 독특한 '무스타일(non-style)'이 의미론적 한계를 드러내는 특정한 통계적 n-gram 패턴에서 기인한다는 점을 논하며, AI 글쓰기에서의 문체적 및 의미론적 특성이 분리 가능한 것이 아니라 근본적으로 얽혀 있음을 입증한다.

원저자: Cory Massaro

게시일 2026-07-21
📖 5 분 읽기🧠 심층 분석

원저자: Cory Massaro

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 이야기가 인간에 의해 쓰였는지 아니면 로봇에 의해 쓰였는지를 밝혀내려는 탐정이라고 상상해 보십시오. 당신은 철자 오류나 문법 오류를 찾는 것이 아니라, 글의 "영혼"을 찾고 있습니다. 언어 과학의 세계에는 **지프의 법칙(Zipf's Law)**이라는 유명한 규칙이 있습니다. 이것을 당신이 가장 좋아하는 노래들의 플레이리스트라고 생각해 보십시오. 어떤 거대한 음악 컬렉션에서든, 몇몇 히트곡(예: "생일 축하합니다"나 아주 유명한 팝송)은 계속해서 반복해서 재생되는 반면, 대부분의 곡은 한두 번만 재생됩니다. 만약 이 노래들을 "가장 많이 재생된 순서"부터 "가장 적게 재생된 순서"로 나열한다면, 그 하락 폭은 매우 구체적이고 예측 가능한 곡선을 따릅니다. 이것은 인간의 말, 책, 그리고 우리가 단어를 사용하는 방식에서도 일어납니다. 과학자들은 오랫동안 이 "음악적" 패턴이 자연스러운 인간의 창의성을 나타내는 신호라고 믿어 왔습니다. 하지만 이제 컴퓨터가 이야기를 쓸 수 있게 되면서, 우리는 질문을 던져야 합니다. 이 기계들은 동일한 음악적 규칙을 따를까요, 아니면 고장 난 레코드판처럼 소리를 낼까요?

코리 마사로(Cory Massaro)가 작성한 이 논문은 바로 그 점을 조사합니다. 저자는 대규모 언어 모델(LLM)—우리가 어디에서나 볼 수 있는 초지능형 AI 챗봇—에 의해 생성된 텍스트가 인간이 쓴 텍스트와 다르게 느껴지는지 알고 싶어 합니다. 이 연구는 AI가 우리가 사용하는 단어를 흉내 낼 수는 있지만, 인간의 글을 살아있게 만드는 리듬다양성을 구현하는 데는 실패한다는 점을 시사합니다. 특정 단어 그룹(예: "세 단어 구절" 또는 "네 단어 구절")이 얼마나 자주 나타나는지 계산함으로써, 저자는 AI의 글쓰기가 인간의 글쓰기보다 훨씬 더 반복적이고 예측 가능하다는 것을 발견했습니다. 그것은 마치 AI가 루프에 갇혀서 똑같은 좋아하는 구절들을 재활용하고 있는 것 같으며, 반면 인간 작가는 새로운 조합들로 당신을 계속 놀라게 합니다. 논문은 이러한 다양성의 결여가 단순히 스타일의 문제가 아니라, 실제로 AI가 표현할 수 있는 아이디어를 제한한다고 결론짓습니다. 다양한 방식으로 말할 수 없다면, 얼마나 많은 다양한 것들을 말할 수 있겠습니까?

"로봇 리듬"의 이야기

저자가 발견한 것을 이해하기 위해, 이야기의 "재료"를 살펴봅시다. 이 논문은 두 가지 주요 유형의 글쓰기를 비교합니다:

  1. 인간: 1900년대 초반 실제 인물이 쓴 고전 회고록인 헨리 애덤스의 교육(The Education of Henry Adams).
  2. 로봇: 인간 프롬프터에 의해 구성되었지만, AI(ChatGPT)가 "작성한" 책인 AI의 내면 생활(The Inner Life of an AI).

또한 저자는 결과가 단순히 우연이 아님을 확인하기 위해 800만 단어의 인간 글쓰기와 800만 단어의 AI 글쓰기가 포함된 방대한 데이터셋을 살펴보았습니다.

거대한 발견: "상투적 구절"의 함정
저자는 AI의 책을 읽을 때 이상한 점을 발견했습니다. 마치 로봇이 일련의 "박제된" 구절들을 계속해서 사용하고 있는 것처럼 느껴졌습니다. 예를 들어, "despite these challenges(이러한 어려움에도 불구하고)"라는 구절은 책에 16번 등장했고, "I began to(~하기 시작했다)"는 50번 넘게 나타났습니다! 반면, 인간 저자인 헨리 애덤스는 훨씬 더 넓은 범위의 단어들을 사용했습니다. 그는 똑같은 네 단어 시퀀스를 거의 반복하지 않았습니다.

이것이 단지 느낌이 아니라는 것을 증명하기 위해, 저자는 수학적 계산을 수행했습니다. 그들은 텍스트에 나타나는 고유한 단어 그룹(n-gram)의 수를 세었습니다.

  • 1-gram은 단일 단어입니다.
  • 2-gram은 두 단어 쌍입니다 (예: "very good").
  • 3-gram4-gram은 더 긴 사슬입니다.

결과는 명확했습니다:

  • 인간의 텍스트에서는 다양성이 높았습니다. 4단어 구절의 경우, 고유한 구절 대비 전체 구절의 비율은 0.9890이었습니다. 이는 헨리 애덤스가 네 단어 시퀀스를 거의 전혀 반복하지 않았음을 의미합니다.
  • AI의 텍스트에서는 다양성이 훨씬 낮았습니다. 4단어 구절에 대한 비율은 0.6882에 불과했습니다. 이는 AI가 자신이 좋아하는 네 단어 사슬을 끊임없이 반복했음을 의미합니다.

이야기의 "기울기"
저자는 또한 글쓰기의 "기울기"를 살펴보았는데, 이는 글이 얼마나 빨리 새로운 아이디어를 소진하는지를 설명하는 멋진 방식입니다. 완벽한 인간의 이야기는 새로운 단어와 구절을 계속 찾아내지만, 그것들은 점점 적게 나타나며 매끄러운 곡선(지프의 법칙)을 따릅니다.

  • AI의 경우, 곡선이 너무 가팔랐습니다. 가장 흔한 구절들은 너무 흔했고, 희귀한 구절들은 너무 희귀했습니다.
  • 저자는 4단어 구절에 대해 AI의 "기울기"는 -0.395(한 테스트에서)였던 반면, 인간의 기울기는 -0.178이었다는 것을 발견했습니다. AI의 더 가파른 숫자는 AI가 인간보다 자신의 선호 구절에 훨씬 더 단단히 매달려 있음을 의미합니다.

"상투적 구절"에 대하여?
저자는 의문을 가졌습니다: "혹시 AI가 단지 같은 아이디어를 다른 단어로 표현하는 것 아닐까? 예를 들어 'huge' 대신 'big'이라고 말하는 것처럼?" 이를 테스트하기 위해, 그들은 텍록을 "표제어 추출(lemmatized)" 했습니다. 즉, 단어들을 그 뿌리(root)에 따라 그룹화하는 것입니다 (따라서 "running", "ran", "runs"는 모두 동일한 단어로 계산됩니다).

  • 결과: 유사한 단어들을 함께 그룹화한 후에도, AI는 여전히 반복적으로 들렸습니다. "기울기"는 크게 변하지 않았습니다. 이는 문제가 단순히 유의어를 사용하는 것에 관한 것이 아니라, AI가 진정으로 특정 구절의 틀에 갇혀 있다는 것을 시사합니다.

"고장 난 레코드판" vs "재즈 솔로"

그렇다면 이 모든 것이 무엇을 의미할까요? 저자는 멋진 비유를 사용합니다: 인간 작가를 즉흥 연주를 하는 재즈 뮤지션이라고 상상해 보십시오. 그들은 몇 가지 익숙한 음을 연주할 수도 있지만, 끊임없이 그것들을 섞고, 새로운 리프를 더하며, 청중을 놀라게 합니다. 반면 AI는 똑같은 캐치한 후렴구로 계속 건너뛰는 고장 난 레코드 플레이어와 같습니다.

논문은 이것이 단순히 AI가 "지루하게" 들린다는 것에 관한 것이 아니라고 주장합니다. 이것은 AI가 무엇을 말할 수 있는지에 관한 것입니다.

  • 한계: AI가 몇몇 구절에 너무 크게 의존하기 때문에, AI는 더 작은 "도구 상자"의 아이디어를 갖게 됩니다. 정해진 수의 단어로 이야기를 쓸 때, 인간은 더 많은 고유한 조합을 사용하기 때문에 더 많은 다양한 아이디어를 담아낼 수 있습니다. 루프에 갇힌 AI는 결국 똑같은 것들을 약간씩 다르게 말하는 데 그칩니다.
  • "느낌": 저자는 사람들이 AI 텍스트를 읽을 때 종종 그것을 "느낄" 수 있다고 언급합니다. 그것은 평평하고, 정형화되어 있으며, 약간 공허하게 느껴집니다. 이 연구는 그 느낌이 구절의 다양성 결여에서 온다는 것을 시사합니다. AI는 스스로의 패턴을 깰 수 없기 때문에 인간의 창의성이라는 "불꽃"이 결여되어 있습니다.

이 논문이 알지 못한다고 명시한 것

이 연구가 하지 않은 일을 주목하는 것도 중요합니다. 저자는 AI의 글쓰기가 도덕적인 의미에서 "나쁘다"고 주장하거나, AI가 결코 좋은 문학을 쓸 수 없다고 말한 것이 아닙니다. 그들은 단지 단어의 통계를 측정했을 뿐입니다.

  • 그들은 AI가 더 창의적이 되는 법을 배울 수 없다는 것을 증명한 것이 아니라, 단지 현재 그들이 분석한 텍스트에서는 패턴이 인간과 매우 다르다는 것을 보여주었을 뿐입니다.
  • 그들은 반복이 항상 나쁜 것은 아니라고 말하지 않았습니다 (때로는 시에서처럼 구절을 반복하는 것이 강력한 예술적 선택이 될 수 있습니다). 하지만 AI는 시인이 되려고 노력하면서 리듬을 다양하게 만드는 법을 잊어버린 로봇처럼, 엉뚱한 곳에서 구절을 너무 많이 반복합니다.

최종 요점

결국, 이 논문은 스타일과 의미가 연결되어 있다는 점을 시사합니다. 이야기의 "느낌"을 그 안의 "아이디어"와 분리할 수 없습니다. 작가(또는 로봇)가 무언가를 말하는 새로운 방식을 찾지 못한다면, 그들이 표현할 수 있는 것에도 한계가 있습니다. AI의 "고장 난 레코드판" 리듬은 단순한 스타일적 특이점이 아닙니다. 그것은 복잡하고 다양한 인간의 생각을 표현하는 기계의 능력이 여전히, 음, 진행 중인 작업임을 보여주는 신호입니다. 숫자는 AI가 말을 할 수는 있지만, 인간이 하는 것과 같은 거칠고 예측 불가능한 다양성을 가지고 노래하는 법은 아직 배우지 못했음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →