← 최신 논문
💬 NLP

Learning by Surprise: Adaptive Mitigation of Model Collapse in Large Language Models

이 논문은 AI가 생성한 콘텐츠로 학습할 때 발생하는 모델 붕괴 현상을 조사하고, 퍼플렉서티(perplexity)를 퇴보의 핵심 동인으로 식별하며, 인간이 작성한 데이터에 대한 접근 없이도 붕괴를 효과적으로 완화하기 위해 높은 놀라움(high-surprise)을 가진 문서를 우선시하는 확장 가능한 모델 내재적 필터링 전략을 제안한다.

원저자: Daniele Gambetta, Gizem Gezici, Fosca Giannotti, Dino Pedreschi, Alistair Knott, Luca Pappalardo

게시일 2026-07-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Daniele Gambetta, Gizem Gezici, Fosca Giannotti, Dino Pedreschi, Alistair Knott, Luca Pappalardo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

논문 설명: "놀라움을 통한 학습: 대규모 언어 모델의 모델 붕괴에 대한 적응형 완화 전략" (쉬운 언어와 일상적인 비유를 통한 번역)

거대한 문제: 자신의 꼬리를 먹는 AI

유명한 요리사가 다른 요리사들이 만든 음식을 맛보며 요리를 배우는 상황을 상상해 보세요. 처음에는 수천 명의 인간 요리사가 만든 매우 다양하고 풍부한 요리를 맛봅니다. 덕분에 그들은 놀랍고도 다양한 음식을 만드는 법을 배웁니다.

하지만 곧 문제가 발생합니다. 인터넷이 AI 요리사들이 쓴 레시피로 가득 차기 시작합니다. 결국, 인간 요리사는 인간의 레시피를 맛보는 대신, 오직 다른 AI 요리사들이 쓴 레시피만을 맛보게 됩니다.

이것을 AI 자가포식(AI Autophagy)(말 그대로 "자기 자신을 먹는 것")라고 부릅니다. 논문에서는 이를 "피드백 루프(feedback loop)"라고 부릅니다. AI가 콘텐츠를 생성하면, 미래 버전의 AI가 그 콘텐츠를 바탕으로 다시 학습하게 되는 현상입니다.

결과: 모델 붕괴 (Model Collapse)
이런 일이 발생하면, AI는 "병"에 걸리기 시작합니다. 창의성을 잃게 됩니다.

  • 비유: 음악가가 자신의 녹음본만 계속 듣는다고 상상해 보세요. 결국 그는 새로운 음을 듣지 못하게 됩니다. 그는 똑같은 세 개의 음을 똑같은 리듬으로 계속 반복해서 연주하기 시작할 것입니다. 그의 음악은 지루하고 반복적이며, 한때 가졌던 "영혼"이나 상식적인 면을 모두 잃어버리게 됩니다.
  • 논문 내용: AI는 문구를 반복하고, 다양성을 잃으며, 논리적으로 말이 안 되는 것들을 만들어냅니다 (예를 들어, 단순히 가장 확률이 높은 단어를 예측하느라 실제 사실이 아닌 "하늘은 초록색이다"라고 말하는 식입니다).

연구진이 "병"을 찾아낸 방법

연구진은 사람이 일일이 "이것은 인간의 레시피이고, 이것은 AI의 레시피다"라고 말해주지 않고도, 이 병이 어떻게 발생하는지 이해하고 이를 어떻게 멈출 수 있는지 알고 싶었습니다.

그들은 AI가 병에 걸리고 있다는 세 가지 주요 징후를 발견했습니다.

  1. "지루해진 뇌" (확률 집중 - Probability Concentration):

    • 비유: 건강한 AI는 문장의 다음 단어를 추측하는 사람과 같습니다. 그들은 "고양이, 강아지, 혹은 새가 될 수도 있겠어"라고 생각할 수 있습니다. 하지만 "붕괴된" AI는 정답 하나에 너무 확신을 가진 사람과 같습니다. 오직 하나의 단어만을 생각합니다. 지나치게 자신만만해지는 것입니다.
    • 과학적 원리: 연구진은 AI의 "확신"이 얼마나 소수의 단어에만 압축되는지를 측정했습니다. AI가 붕괴되면, 다른 모든 가능성을 무시한 채 특정 단어 하나에 거의 100%의 확신을 쏟아붓습니다.
  2. "상실된 상식" (Lost Common Sense):

    • 비유: 만약 건강한 AI에게 "내가 유리잔을 떨어뜨리면 어떻게 될까?"라고 물으면, "깨진다"라고 답할 것입니다. 하지만 붕괴된 AI에게 같은 질문을 하면, "그것은 구름이 된다"라고 하거나 질문을 계속 반복할 수도 있습니다. 현실 세계가 어떻게 돌아가는지에 대한 이해력을 잃어버리는 것입니다.
    • 과학적 원리: 연구진은 AI를 상식 퀴즈로 테스트했습니다. AI가 자신의 출력물로 학습할수록, 이러한 간단한 논리 질문에 답하는 능력이 떨어졌습니다.
  3. "놀라움" 요소 (핵심 발견):

    • 비유: AI를 학생이라고 상상해 보세요. 만약 선생님이 학생에게 이미 완벽하게 암기한 교과서를 준다면, 학생은 지루해져서 학습을 멈출 것입니다. 하지만 선생님이 이상하고 놀라운 사실이 담긴 책을 준다면, 학생의 뇌는 깨어납니다.
    • 과학적 원리: 연구진은 AI가 자신에게 놀랍지 않은(not surprising) 콘텐츠로 학습할 때 가장 빠르게 붕괴한다는 것을 발견했습니다. AI가 이미 예상하는 내용을 읽으면 자신의 나쁜 습관을 강화할 뿐이지만, 자신을 "놀라게 하는" 것(예측하기 어려운 콘텐츠)을 읽으면 건강한 상태를 유지합니다.

해결책: "놀라움을 통한 학습" (Learning by Surprise)

이 논문은 인간이 데이터에 "인간 작성" 또는 "AI 작성"이라는 라벨을 붙이지 않고도 AI를 훈련하는 새로운 방법을 제안합니다.

기존 방식:
"인간이 쓴 텍스트만 통과시켜라"라는 필터를 찾는 것입니다. 문제는 AI가 발전함에 따라 인간의 글과 AI의 글을 구분하는 것이 불가능해진다는 점입니다.

새로운 방식 (퍼플렉시티 필터링 - Perplexity Filtering):
"누가 썼는가?"를 묻는 대신, 연구진은 **"AI가 이 내용에 얼마나 놀라는가?"**를 묻습니다.

  • 전략: AI를 훈련시키기 전에, 텍스트 더미(인간과 AI가 쓴 글 모두 포함)를 살펴봅니다. 그리고 AI에게 이를 읽게 한 뒤 얼마나 "놀랐는지"를 측정합니다.
    • 만약 AI가 "오, 나 이거 알아! 쉽네!"라고 한다면 (낮은 놀라움), 그 데이터는 버립니다.
    • 만 만약 AI가 "와, 이건 예상 못 했는데!"라고 한다면 (높은 놀라움), 그 데이터는 남겨둡니다.

결과:
AI가 가장 놀라워하는 것들로만 훈련하도록 강제함으로써, 연구진은 "붕괴"를 막을 수 있었습니다.

  • AI는 다양성을 유지했습니다 (단순히 같은 단어를 반복하지 않았습니다).
  • AI는 상식을 유지했습니다.
  • 결정적으로: 어떤 문서가 인간의 것인지 AI의 것인지 모르는 상태에서도, 이 방식은 오직 인간의 텍스트만 사용했을 때와 똑같이 우수한 성능을 보였습니다.

이것이 왜 중요한가

이 논문은 우리가 AI가 생성한 콘텐츠로 가득 찬 시대에 진입하고 있다고 주장합니다. 만약 필터 없이 예전의 AI 콘텐츠로 새로운 AI를 계속 훈련시킨다면, 모든 AI는 반복적이고 지루하며 비논리적인 "좀비"가 될 것입니다.

이 "놀라움을 통한 학습" 방식은 실용적인 도구입니다. 이는 AI를 위한 식단 조절과 같습니다. AI에게 "예측 가능하고 반복적인 AI 텍스트"(정크 푸드)를 먹이는 대신, "건강하고 놀라운 콘텐츠"(현재의 지식을 자극하는 음식)를 먹도록 강제하는 것입니다. 이를 통해 인간이 심판 역할을 하지 않아도 AI가 똑똑하고 창의적인 상태를 유지할 수 있게 합니다.

한 문장 요약

AI 모델이 스스로 만든 반복적인 루프에 빠져 지루해지는 것을 막으려면, AI가 쓴 텍스트를 걸러내려 애쓰기보다 AI를 가장 놀라게 만드는 콘텐츠로 훈련시켜야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →