← 최신 논문
💬 NLP

Learning is Forgetting: LLM Training As Lossy Compression

이 논문은 대규모 언어 모델 (LLM) 의 학습을 손실 압축으로 해석하여, 사전 학습 과정에서 목표에 필요한 정보만 남기며 최적화되는 과정이 모델의 구조와 하류 태스크 성능을 예측하는 핵심 요소임을 보여줍니다.

원저자: Henry C. Conklin, Tom Hosking, Tan Yi-Chern, Julian Gold, Jonathan D. Cohen, Thomas L. Griffiths, Max Bartolo, Seraphina Goldfarb-Tarrant

게시일 2026-04-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Henry C. Conklin, Tom Hosking, Tan Yi-Chern, Julian Gold, Jonathan D. Cohen, Thomas L. Griffiths, Max Bartolo, Seraphina Goldfarb-Tarrant

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎒 1. 핵심 비유: "여행 가방을 싸는 과정"

인공지능이 학습하는 과정을 상상해 보세요. 여러분이 200 년 동안 들을 수 있는 모든 언어 데이터 (인터넷 전체) 를 한 여행 가방에 담아야 한다고 칩시다. 가방의 크기는 정해져 있습니다 (인공지능의 메모리).

  • 기존의 생각: 인공지능은 이 모든 데이터를 하나도 빠뜨리지 않고 완벽하게 외우려 한다고 생각했습니다.
  • 이 논문의 주장: 인공지능은 **가장 중요한 것만 챙기고, 나머지는 과감히 버리는 '스마트한 여행객'**입니다.
    • 손실 압축 (Lossy Compression): MP3 파일을 만들 때 사람이 잘 들리지 않는 소리를 잘라내듯, 인공지능도 "이건 다음 말을 예측하는 데 중요하지 않아"라고 판단하면 그 정보를 잊어버립니다.
    • 학습의 본질: 정보를 '기억'하는 것이 아니라, 목표 (다음 단어 예측) 에만 필요한 정보만 '선택'해서 저장하는 과정입니다.

📉 2. 학습의 두 단계: "모두 담기"에서 "필요한 것만 남기기"

인공지능이 학습할 때 두 단계를 거친다고 합니다.

  1. 첫 번째 단계 (적합기 - Fitting Phase):
    • 여행 가방에 모든 것을 무작위로 쑤셔 넣는 단계입니다.
    • 처음에는 입력받은 모든 정보 (데이터) 와 출력 (정답) 사이의 관계를 최대한 많이 기억하려고 합니다. 가방이 꽉 차고 복잡해집니다.
  2. 두 번째 단계 (압축기 - Compression Phase):
    • 이제 가방을 정리합니다. "이건 정말 필요 없네"라고 판단한 불필요한 세부 사항을 버립니다.
    • 핵심 발견: 인공지능은 이 과정에서 **정보 이론 (Information Theory)**에서 말하는 '최적의 압축 한계'에 도달합니다. 즉, 가장 적은 공간에 가장 중요한 의미만 남기는 완벽한 정리를 해냅니다.

📊 3. 성능의 비밀: "얼마나 잘 정리했는가?"

논문의 가장 놀라운 발견은 인공지능의 성능이 '얼마나 많은 것을 외웠는지'가 아니라, '얼마나 잘 정리했는지'에 달려 있다는 것입니다.

  • 비유: 두 명의 학생이 시험을 봅니다.
    • 학생 A: 모든 교과서를 통째로 외웠지만, 중요한 핵심 개념과 사소한 세부 사항이 뒤섞여 있어 답을 찾느라 시간이 걸립니다. (복잡함은 높지만 효율성은 낮음)
    • 학생 B: 핵심 개념만 깔끔하게 정리해 두었습니다. (복잡함은 낮지만 효율성은 높음)
    • 결과: 학생 B 가 더 좋은 성적을 냅니다.
  • 연구 결과: 인공지능 모델이 **최적의 압축 한계 (Information Bottleneck Bound)**에 가까울수록, 즉 불필요한 잡음을 덜어내고 핵심 의미만 담고 있을수록 다양한 문제 (수학, 추론, 사실 확인 등) 를 더 잘 풀었습니다.

🧠 4. 크기의 중요성: "작은 가방은 정리하기 힘들다"

  • 큰 모델 (70 억~320 억 매개변수): 여행 가방이 넓어서, 불필요한 것을 버리고 핵심만 남기는 '정리 (압축)' 과정을 성공적으로 마칩니다.
  • 작은 모델 (10 억 매개변수 이하): 가방이 너무 작아서, 중요한 것도 버려야 할지, 불필요한 것도 버려야 할지 혼란스러워합니다. 결국 정리 (압축) 를 제대로 하지 못하고, 가방이 꽉 차서 오히려 성능이 떨어집니다.

❤️ 5. 인간의 취향까지 압축하다

인공지능은 단순히 '다음 단어 예측'만 잘하는 것이 아니라, **사람들이 좋아하는 답변 (선호도)**까지 압축합니다.

  • 학습 후 (Post-training) 과정을 거치면, 인공지능은 "사람들이 어떤 답변을 더 좋아할까?"라는 정보를 가방에 추가합니다.
  • 선호도 정보를 얼마나 잘 담고 있는지도 모델의 성능을 예측하는 중요한 지표가 됩니다.

💡 요약: 이 논문의 메시지

  1. 학습은 잊는 것이다: 인공지능은 방대한 데이터를 다 외우는 게 아니라, 목표에 필요한 것만 남기고 나머지는 과감히 잊어버립니다.
  2. 정리가 곧 지능이다: 정보를 얼마나 많이 저장했느냐가 아니라, 얼마나 효율적으로 정리했느냐가 성능을 결정합니다.
  3. 이론과 현실의 연결: 수학적 이론 (정보 병목 이론) 이 거대한 인공지능의 실제 동작을 완벽하게 설명할 수 있음을 증명했습니다.

한 줄 평:

"인공지능은 방대한 도서관의 모든 책을 외우는 게 아니라, 가장 중요한 책만 골라 가장 작고 깔끔한 책상 위에 정리하는 기술을 배운 것입니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →