← 최신 논문
💬 NLP

Where does output diversity collapse in post-training?

본 논문은 생성형 언어 모델의 출력 다양성 붕괴가 추론 시나리오가 아닌 학습 데이터 구성에 의해 결정되며, 이는 추론 단계의 조치만으로는 해결할 수 없음을 Olmo 3 의 다양한 파생 모델들을 통해 실증적으로 규명했습니다.

원저자: Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras

게시일 2026-04-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🤖 AI 의 '다양성'이 사라지는 곳: 왜 똑같은 대답만 할까?

이 논문은 최근 인공지능 (LLM) 이变得越来越 똑똑해지면서, 정작 답변의 다양성이 사라져서 모든 사람이 같은 말을 하는 문제가 발생한다는 사실을 파헤친 연구입니다. 마치 "모든 학생이 똑같은 답안지를 작성하는 시험"처럼 말이죠.

저희는 이 복잡한 연구를 세 가지 핵심 이야기로 나누어, 누구나 쉽게 이해할 수 있도록 설명해 드리겠습니다.


1️⃣ 비유: "요리 학교"와 "레시피"의 차이

이 연구는 AI 가 배우는 과정을 세 가지 다른 '요리 학교'에 비유할 수 있습니다.

  • 기초 학교 (Base Model): 다양한 재료를 맛보고 창의적으로 요리를 만드는 학생입니다. 답이 하나만 있는 게 아니라, 여러 가지 방식으로 요리를 할 수 있죠.
  • 생각하는 요리 학교 (Think Lineage): 이 학교는 **두 명의 명장 (Teacher)**에게만 배우는 곳입니다. "이렇게 해라, 저렇게 해라"라고 두 명만 가르쳐서, 학생들은 두 명의 스타일만 따라 하게 됩니다.
  • 다양한 요리 학교 (Instruct Lineage): 이 학교는 수백 명의 다양한 요리사에게 배웁니다. 레시피가 훨씬 다양하죠.

🔍 연구의 발견:

  • 생각하는 요리 학교는 **초급 과정 (SFT)**에서 이미 두 명장의 스타일만 배우느라, 창의성이 급격히 떨어집니다. (다양성 붕괴가 여기서 일어남)
  • 다양한 요리 학교는 초급 과정에서는 괜찮지만, **고급 과정 (DPO)**에서 "사람들이 좋아하는 맛"만 골라내느라 다양성이 사라집니다.

💡 결론: 다양성이 사라지는 시점은 어떤 '데이터 (재료)'로 배웠는지에 따라 달라집니다. 같은 교육 과정이라도, 배운 재료 (데이터) 가 좁으면 일찍 다양성이 죽고, 넓으면 나중에 죽습니다.


2️⃣ 비유: "생각하는 과정"은 다양성을 구하지 못해

많은 사람이 "AI 가 답변을 할 때 '생각하는 과정 (Chain of Thought)'을 보여주면, 더 다양한 답이 나오지 않을까?"라고 생각합니다. 마치 "생각을 길게 늘어놓으면 더 창의적이 되지 않을까?" 하는 기대와 비슷하죠.

하지만 연구자들은 AI 의 '생각 과정'을 강제로 지우고 직접 답만 말하게 해보았습니다.

  • 결과: "생각 과정"을 지우더라도, AI 가 내는 최종 답안의 다양성은 전혀 회복되지 않았습니다.
  • 비유: 이는 마치 "학생이 시험지를 풀 때 풀이 과정을 지워도, 정답이 여전히 똑같다면 그 학생의 머릿속에 이미 정답이 고정되어 있다는 뜻"과 같습니다.

💡 결론: 다양성 부족은 AI 가 답을 내는 방식 (생각 과정) 때문이 아니라, 학습을 통해 머릿속 (가중치) 에 이미 박혀있는 문제입니다. 그래서 AI 가 "생각"을 하든 말든, 답은 여전히 비슷비슷합니다.


3️⃣ 비유: "오답 제거"와 "진짜 획일화"의 차이

AI 가 다양한 답을 내지 않는 이유가 단순히 "틀린 답을 없애서"일까요? 아니면 "올바른 답들 사이에서도 다양성이 사라져서"일까요?

연구진은 이 두 가지를 분리해서 분석했습니다.

  • 상황 A (수학/코딩 문제): 틀린 답을 많이 걸러내다 보니, 자연스럽게 답의 종류가 줄어든 경우입니다. (이건 질 관리로 볼 수 있어 나쁘지 않음)
  • 상황 B (창의적 글쓰기/가치관 문제): 정답이 여러 개일 수 있는데, AI 가 하나의 정답만 고집하며 다른 관점을 완전히 무시하는 경우입니다. (이건 위험함)

💡 결론:

  • 수학이나 코딩에서는 다양성이 줄어든 게 오히려 "정답을 잘 찾아냈다"는 신호일 수 있습니다.
  • 하지만 창의적인 글쓰기나 사회적 이슈에서는, AI 가 하나의 관점만 고집하며 다른 가능성을 지워버리는 것이 큰 문제입니다. 이는 AI 가 우리 사회의 다양한 목소리를 대변하지 못하게 만들 수 있습니다.

🌟 요약: 우리가 무엇을 배워야 할까?

  1. 데이터가 핵심입니다: AI 의 다양성은 학습 시 어떤 데이터를 얼마나 다양하게 주느냐에 달려 있습니다. 좁은 데이터 (두 명장만) 로 배우면 일찍 다양성이 죽고, 넓은 데이터 (수백 명) 로 배우면 나중에 죽습니다.
  2. 생각을 막으면 안 됩니다: AI 가 "생각"을 하지 않게 해도 다양성이 돌아오지 않습니다. 문제는 학습된 뇌에 있습니다.
  3. 과제에 따라 다릅니다: 수학 문제에서는 "틀린 답"을 줄이는 게 중요하지만, 창의적 글쓰기에서는 "다른 관점"을 잃지 않는 게 중요합니다.

🎯 최종 메시지:
AI 의 다양성을 되찾으려면, 학습 단계에서 더 다양한 데이터 (교사, 레시피) 를 섞어주는 것이 가장 중요합니다. AI 가 이미 학습을 끝낸 후, 답변 방식을 바꾸거나 "생각"을 강제로 끄는 것만으로는 해결할 수 없습니다.

이 연구는 AI 개발자들에게 **"더 다양한 재료로 배워야, 더 다양한 세상을 보여줄 수 있다"**는 중요한 교훈을 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →