← 최신 논문
💬 NLP

Sampling More, Getting Less: Calibration is the Diversity Bottleneck in LLMs

본 논문은 대규모 언어 모델의 다양성 붕괴가 샘플링 휴리스틱의 한계가 아니라 디코딩 중 확률 분포의 순서와 형태 보정 오류에 주로 기인하며, 이로 인해 출력 유효성과 다양성 간의 트레이드오프가 발생함을 규명한다.

원저자: Amin Banayeeanzade, Qingchuan Yang, Dhruv Tarsadiya, Fatemeh Bahrani, Leonardo Blas, Alfy Samuel, Robin Jia, Meisam Razaviyayn, Sai Praneeth Karimireddy

게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Amin Banayeeanzade, Qingchuan Yang, Dhruv Tarsadiya, Fatemeh Bahrani, Leonardo Blas, Alfy Samuel, Robin Jia, Meisam Razaviyayn, Sai Praneeth Karimireddy

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델 (LLM) 에게 이야기를 들려주거나 시를 쓰거나 무작위 도시를 제안해 달라고 요청한다고 상상해 보세요. 여러분은 다양한 창의적인 답변을 기대할 것입니다. 하지만 대신 모델은 종종 고착되어 같은 몇 가지 진부한 표현을 반복적으로 제시합니다 (예: "옛날 옛적에..." 또는 "칠레 발파라이소").

이 논문은 이러한 현상이 발생하는지 조사합니다. 저자들은 이 문제가 단순히 모델이 "지루하다"거나 단어를 선택하는 현재의 도구들 (샘플링 방법) 이 나쁘기 때문이 아니라고 주장합니다. 대신 문제는 모델이 자신의 내부 확률 지도를 조직화하는 방식에 내재되어 있습니다. 저자들은 이를 **"보정 병목 현상 (Calibration Bottleneck)"**이라고 부릅니다.

이를 설명하기 위해, 모델이 모든 가능한 다음 단어들이 진열된 거대한 책장 앞에 서 있는 사서라고 상상해 보세요. 사서는 이야기를 이어가기 위해 다음 단어를 선택해야 합니다.

두 가지 주요 문제

이 논문은 이 사서가 현실과 불일치하는 ("오보정된") 두 가지 구체적인 방식을 식별하며, 이로 인해 다양성이 붕괴된다고 설명합니다.

1. 순서 보정 (Order Calibration): 사서가 책을 정렬할 수 없다

비유:
사서에게 "좋은" 책을 골라달라고 요청한다고 가정해 보세요. 여러분은 사서가 모든 "좋은" 책을 선반 맨 위에, 모든 "나쁜" 책을 맨 아래에 배치할 것이라고 기대합니다.

  • 모델이 하는 일: 사서는 일부 좋은 책을 맨 위에 두지만, 그 바로 아래에 나쁜 책들을 섞어 넣습니다. 그리고 선반 더 아래쪽에는 나쁜 책들 사이에 숨겨진 더 많은 좋은 책들이 있습니다.
  • 결과: 만약 사서에게 "상위 10 권만 주세요"라고 말하면, 좋은 책 5 권과 나쁜 책 5 권을 받게 될 수 있습니다. "안전起见 상위 100 권을 주세요"라고 하면 90 권의 나쁜 책을 받게 됩니다.
  • 논문의 주장: 모델은 순서 보정에 실패합니다. "유효한" (올바르고 의미 있는) 단어를 "무효한" (말도 안 되는) 단어보다 신뢰성 있게 상위에 배치하지 못합니다. 유효한 단어와 무효한 단어가 순위에서 섞여 있기 때문에, 이 목록을 필터링하려는 어떤 도구 (예: "Top-K" 또는 "Top-P") 라도 끔찍한 선택을 강요받습니다. 나쁜 아이디어를 피하기 위해 좋은 아이디어를 잘라내거나, 좋은 아이디어를 살리기 위해 너무 많은 나쁜 아이디어를 포함해야 하는 선택입니다.

2. 형태 보정 (Shape Calibration): 사서가 한 권의 책에 집착한다

비유:
이제 사서가 나쁜 책과 좋은 책을 분리하는 데 성공했다고 상상해 보세요. 하지만 "좋은" 더미를 살펴볼 때, 사서는 단 한 권의 특정 책에만 집착합니다.

  • 모델이 하는 일: 사서는 90% 의 관심을 한 권의 특정 "좋은" 책 (예: "옛날 옛적에") 에 쏟습니다. 나머지 99 권의 "좋은" 책들은 아주 미세한 관심만 받습니다. 반면, "나쁜" 책들은 맨 아래에 길고 얇은 꼬리로 흩어져 있습니다.
  • 결과: 만약 여러분이 ("온도"를 사용하여 사서에게 더 무작위적으로 행동하라고 지시하는 것처럼) 상황을 바꾸려고 시도하더라도, 사서는 단지 집착 대상을 약간 바꿀 뿐입니다. "옛날 옛적에"에 집착하는 것을 멈추고 "어떤 세계에서는..."에 집착하기 시작할 수 있지만, 여전히 나머지 98 개의 좋은 옵션은 무시합니다. 더 나쁘게는, 사서를 더 무작위적으로 만드는 것은 종종 희귀한 "좋은" 책 대신 긴 꼬리에 있는 "나쁜" 책을 선택하게 만듭니다.
  • 논문의 주장: 모델은 형태 보정에 실패합니다. 확률이 소수의 특정 유효 옵션에 지나치게 집중되어 나머지 유효 옵션들이 관심을 받지 못하게 됩니다.

연쇄 효과: 하나의 실수가 재앙이 되는 이유

이 논문은 이러한 문제들이 이야기가 길어질수록 더 악화된다고 설명합니다.

비유:
미로를 걷고 있다고 상상해 보세요.

  • 1 단계: 첫 번째 갈림길에서 올바른 경로를 선택할 확률은 90% 이고, 막다른 길에 빠질 확률은 10% 입니다. 이는 괜찮아 보입니다.
  • 2 단계: 다음 갈림길에서도 다시 올바른 길일 확률은 90% 입니다.
  • 결과: 20 번의 갈림길을 지나야 한다면, 막다른 길에 한 번도 부딪히지 않고 전체 경로를 올바르게 통과할 확률은 거의 0 에 수렴합니다.

이 논문은 수학적으로 증명합니다. 모델이 매 단계마다 작은 실수를 (단어의 잘못된 혼합을 선택하거나 한 단어에 지나치게 집중하는) 하기 때문에, 이러한 실수들이 누적된다는 것입니다. 모델이 문장이나 단락을 끝낼 때쯤이면, 진정으로 다양하고 유효한 경로를 탐색했을 확률은 기하급수적으로 희미해집니다.

그들이 무엇을 했는가?

연구자들은 단순히 추측한 것이 아니라 "진단 도구 상자"를 구축했습니다:

  1. 통제된 테스트: 그들은 모델에게 정확한 정답 목록을 알고 있는 간단한 작업 (무작위 숫자 생성 또는 미국 주 이름 나열 등) 을 부여했습니다.
  2. "오라클 (Oracle)" 테스트: 그들은 어떤 단어가 유효한지 정확히 아는 완벽한 필터를 만들었습니다. 이 완벽한 필터가 있음에도 불구하고, 모델들은 여전히 "형태" 문제 (한 단어에 대한 집착) 로 인해 다양성을 유지하는 데 어려움을 겪었습니다.
  3. 판결: 그들은 작고 거대한 14 개의 서로 다른 모델을 테스트했습니다. 그들은 더 큰 모델들이 문제를 해결하지 못했다는 것을 발견했습니다. 가장 똑똑한 모델들조차도 이러한 정렬 및 집중 문제를 여전히 가지고 있었습니다.

결론

이 논문은 AI 의 다양성 부족이 "선택" 도구 (온도나 Top-K 샘플링 등) 의 버그가 아니라고 결론지었습니다. 이는 모델이 자신의 신뢰도를 분배하는 방식에 근본적인 결함이 있습니다.

  • 모델은 유효한 단어를 무효한 단어보다 신뢰성 있게 정렬할 수 없습니다.
  • 모델은 모든 유효한 단어에 관심을 골고루 분배할 수 없습니다.

모델이 내부 도서관을 다르게 조직화하는 법을 배우기 전까지는, 단순히 설정을 조정하는 것만으로는 진정한 창의성이나 다양성을 unlocking 할 수 없습니다. "병목 현상"은 우리가 모델을 읽는 도구가 아니라 모델 자체의 분포에 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →