← 최신 논문
🤖 machine learning

Escaping the Mode Lottery: Multi-Response Training Improves Language Model Generalization

이 논문은 다중 응답 훈련(Multi-Response Training, MRT)을 표준적인 단일 응답 미세 조정에 대한 통계적으로 근거 있는 대안으로 소개하며, 프롬프트당 여러 개의 유효한 완성을 유지하는 것이 원칙적인 분산 예산 트레이드오프와 최적의 응답 선택 전략을 통해 조건부 출력 분포를 더 잘 포착하고 "모드 로터리(mode lottery)"를 피함으로써 언어 모델의 일반화 성능을 향상시킨다는 것을 입증한다.

원저자: Hasan Amin, Kian Ahrabian, Ming Yin, Rajiv Khanna

게시일 2026-06-02
📖 5 분 읽기🧠 심층 분석

원저자: Hasan Amin, Kian Ahrabian, Ming Yin, Rajiv Khanna

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 학생에게 이야기를 쓰는 법을 가르치고 있다고 상상해 보세요. 예전 방식(논문에서 **단일 응답 훈련(Single-Response Training)**이라고 부르는 방식)에서는, 당신은 학생에게 "고양이에 대한 이야기를 써보렴"이라는 프롬프트를 주고, 좋은 이야기의 예시를 하나 보여줍니다. 그리고 당신은 말합니다. "이것이 정답이야."

문제는 단 하나의 정답만 존재하는 것이 아니라는 점입니다. 당신은 재미있는 이야기를 쓸 수도 있고, 슬픈 이야기를, 미스터리를, 혹은 공상 과학 모험담을 쓸 수도 있습니다. 단 하나의 버전만을 보여줌으로써, 당신은 **"모드 로터리(Mode Lottery, 최빈값 복권)"**를 하는 셈입니다. 이는 "우리가 선택해서 보여준 이 특정 이야기가 운 좋게 뽑힌 것이다"라고 말하는 것과 같습니다. 만약 학생이 오직 한 종류의 이야기만 보게 된다면, 그들은 그것이 고양이에 대해 쓸 수 있는 유일한 방법이라고 생각할 수 있으며, 다른 모든 유효하고 창의적인 가능성들을 놓치게 될 것입니다.

이 논문은 **다중 응답 훈련(Multi-Response Training, MRT)**이라는 새로운 교육 방식을 제안합니다. 하나의 이야기를 보여주는 대신, 동일한 프롬프트에 대해 서로 다르면서도 똑같이 훌륭한 여러 개의 이야기를 보여주는 것입니다.

다음은 이 논문의 주요 아이디어들을 쉬운 비유를 통해 정리한 내용입니다.

1. 두 가지 유형의 "질문"

저자들은 두 가지를 명확히 구분합니다:

  • 프롬프트 (질문): 당신이 묻는 다양한 주제들입니다 (예: "시를 써줘", "이 코드를 수정해줘", "여행 계획을 세워줘").
  • 응답 (답변): 동일한 질문에 답할 수 있는 다양한 방식들입니다.

비유: 당신이 요리사라고 상상해 보세요.

  • 새로운 프롬프트는 새로운 재료를 얻는 것과 같습니다 (새로운 채소, 새로운 향신료). 이것은 당신에게 세상의 다양성을 가르쳐 줍니다.
  • 새로운 응답은 동일한 재료에 대한 서로 다른 레시피를 보는 것과 같습니다 (예: 감자를 요리하는 5가지 다른 방법). 이것은 당신에게 단일 주제에 대한 깊이를 가르쳐 줍니다.

논문은 만약 당신이 많은 종류의 재료(프롬프트)를 가지고 있더라도 각 재료마다 하나의 레시피만 가지고 있다면, 요리의 잠재력을 온전히 배우지 못한다고 주장합니다. 당신은 하나의 감자를 요리할 수 있는 모든 방법(조건부 분포)을 이해하기 위해 여러 개의 레시피를 볼 필요가 있습니다.

2. "분산 예산(Variance-Budget)" 법칙 (언제 더 많은 답변을 보여줄 것인가)

당신은 "왜 모든 질문에 대해 100개의 답변을 보여주지 않나요?"라고 생각할 수 있습니다. 논문은 다음과 같이 말합니다: "아니요, 그것은 돈 낭비입니다."

그들은 "분산 예산(Variance-Budget)" 개념을 도입했습니다. 당신의 훈련 예산을 식료품 예산이라고 생각해 보세요.

  • 프롬프트는 비쌉니다: 새로운, 독특한 질문을 작성하는 데는 인간의 노력, 시간, 그리고 비용이 듭니다.
  • 응답은 저렴합니다: 일단 질문이 하나 있으면, 컴퓨터는 매우 빠르고 저렴하게 50개의 서로 다른 답변을 생성할 수 있습니다.

규칙:

  • 만약 하나의 질문에 대한 답변들이 모두 매우 유사하다면(낮은 다양성), 더 많은 답변을 보여주는 것은 큰 도움이 되지 않습니다. 그것은 마치 똑같은 고양이 사진 50장을 보여주는 것과 같으며, 새로운 것을 배우지 못합니다.
  • 만약 답변들이 매우 다르다면(높은 다양성), 더 많은 답변을 보여주는 것은 엄청난 이득입니다. 그것은 마치 감자를 요리하는 50가지 다른 방법을 보여주는 것과 같으며, 많은 것을 배울 수 있습니다.

논문은 당신이 몇 개의 답변(KK)을 유지해야 하는지 정확히 알려주는 간단한 공식을 제공합니다. 이는 다음 두 가지에 달려 있습니다:

  1. 답변들이 서로 얼마나 다른가 (다양성).
  2. 새로운 질문을 얻는 비용과 새로운 답변을 얻는 비용의 비율.

최적의 지점: 답변이 저렴하고 다양하며, 질문이 비싸다면, 질문당 많은 답변을 유지해야 합니다. 만약 답변들이 모두 같다면, 단 하나만 유지하십시오.

3. "모드 로터리(Mode Lottery)"의 함정

논문은 만약 당신이 점수(예: 보상 시스템)를 기준으로 오직 "최고의" 답변만을 선택한다면, 실수로 모델을 망칠 수 있다고 경고합니다.

비유: 오직 "A+" 에세이만 보여주는 선생님을 상상해 보세요.

  • 함정: 학생은 A+를 받는 방법이 단 하나뿐이라고 배웁니다. 그들은 창의적으로 시도하거나 다른 유효한 글쓰기 방식을 탐구하는 것을 멈춥니다. 그들은 단 하나의 스타일을 복사하는 데로 "붕괴(collapse)"됩니다.
  • 논문의 해결책:
    • 무작위 선택 (안전한 선택): 그냥 KK개의 답변을 무작위로 뽑습니다. 이것은 편향되지 않았으며 모델에게 전체적인 가능성의 범위를 가르쳐 줍니다.
    • 보상 기반 선택 (위험한 선택): 가장 높은 점수를 받은 답변들만 뽑는 것입니다. 이는 모델이 다른 모든 유효한 방식들을 잊어버리게 만드는 "모드 로터리" 문제를 일으킬 수 있습니다.
    • "GRADES" 방식: 스마트한 절충안입니다. 품질이 높으면서도 서로 다른 답변들을 선택하여, 모델이 단 하나의 스타일에 갇히지 않고도 다양하고 좋은 옵션들을 볼 수 있도록 보장합니다.

4. "암시적(Implicit)" 지름길

논문은 거대한 데이터셋에 대해 흥미로운 점을 발견했습니다. 때로는 하나의 프롬프트에 대해 명시적으로 여러 답변을 보여줄 필요가 없습니다. 만약 당신이 방대한 목록을 가지고 있다면, 많은 질문이 사실상 같은 질문의 재구성된 버전일 것입니다 (예: "누수가 어떻게 고쳐지나요?" vs "싱크대가 물이 새요, 도와주세요!").

비유: 만약 100명의 서로 다른 사람들이 당신에게 신발 끈 묶는 법을 묻고, 당신이 그들에게 각각 하나의 답변만 준다고 해도, 질문들이 약간씩 다르다면 모델은 그 약간씩 다른 질문들을 통해 신발 끈을 묶는 "여러 가지 방법"을 여전히 배울 수 있습니다. 이것을 **암시적 다중 응답 훈련(Implicit Multi-Response Training)**이라고 합니다. 하지만 논문은 질문들이 진정으로 달라야만 이 방식이 작동한다고 말합니다. 질문들이 단순히 복사해서 붙여넣은 수준이라면 도움이 되지 않습니다.

요약: 당신은 무엇을 해야 하는가?

논문은 AI 모델을 훈련시키는 모든 이들을 위한 간단한 가이드를 결론으로 제시합니다:

  1. 단순히 문제에 더 많은 데이터를 들이붓지 마십시오. 중요한 것은 단어의 숫자가 아니라, 답변의 다양성입니다.
  2. 다양성을 확인하십시오. 당신의 질문들이 많은 유효한 답변을 가지고 있다면, 단 하나만 보여주는 것을 멈추십시오. 2개, 4개, 혹은 8개를 보여주십시오.
  3. 예산을 고려하십시오. 새로운 질문을 얻는 것이 어렵고 비싸지만, 답변을 생성하는 것이 쉽고 저렴하다면, 하나의 질문당 여러 개의 답변을 보여주는 쪽으로 무게를 두십시오.
  4. 답변을 현명하게 선택하십시오. 만약 당신이 AI가 인간 언어의 전체 범위를 이해하기를 원한다면, 답변을 무작위로 뽑거나 다양성을 확보하십시오. 만약 "가장 높은 보상"을 주는 답변만 고른다면, 실수로 AI를 좁고 반복적인 방식으로 가르치게 될 수 있습니다.

요약하자면, MRT는 많은 질문에 대해 단 하나의 "정답"이 있는 것이 아니라, 유효한 것들의 전체 스펙트럼이 존재한다는 것을 가르침으로써 "모드 로터리"에서 벗어납니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →