← 최신 논문
💬 NLP

Diverse, not Short: A Length-Controlled Data Selection Strategy for Improving Response Diversity of Language Models

이 논문은 언어 모델의 짧은 출력물에 대한 체계적 편향을 완화하여, 품질을 유지하면서도 다양한 창의적 작업 전반에서 응답의 다양성과 표현력을 크게 향상시키는 길이 제어형 데이터 선택 전략인 Diverse-NS를 소개한다.

원저자: Vijeta Deshpande, Debasmita Ghose, John D. Patterson, Roger Beaty, Anna Rumshisky

게시일 2026-02-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Vijeta Deshpande, Debasmita Ghose, John D. Patterson, Roger Beaty, Anna Rumshisky

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: "짧고 지루한" 함정

당신에게 매우 재능 있는 작가(거대 언어 모델)가 있다고 상상해 보세요. 이 작가는 유익하고, 안전하며, 예의 바르게 행동하도록 훈련받았습니다. 당신은 그에게 이야기를 써달라고 요청합니다.

문제는, 작가가 "완벽"하고 안전해지려고 노력하는 과정에서 마치 시험을 치르는 불안한 학생처럼 행동하기 시작했다는 점입니다. 그들은 짧은 답변이 더 좋은 답변이라고 생각하기 때문에 길게 쓰는 것을 두려워합니다.

왜 그럴까요? 그들의 결과물을 채점하는 도구(다양성 지표)들이 고장 났기 때문입니다. 이 도구들은 마치 3단어짜리 문장이 30단어짜리 문단보다 더 "창의적"이라고 생각하는 심판과 같습니다. 작가는 이를 눈치채고, 좋은 점수를 받기 위해 당신에게 짧고 안전하며 반복적인 답변만을 내놓기 시작합니다.

저자들은 이를 **"간결성 편향(Brevity Bias)"**이라고 부릅니다. 이는 마치 요리사가 맛을 보는 사람이 담백한 음식만 좋아한다는 이유로 양념을 넣는 것을 그만두는 것과 같습니다. 그 결과, AI는 창의성과 표현력이 떨어지게 되며, 결국 모든 AI의 출력물이 똑같이 들리게 되는 현상(이를 "모델 붕괴"라고 합니다)이 발생합니다.

해결책: "짧은 것이 아니라 다양한 것" (Diverse, not Short - Diverse-NS)

저자들은 **"짧은 것이 아니라 다양한 것(Diverse, not Short, 이하 Diverse-NS)"**이라는 새로운 전략을 만들었습니다. 이것은 고장 난 채점 시스템을 바로잡는 작가를 위한 새로운 훈련 프로그램이라고 생각하면 됩니다.

작동 방식은 다음과 같습니다.

  1. "두 가지 초안" 게임:
    연구진은 AI에게 이야기를 두 번 쓰도록 요청합니다.

    • 초안 A: AI가 자연스럽게 씁니다 (기본적인, 종종 지루한 스타일).
    • 초안 B: AI에게 특정 규칙을 적용하여 다시 쓰도록 요청합니다: "더 흥미롭고 다양하게 만들되, 초안 A와 정확히 같은 길이로 유지할 것."
  2. "공정한 심판" 필터:
    보통 더 창의성을 요구하면 텍스트가 길어집니다. 하지만 연구진은 엄격한 규칙을 세웠습니다. 만약 초안 B가 초안 A보다 길다면, 버리십시오.
    그들은 "더 창의적인" 버전이 "지루한" 버전과 거의 같은 길이를 유지하는 쌍(pair)만을 남깁니다. 이를 통해 AI에게 가르칩니다: "길게 늘어지지 않고도 창의적일 수 있다."

  3. "작은 스승" 기법:
    연구진은 놀라운 사실을 발견했습니다. 더 작고 저렴한 AI 모델(예: 70억 파라미터 모델)이 훨씬 더 크고 비싼 모델(예: 130억 파라미터 모델)을 위한 "다양성 스승" 역할을 할 수 있다는 것입니다.

    • 비유: 작은 규모의 재기 넘치는 지역 예술가가 유명하고 거대한 자본을 가진 스튜디오에 더 독특하게 그림 그리는 법을 가르친다고 상상해 보세요. 작은 예술가는 규칙을 창의적으로 깨는 법을 알고 있고, 큰 스튜디오는 그들로부터 배웁니다. 이는 많은 비용과 컴퓨팅 자원을 절약해 줍니다.

결과: 풍미는 더하고, 크기는 그대로

연구진은 네 가지 다른 창의적 과업에 대해 이를 테스트했습니다:

  • 확산적 연상(Divergent Associations): 서로 매우 다른 단어들을 나열하기.
  • 페르소나 생성(Persona Generation): 독특한 캐릭터 프로필(이름, 직업, 도시) 만들기.
  • 대안적 용도(Alternate Uses): 흔한 물건(예: 벽돌)을 사용하는 기발한 방법 생각하기.
  • 창의적 글쓰기(Creative Writing): 세 가지 무작위 단어를 사용하여 짧은 이야기 쓰기.

어떤 결과가 나왔을까요?

  • 더 높은 다양성: "Diverse, not Short"로 훈련된 모델은 훨씬 더 다양하고 흥여로운 결과물을 만들어냈습니다. 더 독특한 단어와 아이디어를 사용했습니다.
  • 품질 저하 없음: 보통 무언가를 더 다양하게 만들면 품질이 떨어지기 마련입니다(마치 엉망이고 혼란스러운 이야기처럼). 하지만 여기서는 품질이 높게 유지되었습니다. 어떤 경우에는 오히려 더 좋아지기도 했습니다.
  • 효율성: 이 새로운 기술을 가르치기 위해 단 3,000개의 예시만 필요했습니다. 이는 학생에게 몇 년 동안 가르치는 대신 몇 시간 동안 가르치는 것과 같습니다.

새로운 도구: "다양성 데실(Diversity Decile)"

저자들은 또한 기존의 창의성을 측정하는 도구들이 긴 답변에 불공평하다는 것을 깨달았습니다. 그래서 그들은 **"다양성 데실(Diversity Decile)"**이라는 새로운 자를 발명했습니다.

  • 비유: 경주를 상상해 보세요. 기존의 자는 단순히 얼마나 빨리 달렸는지만 측정했지만, 어떤 러너는 무거운 배낭(긴 텍xt)을 메고 있고 어떤 러너는 그렇지 않다는 점을 무시했습니다.
  • 새로운 자: "다양성 데실"은 동일한 크기의 배낭을 멘 다른 러너들과 비교하여 얼마나 빨리 달렸는지를 봅니다. 즉, "이 긴 이야기가 다른 긴 이야기들보다 더 창의적인가?"를 묻습니다. 이를 통해 길고 표현력이 풍부한 답변들이 마땅히 받아야 할 인정을 받을 수 있도록 보장합니다.

요약

이 논문은 우리가 "창의성"을 측정하는 방식이 의도치 않게 간결함을 보상하기 때문에 AI 모델들이 너무 짧고 반복적으로 변해왔다고 주장합니다.

**"짧은 것이 아니라 다양한 것(Diverse, not Short)"**이라는 전략을 통해, 저자들은 모델이 답변을 더 길게 만들지 않고도 창의적일 수 있도록 가르쳤습니다. 그들은 다음과 같이 수행했습니다:

  1. 지루한 초안과 같은 길이의 창의적인 초안을 비교했습니다.
  2. 더 작고 저렴한 AI를 사용하여 더 큰 AI에게 다양해지는 법을 가르쳤습니다.
  3. 긴 답변을 불이익 주지 않는, 더 공정한 새로운 측정 도구를 만들었습니다.

그 결과, AI는 더 표현력이 풍부하고, 더 창의적이며, 여전히 높은 품질을 유지하면서도, 훈련 비용이 저렴하고 속도가 빠른 모델이 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →