Are LLMs becoming similarly creative? Evidence from three years of models
이 논문은 3년간의 거대언어모델 출시를 분석하여 개방형 창의적 과업에서 출력 다양성이 통계적으로 유의미하게 감소했음을 발견하였으며, 이는 인간-AI 공동 창작 작업에서 인간의 주체성을 저해할 수 있는 균질화 추세를 시사한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
기술 요약: "LLM은 유사하게 창의적으로 변하고 있는가? 3년간의 모델 데이터를 통한 증거"
문제 제기
수많은 벤치마크가 검증 가능한 정답이 존재하는 과제에 대한 대규모 언어 모델(LLM)의 성능을 추적하고 있지만, 창의성, 독창성, 다양성이 핵심인 개방형 과제에 대한 종단적 데이터는 부족한 실정이다. 기존 연구에 따르면 LLM이 개별적으로는 창의적으로 보일 수 있으나, 서로 다른 모델 간에는 시간이 흐름에 따라 출력물이 서로 유사해지는 집단적 동질성을 보이는 경우가 많다. 그러나 이러한 동질성이 발전하는 기술의 일시적인 산물인지, 아니면 통계적 언어 모델의 필연적인 특징인지는 불분명하다. 현재의 벤치마크(예: MMLU, HELM)는 명시적인 기준과 검증 가능한 정답에 집중되어 있어, 시간이 지남에 따라 창의적 출력물의 다양성이나 독창성의 추세를 포착하지 못한다.
방법론
저자들은 4단계 과정을 통해 LLM 출력 다양성에 대한 예비적 시간적 분석을 수행하였다:
- 프롬프트 선정: 창의적 행동을 유도하기 위해 두 가지 상호 보완적인 개방형 프롬프트 세트를 선정하였다:
- 대안적 용도 과제 (AUT): 일반적인 사물의 비전형적인 용도를 생성하게 하는 표준화된 심리 측정 평가이다.
- Infinity-Chat100: 창의적 콘텐츠 생성, 브레인스토밍, 아이디어 구상 등 6개 카테고리를 아우르는 100개의 실제 사용자 질의 모음이다.
- 데이터 수집: 2023년 3월부터 2026년 7월 사이에 출시된 68개의 모델(12개의 주요 모델 제공업체, 폐쇄형 가중치 모델 33개 및 개방형 가중치 모델 34개)을 대상으로 프롬프트를 실행하였다. 모든 생성 작업에는 확률적 샘플링을 유지하기 위해 temperature와 top-p 값을 1.0으로 설정하였다.
- 의미론적 임베딩: 응답은
all-MiniLM-L6-v2문장 트랜스포머 모델을 사용하여 임베딩되었다. AUT의 경우, 단일 사물에 대한 모든 용도를 하나의 벡터로 임베딩하였으며, Infinity-Chat의 경우 각 응답을 개별적으로 임베딩하였다. - 회귀 분석: 모델 패밀리 간(서로 다른 제공업체의 모델들) 임베딩의 코사인 거리를 계산하여 의미적 발산 정도를 측정하였다. 이 쌍들은 출시 날짜에 따라 9개의 시간적 빈(bin)으로 그룹화되었다. 빈 인덱스에 대한 평균 코사인 거리에 대해 최소제곱법(OLS) 회귀 분석을 수행하였다. 모델 패밀리 구성의 불균형으로 인한 편향을 완화하기 위해, 저자들은 기울기 추정치의 분포를 생성하고자 1,000회의 패밀리 균형 재표본 추출(resampling)을 수행하였다.
주요 기여
- 종단적 프레임워크: 본 논문은 모델 행동의 정적 스냅샷을 넘어, 시간이 경과함에 따라 LLM의 창의적 출력물이 진화하는 과정을 추적하는 최초의 프레임워크를 제공한다.
- 이중 과제 분석: 통제된 심리 측정 과제(AUT)와 실제 사용자 질의(Infinity-Chat100)를 결합함으로써, 구조화된 맥락과 비구조화된 맥락 모두에서 창의성을 평가한다.
- 수렴에 대한 정량적 증거: 본 연구는 LLM의 출력이 시간이 지남에 따라 점점 더 유사해지고 있다는 경험적 증거를 제시하며, 새로운 모델이 본질적으로 더 큰 창의적 다양성을 제공한다는 가설에 도전한다.
결과
분석 결과, 3년간의 관찰 기간 동안 모델 출력의 다양성이 통계적으로 유의미하게 감소하는 것으로 나타났다:
- 추세: AUT와 Infinity-Chat 데이터셋 모두 시간이 지남에 따라 교차 패밀리 코사인 거리가 지속적으로 감소하는 음(-)의 기울기를 보였으며, 이는 의미적 유사성(동질성)이 증가하고 있음을 나타낸다.
- 규모: 감소 폭은 Alternate Uses Task에서 가장 두드러졌는데, 평균 교차 패밀리 거리가 가장 초기 출시 빈의 약 0.50에서 최근 빈의 0.40 미만으로 떨어졌다. Infinity-Chat 데이터셋은 약 0.34에서 0.32로 완만하지만 일관된 감소를 보였다.
- 강건성: 1,000회의 모든 재표본 추출 반복 실험에서 두 데이터셋 모두 음(-)의 기울기가 도출되었으며, 이는 해당 추세가 각 패밀리의 다양한 모델 조합에 걸쳐 강건함을 확인시켜 준다.
의의 및 주장
본 논문은 LLM이 개방형 응답을 요구하는 과제에서 점점 덜 창의적으로 변하고 있다고 상정하며, 이는 모델 간의 창의적 실체(substance)가 수렴하고 있음을 시사한다. 저자들은 만약 이러한 추세가 지속된다면, "LLM 주도의 동질화가 인간-AI 공동 창작 작업에서 인간의 주체성을 점진적으로 약화시킬 수 있다"고 주장한다.
본 연구는 이러한 발견을 예비적 분석으로 규정하며, 인간의 창의적 과정에서 LLM의 역할에 대한 신중한 고려가 필요함을 강조한다. 또한, 이는 "AI 창의성 역설(AI creativity paradox)"을 부각시킨다. 즉, 모델들이 개별적으로는 창의적으로 보일 수 있으나, 그들의 총체적 출력은 점점 덜 다양해지고 있으며, 이는 사용자가 접하는 아이디어의 범위를 제한하고 결과적으로 인간의 다운스트림 창의성에 부정적인 영향을 미칠 수 있다는 것이다. 저자들은 자신들의 작업이 예비적임을 명시하며, 이러한 수렴을 유도하는 근본적인 메커니즘(예: 공유된 학습 데이터 또는 지식 증류)과 구체적인 요인을 조사하기 위한 후속 연구를 촉구한다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.