CreativityPrism: A Cross-Domain Evaluation Framework for Large Language Model Creativity
이 논문은 확산적 사고, 창의적 글쓰기, 논리적 추론의 8가지 과업에 대해 세 가지 차원(품질, 참신성, 다양성)을 사용하여 대규모 언어 모델을 평가하는 확장 가능한 교차 도메인 평가 프레임워크인 CreativityPrism을 소개하며, 최첨단 모델들이 글쓰기와 추론에서는 뛰어나지만 확산적 사고에서는 유의미한 우위를 보이지 않고 성능이 서로 다른 창의적 차원 간에 일반화되는 경우가 드물다는 점을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 마법의 텍스트 생성기(대규모 언어 모델, LLM) 도서관이 있다고 상상해 보세요. 모두가 이렇게 묻습니다. "이 기계들이 정말로 창의적인가?"
문제는 "창의성"이라는 개념이 매우 모호하다는 점입니다. 때로는 재미있는 이야기를 쓰는 것을 의미하기도 하고, 때로는 수학 문제를 기발한 방식으로 푸는 것을 의미하며, 때로는 종이클립의 새로운 용도를 생각해 내는 것을 의미하기도 합니다. 이 논문이 나오기 전까지 연구자들은 작업마다 서로 다른 자를 사용하여 창의성을 측정하려 했거나, 인간에게 모든 답변을 채점하도록 요청하곤 했습니다. 하지만 이는 느리고 비용이 많이 드는 일이었습니다.
"CreativityPrism"의 등장.
CreativityPrism을 하나의 고성능 프리즘이라고 생각해 보세요. 우리는 이 프리즘에 빛의 줄기(AI의 출력물)를 통과시킵니다. 그러면 단순히 하얀 덩어리를 보는 대신, 빛이 세 가지 뚜렷한 색깔로 분리되어 기계의 창의성이 가진 진정한 본질을 드러내 줍니다.
창의성의 세 가지 색깔
저자들은 기계가 정말로 창의적인지 이해하려면 세 가지 특정한 방식으로 측정해야 한다고 주장합니다.
- 품질 (Quality - "제대로 작동하는가?"의 색): 이것은 기초입니다. 만약 기계가 앞뒤가 맞지 않는 이야기를 쓰거나 수학 문제를 틀리게 푼다면, 그 아이디어가 아무리 "새롭다" 해도 소용없습니다. 그것은 그저 노이즈일 뿐입니다. 품질은 출력이 실제로 과업을 완수했는지를 측정합니다.
- 참신함 (Novelty - "얼마나 특이한가?"의 색): 이것은 답변이 평범함에서 얼마나 멀어졌는지를 측정합니다. 기계가 인간이 한 번도 본 적 없는 해결책을 제시했나요? 아니면 단순히 학습 데이터에 있는 내용을 복사했을 뿐인가요?
- 다양성 (Diversity - "얼마나 많은 옵션이 있는가?"의 색): 이것은 폭을 측정합니다. 만약 기계에게 10가지 아이디어를 요청했을 때, 그 10가지가 완전히 다른 아이디어인가요, 아니면 그저 약간씩만 다른 10가지 버전인가요?
비유: 요리사를 상상해 보세요.
- 품질: 음식이 맛있고 타지 않았습니다.
- 참신함: 요리사가 아무도 시도해보지 않은 맛의 조합(예: 초콜릿과 피클)을 발명했습니다.
- 다양성: 요리사가 10가지 종류의 디저트를 만들 수 있습니다. 단지 10가지 버전의 초콜릿 케이크를 만드는 것이 아니라 말이죠.
- CreativityPrism은 이 세 가지를 모두 확인합니다. 100가지 다른 버전의 탄 초콜릿 케이크를 만드는 요리사는 다양성은 높지만 품질과 참신함은 낮습니다.
거대한 테스트: 주방 안의 17명의 셰프
저자들은 현재 사용 가능한 가장 똑똑한 AI 모델 17개(OpenAI, Google, Anthropic, DeepSeek 등의 기업 제품)를 선정하여 세 가지 영역에 걸친 8가지 서로 다른 도전 과제에 투입했습니다.
- 확산적 사고 (Divergent Thinking): "벽을 쌓는 것 외에 벽돌로 할 수 있는 일은?"(Alternative Uses Test)과 같은 테스트입니다.
- 창의적 글쓰기 (Creative Writing): 프롬프트에 기반하여 이야기나 시를 쓰는 것입니다.
- 논리적 추론 (Logical Reasoning): 엄격하고 기이한 제약 조건 아래에서 수학 문제를 풀거나 코드를 작성하는 것입니다.
발견된 사실 (반전)
1. "거대 모델 vs 작은 모델"의 격차
거대하고 비싼 AI 모델들("프런티어" 모델)은 일반적으로 창의적 글쓰기와 논리적 추론에 더 뛰어납니다. 이들은 복잡한 레시피를 따르고 아름다운 메뉴판을 쓸 줄 아는 숙련된 셰프와 같습니다. 하지만 확산적 사고(엉뚱하고 관련 없는 아이디어 내기)에 있어서는, 초고가 모델과 작은 오픈 소스 모델 사이의 격차가 거의 사라집니다. 거대 모델이 "틀을 깨는 생각"을 하는 데 있어 반드시 작은 모델보다 더 뛰어나지는 않다는 것입니다.
2. "전문가"의 문제
여기 아주 놀라운 발견이 있습니다. 한 종류의 창의성에 능숙하다고 해서 다른 종류의 창의성에도 능숙하다는 뜻은 아닙니다.
- 어떤 모델은 소설을 쓰는 데는 천재적이지만(높은 품질), 숟가락의 기이한 용도를 생각해 내는 데는 형편없을 수 있습니다(낮은 참신함).
- 어떤 모델은 1,000개의 다양한 답변을 생성할 수는 있지만(높은 다양성), 그중 어느 것도 새롭거나 유용하지 않을 수 있습니다(낮은 참신함).
저자들은 "참신함"이 가장 무작위적인 차원이라는 것을 발견했습니다. 수학 문제에서 "새로운" 것을 잘 낸다고 해서, 이야기에서도 "새로운" 것을 낼 것이라는 보장은 없습니다. 이 둘은 완전히 다른 기술입니다.
3. "심판" 솔루션
인간이 이 모든 테스트를 채점하기에는 너무 느리기 때문에, 저자들은 영리한 트릭을 사용했습니다. 바로 다른 AI들을 사용하여 답변을 채점하게 한 것입니다. 하지만 그들은 AI를 맹목적으로 믿지 않았습니다. 먼저 인간 전문가들이 작은 샘플을 채점하게 하여, "AI 심판"들이 실제로 인간과 일치하는지 확인했습니다. 이는 마치 헤드 셰프가 몇 가지 요리를 직접 맛보며 수셰프들이 음식의 점수를 제대로 매기고 있는지 확인하는 것과 같습니다.
결론
CreativityPrism은 우리가 "이 AI는 창의적이다"라고 단 하나의 모호한 문장으로 말하는 것을 멈추게 해주는 새로운 도구입니다. 대신 이 도구는 다음과 같이 알려줍니다. "이 AI는 좋은 이야기를 쓰는 데는 뛰어나지만, 수학 문제를 창의적으로 푸는 데는 보통이며, 기이하고 관련 없는 아이디어를 내는 데는 별로 좋지 않다."
이는 창의성이 단 하나의 초능력이 아니라, 항상 함께 움직이지 않는 서로 다른 기술들의 집합임을 증证明합니다. 진정으로 창의적인 기계를 만들기 위해서는, 단순히 우연히 모든 것을 잘하기를 바라는 것이 아니라, 이러한 서로 다른 "색깔"의 창의성을 위해 구체적으로 훈련시켜야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.