Rethinking Creativity Evaluation: A Critical Analysis of Existing Creativity Evaluations
이 논문은 다양한 영역에 걸쳐 네 가지 일반적인 창의성 평가 지표를 비판적으로 분석하여, 이들이 보이는 상당한 불일치, 영역별 한계, 그리고 인간의 판단과의 불일치를 밝힘으로써 더욱 견고하고 일반화 가능한 프레임워크의 시급한 필요성을 강조한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 세상에서 가장 창의적인 작가, 문제 해결사, 그리고 과학자를 찾으려는 인재 발굴 전문가라고 상상해 보십시오. 당신에게는 엄청난 양의 응모작이 쌓여 있지만, "천재적인" 것들과 "지루한" 것들을 빠르게 분류할 방법이 필요합니다. 사람이 일일이 읽기에는 너무 많기 때문에, 당신은 이 분류를 대신해 줄 네 가지 서로 다른 자동화 도구(지표)를 사용하기로 결정했습니다.
이 논문은 본질적으로 그 네 가지 도구에 대한 성적표입니다. 저자들은 이 도구들이 실제로 작동하는지 테스트했으며, 나쁜 소식은 다음과 같습니다: 그것들은 모두 상당히 신뢰할 수 없다는 것입니다.
다음은 테스트한 네 가지 도구와 그것들이 실패한 이유를 쉬운 비유를 들어 설명한 내용입니다.
테스트된 네 가지 도구
1. "복사-붙여넣기" 탐지기 (창의성 지수 - Creativity Index)
- 작동 방식: 이 도구는 인터넷을 스캔하여 특정 문장이 이전에 작성된 적이 있는지 확인합니다. 만약 어떤 구절이 독특하고 거대한 데이터베이스에 나타나지 않는다면, 높은 "창의성" 점수를 부여합니다.
- 문제점: 이것은 요리사의 창의성을 오직 그가 사용한 재료 중 다른 누구도 사본 적 없는 재료가 얼마나 많은가로만 판단하는 것과 같습니다.
- **창의적 글쓰기(Creative Writing)**에서는 독특한 단어가 참신한 이야기를 의미할 수 있기 때문에 괜찮게 작동했습니다.
- **문제 해결(Problem Solving)**과 과학(Science) 분야에서는 처참하게 실패했습니다. 뛰어난 새로운 과학적 아이디어는 매우 흔하고 표준적인 단어들(예: "실험" 또는 "데이터")을 사용할 수 있는데, 이 도구는 이를 지루하다고 판단합니다. 반대로, 작가가 멋져 보이기 위해 기이하고 생소한 단어를 사용하면, 이 도구는 이를 천재적이라고 생각합니다. 이 도구는 아이디어의 참신함이 아니라 어휘의 다양성을 측정하는 것입니다.
2. "놀람 측정기" (퍼플렉서티 - Perplexity)
- 작동 방식: 이 도구는 컴퓨터가 문장의 다음 단어를 예측할 때 얼마나 "놀랄지"를 추측합니다. 텍스트가 매우 예측 가능하다면 점수는 낮아집니다. 만약 텍스트가 이상하고 예상 밖이라면 점수는 높아집니다. 즉, 창의성 = 놀라움이라는 아이디어입니다.
- 문제점: 이것은 코미디언을 평가할 때 관객이 얼마나 자주 당황해서 숨을 들이켜는지로만 판단하는 것과 같습니다.
- 때때로 텍스트가 높은 점수(매우 놀라운 수준)를 받는 이유는, 그것이 창의적이어서가 아니라 문법적으로 엉망이거나 터무니없기 때문입니다.
- 때로는 정말 뛰어나고 명료한 아이디어가 매우 매끄럽고 읽기 쉽게 작성되어, 도구가 낮은 점수를 주기도 합니다.
- 저자들은 "창의적인" 텍스트와 "비창의적인" 텍스트가 정확히 같은 점수를 받는다는 것을 발견했으며, 이는 이 도구가 둘을 구별하는 데 무용지물임을 보여줍니다.
3. "문장 구조 스캐너" (통사적 템플릿 - Syntactic Templates)
- 작동 방식: 이 도구는 문장의 뼈대(예: "그 [명사]가 [형용사]한 [명사]를 [동사]하다")를 살펴봅니다. 그리고 작성자가 동일한 문장 패턴을 반복해서 사용하고 있는지 확인합니다.
- 문제점: 이것은 화가가 그린 그림은 무시한 채, 오직 붓질의 모양만으로 화가를 평가하는 것과 같습니다.
- 창의적 글쓰기에서 이 도구는 AI가 흔히 사용하는 반복적이고 정형화된 문장 구조(예: "영웅의 여정은 ~할 때 시작되었다...")를 잡아냈습니다.
- 그러나 과학과 문제 해결 분야에서 전문가들은 명확성과 정밀함을 유지하기 위해 표준적이고 정형화된 언어를 사용할 필요가 있습니다. 이 도구는 그들이 규칙을 따랐다는 이유로 그들을 비창의적이라고 간주하며 벌점을 주었습니다.
4. "AI 판사" (LLM-as-a-Judge)
- 작동 방식: 다른 AI를 사용하여 마치 인간 교사가 하듯 작업물을 읽고 등급을 매깁니다.
- 문제점: 이것은 학생에게 다른 학생의 숙제를 채점하게 하는 것과 같습니다. 그들은 일관성이 없고 쉽게 속습니다.
- 압박 가능성(Squeezable): 질문을 약간만 바꿔도(예: "이것은 창의적인가?" vs "이것은 비창의적인가?") AI는 완전히 입장을 바꿉니다.
- 편향성(Biased): 실제 품질과 상관없이 한쪽 방향으로 치우치는 경향이 있습니다(예: 항상 "아니오, 이것은 창의적이지 않습니다"라고 답함).
- 불확실성(Unreliable): 동일한 에세이에 대해 세 번 채점을 요청했을 때, AI가 스스로의 답변에 동의한 비율은 40%에 불과했습니다. 그것은 기본적으로 추측을 하고 있는 것입니다.
큰 그림 (The Big Picture)
저자들은 이 도구들을 세 가지 유형의 창의성에 적용했습니다:
- 창의적 글쓰기 (이야기, 시).
- 문제 해결 (일상적인 물건을 사용하는 기발한 방법 찾기).
- 연구 아이디어 구상 (새로운 과학적 이론 제시).
결과: 단 하나의 도구도 이 세 가지 모두를 위해 작동하지 않았습니다. 창의적인 이야기를 포착하는 데 좋은 도구가 창의적인 과학적 아이디어를 포착하는 데는 형편없는 성능을 보였습니다. 때로는 도구들이 정확히 동일한 텍스트에 대해 서로 상반된 결과를 내놓기도 했습니다.
결론
이 논문의 결론은 우리가 현재 진정한 창의성을 자동으로 측정할 수 있는 신뢰할 만한 방법을 가지고 있지 않다는 것입니다.
- 현재의 도구들은 주로 단어 선택, 문장 길이, 또는 텍스트가 얼마나 "이상하게" 보이는지와 같은 표면적인 것들을 측정합니다.
- 이 도구들은 텍스트 뒤에 숨겨진 실제 아이디어나 개념을 측정하는 데 실패합니다.
- 컴퓨터가 이러한 수치들을 바탕으로 무언가를 "창의적"이라고 말한다고 해서, 그것이 반드시 인간이 동의한다는 뜻은 아닙니다.
저자들은 본질적으로 이렇게 말하고 있습니다: "우리는 이러한 단순한 수학적 트릭에 의존하는 것을 멈춰야 합니다. 인간(또는 기계)의 창의성을 판단할 수 있을 만큼 우리는 단어가 아닌 아이디어를 이해하는 더 나은 시스템을 구축해야 합니다."
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.