Why Large Language Models and Humans Converge and Diverge in Evaluating Creativity
이 논문은 대규모 언어 모델(LLM)이 참신성과 같은 내재적 특성에 대해서는 인간의 창의성 평가와 일치하는 반면, 모델 특유의 좁은 기준에 의존하고 맥락 정보에 둔감하다는 점 때문에 상당한 차이를 보이며, 이는 창의성 평가를 위한 특정 LLM 평가 모델의 선택이 중대한 결정임을 드러낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대하고 시끌벅적한 미술관에 있다고 상상해 보세요. 그곳의 모든 사람들은 어떤 그림이 "창의적"인지 맞히려고 애쓰고 있습니다. 어떤 이들은 오직 물감과 붓터치만을 보고, 다른 이들은 누가 그렸는지, 가격이 얼마인지, 혹은 현재 유행하는 것인지에 주목합니다. 아주 오랫동안 인간만이 이 미술관의 심판 역할을 해왔습니다. 하지만 이제, 새로운 종류의 심판이 도착했습니다. 바로 대규모 언어 모델(LLM)입니다. LLM을 인류가 쓴 거의 모든 책, 기사, 웹사이트를 읽은 초지능 로봇이라고 생각해 보세요. 이 로봇은 인간이 말하는 것에 대해 매우 많은 것을 알고 있기 때문에, 인간처럼 창의성을 판단할 수 있을 것이라고 우리는 기대했습니다. 하지만 여기에는 미스터리가 있습니다. 때때로 로봇은 우리와 의견이 일치하지만, 때로는 완전히 다른 그림을 보고 있는 것처럼 보이기도 합니다. 과학자들은 로봇이 언제 우리처럼 생각하고, 언제 자신의 생각 속에 갇혀 길을 잃는지 알고 싶어 합니다. 이 논문은 우리가 이 디지털 심판들을 우리의 창의성 경연 대회에서 우승자를 뽑는 데 신뢰할 수 있는지 확인하기 위해 이 질문을 파고듭니다.
연구진은 이 로봇 심판들이 정확히 어떤 규칙을 따르는지 알아내고자 했습니다. 그들은 단순히 "이것이 창의적인가?"라고 묻지 않았습니다. 대신 로봇들에게 "이것은 새로운가?", "이것은 유용한가?", 혹은 "이것은 유명한가?"와 같이 인간이 보통 고려하는 26가지 서로 다른 요소들의 중요도를 순위 매기도록 요청했습니다. 그들은 가장 인기 있는 6개의 LLM(GPT, Grok, DeepSeek, ERNIE, Claude, Gemini)을 테스트하여 그 답변을 실제 인간의 답변과 비교했습니다.
여기서 그들이 발견한 커다란 놀라움이 있습니다. 로봇들은 모두 똑같이 생각하는 것도 아니고, 우리와 똑같이 생각하는 것도 아니라는 점입니다. 인간은 아이디어 자체와 더불어 세상의 맥락(예: 평판이나 시장 트렌드)까지 아우르는 넓은 그물을 사용하여 창의적인 아이디어를 포착하는 반면, 로봇은 주로 아이디어 자체만을 봅니다. 구체적으로, 로봇들은 **새로움(novelty)**에 집착합니다. 아이디어가 새롭거나, 기이하거나, 예상치 못한 것이라면 로봇들은 그것을 매우 좋아합니다. 또한 아이디어가 재미있거나 예술적일 때도 좋아합니다. 하지만 "맥락적" 단서, 즉 제품이 유명한 브랜드로부터 나왔는지, 대중적인 히트 상품인지, 혹은 유행하는 것인지와 같은 부분에 대해서는 로봇들이 거의 무시합니다. 인간에게 유명한 브랜드는 어떤 아이디어를 더 창의적으로 보이게 만들 수 있지만, 로봇에게 그것은 그저 소음일 뿐입니다.
이 연구는 또한 모든 로봇이 동일하게 만들어진 것은 아니라는 사실을 밝혀냈습니다. GPT나 Grok 같은 모델은 "더 넓은 그물"을 가지고 있습니다. 이들은 인간의 26가지 기준 중 더 많은 것을 살펴보기 때문에 그들의 판단은 인간의 의견과 꽤 잘 일치합니다. 반면, Claude나 Gemini 같은 모델은 "더 좁은 그물"을 가지고 있습니다. 이들은 핵심 아이디어에 엄격하게 집중하며 그 외의 거의 모든 것을 무시합니다. 이는 만약 당신이 좁은 그물을 가진 로봇에게 창의적인 아이디어를 심사하도록 요청한다면, 그 로봇이 인간이 중요하게 여기는 사회적 또는 시장적 맥락을 무시하기 때문에 인간의 생각과는 동떨어진 결과를 낼 수 있음을 의미합니다.
이를 증명하기 위해 연구진은 두 가지 추가 테스트를 실시했습니다. 첫 번째 테스트에서 그들은 인간과 로봇에게 1,100개 이상의 아이디어를 심사하게 했습니다. 그 결과, "넓은 그물"을 가진 로봇들이 "좁은 그물"을 가진 로봇들보다 인간의 점수와 훨씬 더 잘 일치한다는 것을 발견했습니다. 두 번째 테스트에서 그들은 인간과 로봇에게 동일한 제품 설명을 보여주되, 일부 제품에는 브랜드나 시장 성공 여부에 대한 문장을 추가했습니다. 인간의 평점은 그 추가적인 맥락을 보았을 때 급상가했습니다. 그들은 그 맥락 덕분에 제품이 더 창의적이라고 생각했습니다. 하지만 로봇은 어땠을까요? 로봇의 평점은 거의 변하지 않았습니다. 그들은 인간을 흔들어 놓았던 사회적 단서들에 완전히 눈이 멀어 있었습니다.
그렇다면 이것이 미래에 의미하는 바는 무엇일까요? 이는 우리가 모든 AI 심판을 동일하게 취급해서는 안 된다는 것을 시사합니다. 만약 당신이 진정으로 독창적이고 신선한 아이디어를 알고 싶다면, 로봇은 훌륭한 조력자가 될 수 있습니다. 하지만 만약 당신이 어떤 아이디어가 현실 세계에서 성공할지, 브랜드에 부합할지, 혹은 사람들의 입에 오르내릴지를 알고 싶다면, 로봇은 핵심을 놓칠 수도 있습니다. 이 논문은 적절한 AI 심판을 선택하는 것이 매우 중요하다는 점을 시사합니다. 모델마다 적용하는 규칙이 다르기 때문에, 그들은 서로 다른 우승자를 뽑을 것입니다. 우리는 로봇이 전체 그림을 보고 있다고 가정해서는 안 됩니다. 왜냐하면 로봇은 종종 매우 특정한, 좁은 렌즈를 통해 보고 있기 때문입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.