← 최신 논문
💬 NLP

Automated Creativity Evaluation of Language Models Across Open-Ended Tasks

이 논문은 발산적 참신함을 측정하기 위한 의미론적 엔트로피와 수렴적 과업 완수도를 평가하기 위한 검색 기반 멀티 에이전트 판별기를 결합함으로써, 개방형 과업 전반에 걸쳐 대규모 언어 모델의 창의성을 정량화하는 확장 가능하고 도메인 불가지론적인 프레임워크를 소개한다.

원저자: Min Sen Tan, Zachary Kit Chun Choy, Syed Ali Redha Alsagoff, Nadya Yuki Wangsajaya, Mohor Banerjee, Swaagat Bikash Saikia, Alvin Chan

게시일 2026-06-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Min Sen Tan, Zachary Kit Chun Choy, Syed Ali Redha Alsagoff, Nadya Yuki Wangsajaya, Mohor Banerjee, Swaagat Bikash Saikia, Alvin Chan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 새로운 AI 작가, 발명가, 문제 해결사 그룹의 '창의성'을 판별하려는 인재 발굴 전문가라고 상상해 보십시오. 과거에 창의성을 판단하는 것은 마치 자를 가지고 그림을 채점하는 것과 같았습니다. 이는 매우 번거롭고, 매 작품마다 인간 전문가가 필요했으며, 특정 유형의 예술에만 적용할 수 있었습니다.

이 논문은 퍼즐을 풀거나 이야기를 쓰는 것과 같은 모든 종류의 개방형 과제에 적용 가능한 새로운 자동화된 "창의성 성적표(Creativity Scorecard)"를 소개합니다. 저자들은 창의성을 두 가지 별개의 초능력으로 나누고 이를 각각 측정합니다: 확산적 사고(다양한 아이디어를 꿈꾸는 능력)와 수렴적 사고(최선의 아이디어를 선택하고 그것이 작동하게 만드는 능력)입니다.

이 시스템의 작동 방식은 다음과 같습니다 (쉬운 비유를 사용함):

1. "꿈꾸기" 측정하기 (확산적 창의성)

문제점: AI가 단순히 같은 아이디어를 단어만 바꿔서 반복하고 있는 것인지, 아니면 실제로 새로운 영역을 탐구하고 있는 것인지 어떻게 알 수 있을까요?
과거의 방식: 단어 수를 세거나 문장의 표면적인 형태가 다른지 확인했습니다. 이는 요리사가 "수프"를 설명할 때 얼마나 다양한 단어를 사용하는지로 요리사를 평가하는 것과 같습니다. 정작 맛은 모두 똑같은데 말이죠.
새로운 방식 (의미론적 엔트로피): 저자들은 **의미론적 엔트로피(Semantic Entropy)**라는 개념을 사용합니다.

  • 비유: 당신이 AI에게 "강을 건너려면 어떻게 해야 할까?"라고 묻는다고 가정해 봅시다.
    • 창의성이 낮은 AI는 "다리를 만든다", "다리를 건설한다", "교량을 구축한다"라고 말할 수 있습니다. 겉보기에는 달라 보이지만 의미는 완전히 같습니다. 이때의 "엔트로피(다양성)"는 낮습니다.
    • 창의성이 높은 AI는 "다리를 만든다", "드론을 날린다", "덩굴을 엮는다", "물이 얼 때까지 기다린다"라고 말할 수 있습니다. 이들은 진정으로 다른 경로들입니다. 이때의 "엔트로피"는 높습니다.
  • 결론: 이 방법은 "다양성 측정기" 역할을 합니다. 표면적인 단어의 변화를 무시하고, AI가 얼마나 많은 서로 다른 개념적 방향을 탐색하는지를 측정합니다. 연구 결과, 이 측정 방식이 기존 방식보다 인간이 생각하는 '창의성'과 훨씬 더 잘 일치한다는 것을 발견했습니다.

2. "실행하기" 측정하기 (수렴적 창의성)

문제점: 기발한 아이디어를 내놓는 것은 쉽지만, 그 아이디어가 실제로 문제를 해결하게 만드는 것은 어렵습니다. AI가 강을 건너기 위해 "용을 타고 날아간다"라고 제안할 수도 있는데, 이는 창의적일 수는 있으나 쓸모는 없습니다.
과거의 방식: 단일 AI 심판이나 인간이 답변을 읽게 했습니다. 이는 느리고 비용이 많이 들며, 규모를 키우기 어렵습니다.
새로운 방식 (검색 기반 멀티 에이전트 팀): 저자들은 전문화된 AI "심판" 팀을 구축하되, 시간과 비용을 절약하기 위한 반전을 더했습니다.

  • 비유: 안전 관리자, 실행 가능성 전문가, 스토리 비평가로 구성된 전문가 패널이 프로젝트를 검토한다고 상상해 보십시오.
    • 기존 방식: 전문가들이 말할 때마다 대화의 처음부터 끝까지 전체 기록을 다시 읽습니다. 이는 회의를 할 때마다 사람들이 발언하기 전에 지난 100페이지 분량의 노트를 다시 읽어야 하는 것과 같습니다. 이는 매우 거대하고 비용이 많이 드는 작업입니다.
    • 새로운 방식: 이 팀은 "스마트 파일링 시스템"을 사용합니다. 모든 것을 다시 읽는 대신, 현재 논의 중인 지점과 관련된 특정 노트만을 불러옵니다.
  • 결론: 이 "검색 기반(Retrieval-Based)" 접근 방식은 정확도는 인간 전문가만큼 유지하면서도 컴퓨팅 비용을 63% 절감했습니다. 이를 통해 AI가 단순히 헛소리를 늘어놓는 것이 아니라, 실제로 과제의 요구 사항을 충족하고 있는지 확인합니다.

3. 위대한 발견: 두 가지 서로 다른 기술

이 논문의 가장 놀라운 발견은, 이 두 가지 기술인 꿈꾸기실행하기가 자동으로 함께 성장하지 않는다는 점입니다.

  • 비유: 자동차를 생각해 보십시오. 목적지까지 완벽하게 도달할 수 있는 매우 강력한 엔진(수렴적/과제 수행 능력)을 가졌다고 해서, 운전자가 반드시 오프로드 길을 탐험하는 데 능숙하다는 뜻은 아닙니다(확산적/창의성).
  • 발견: AI 모델이 커지고 지시 사항을 따르는 능력(수렴적)이 좋아질수록, 반드시 더 기발한 아이디어를 탐색(확산적)하게 되는 것은 아닙니다. 실제로 가장 크고 "정확한" 모델들이 오히려 더 작은 모델들보다 탐색 범위가 좁은 경우가 있었습니다. 이는 현재의 학습 방식이 AI를 '정확하게' 만드는 데는 뛰어나지만, 반드시 더 '창의적으로' 만드는 것은 아님을 시사합니다.

4. 시스템 테스트

저자들은 이 프레임워크를 세 가지 매우 다른 "놀이터"에서 테스트했습니다:

  1. 맥가이버(MacGyver): 일상적인 물건을 사용하여 물리적인 문제를 해결하기 (예: "양말로 누수를 막으려면 어떻게 해야 할까?").
  2. 하이포젠(HypoGen): 새로운 과학적 연구 아이디어 제안하기.
  3. 북미아(BookMIA): 특정 시작점과 종료점이 있는 창의적인 이야기 쓰기.

이 세 가지 경우 모두에서, 그들의 시스템은 AI의 아이디어가 얼마나 "넓은지"와 최종 솔루션이 얼마나 "좋은지"를 성공적으로 측정했으며, 이를 통해 다양한 유형의 창의성에 걸쳐 작동함을 입증했습니다.

요약

이 논문은 **창의성을 위한 보편적이고 자동화된 자(ruler)**를 제공합니다. 이는 많은 독특한 아이디어를 생성하는 능력문제를 올바르게 해결하는 능력을 분리하여 보여줍니다. 또한, AI가 문제를 해결하는 데는 점점 더 능숙해지고 있지만, 반드시 더 상상력이 풍부해지는 것은 아니며, 이러한 특정한 "창의적 불꽃"을 측정하고 장려하기 위한 새로운 도구가 필요함을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →