← 최신 논문
🤖 AI

Assessing the Creativity of Large Language Models: Testing, Limits, and New Frontiers

본 논문은 기존 인간 창의성 검사가 글쓰기, 수렴적 사고, 과학적 아이디어 생성에 대한 대규모 언어 모델 (LLM) 의 성능을 예측하는 데 있어 제한적인 타당성을 보임을 체계적으로 평가하고, 수렴적 사고와 발산적 사고를 동시에 평가함으로써 과학적 아이디어 생성을 예측할 수 있는 최초의 강력한 도구인 발산적 원격 연상 검사 (DRAT) 를 제시합니다.

원저자: Samuel Schapiro, Alexi Gladstone, Jonah Black, Heng Ji

게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Samuel Schapiro, Alexi Gladstone, Jonah Black, Heng Ji

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 여러분은 매우 똑똑한 로봇들 (대규모 언어 모델, 또는 LLM) 의 거대한 도서관을 가지고 있습니다. 여러분은 그중에서 진정한 '창의성'을 가진 로봇이 누구인지 알고 싶습니다. 하지만 기계의 창의성을 어떻게 측정할 수 있을까요?

오랜 기간 동안 과학자들은 인간에게 사용하는 동일한 테스트를 이러한 로봇들을 평가하는 데 활용하려고 노력해 왔습니다. 이는 물고기가 나무를 오르는 능력을 측정하여 그 나무 오르기 실력을 평가하려는 것과 같습니다. 이 논문은 일부 기존 테스트가 어느 정도 작동하기는 하지만, 특히 과학적 아이디어와 관련해서는 전체 이야기를 전달하지 못하는 경우가 많다고 주장합니다.

다음은 연구자들이 발견한 내용과 이를 해결하기 위해 구축한 방법에 대한 간단한 요약입니다.

1. 문제: 잘못된 자를 사용함

연구자들은 인간이 치르는 두 가지 주요 '창의성 테스트'를 살펴보았습니다.

  • 수렴적 사고: 누군가에게 하나의 질문에 대해 많은 수의 서로 다른 기발한 답변을 생각해 내도록 요청하는 것 (예: "서로 완전히 다른 10 가지 물건을 나열해 보세요").
  • 수렴적 사고: 서로 관련 없는 세 가지 물건을 연결하는 단 하나의 정답을 찾도록 요청하는 것 (예: "코티지", "스위스", "케이크" \rightarrow "치즈").

이 팀은 이러한 인간용 테스트를 사용하여 수십 개의 AI 모델을 테스트했습니다. 그들은 몇 가지 놀라운 사실을 발견했습니다.

  • '똑똑함'의 함정: 창의성을 측정하는 것처럼 보였던 많은 테스트들은 실제로는 로봇이 얼마나 '똑똑한지' 또는 지식이 풍부한지를 측정하고 있었습니다. 로봇이 수학이나 독해에 능하다면, 실제로 창의적이지 않더라도 이러한 테스트에서 자연스럽게 높은 점수를 받습니다. 이는 수학 시험에서 학생에게 높은 점수를 받았다는 이유만으로 그것을 '창의성 테스트'라고 부르는 것과 같습니다.
  • '과학적' 맹점: 가장 충격적인 발견은 기존의 인간용 테스트 중 어느 것도 AI 가 좋은 과학적 아이디어를 생각해 낼 수 있는지 reliably 예측할 수 없다는 것이었습니다. 이야기 쓰기에 뛰어나거나 무작위 단어를 나열하는 데 능한 로봇이 있을 수 있지만, 새로운 과학 이론을 발명하는 데는 형편없을 수 있습니다. 기존의 자들은 이 작업에는 적합하지 않았습니다.
  • 더 새로운 모델의 역설: AI 모델이 더 최신화되고 강력해질수록, 실제로는 수렴적 사고 (독특하고 기발한 아이디어를 생각해 내는 것) 에서 더 나빠졌습니다. 그들은 새로운 레시피를 발명하는 요리사라기보다, 같은 쿠키를 반복해서 생산하는 공장과 같이 더 경직되고 표준화되었습니다.

2. 해결책: 새로운 하이브리드 테스트 (DRAT)

기존 테스트가 과학적 창의성을 예측하는 데 실패했기 때문에, 저자들은 수렴적 원격 연관 테스트 (Divergent Remote Association Test, DRAT) 라는 새로운 테스트를 고안했습니다.

기존 테스트를 두 가지 별도의 도구로 생각해 보세요.

  • 도구 A (수렴적): 물건을 부수어 얼마나 많은 다른 조각이 나오는지 확인하는 대형 망치.
  • 도구 B (수렴적): 물건을 단단히 조여 완벽한 한 가지 적합성을 찾는 나사 드라이버.

과학적 창의성의 문제는 동시에 둘 다 필요하다는 점입니다. 새로운 것을 찾기 위해 아이디어를 부수어야 하지만, 그 아이디어들이 실제로 의미를 가지고 문제에 적합하도록 조여야 합니다.

DRAT 의 작동 방식:
AI 에게 "심장박동", "파이프라인", "위상수"와 같이 매우 다른 세 개의 '앵커' 단어를 준다고 상상해 보세요.

  1. 과제: AI 는 서로 서로 다른 10 개의 단어를 생성해야 합니다 (수렴적).
  2. 조건: 하지만 그 10 개의 단어 중 하나하나가 세 개의 앵커 단어 모두와 비유적으로 연결될 수 있어야 합니다 (수렴적).

이는 시인에게 10 개의 완전히 다른 시를 쓰게 하되, 모든 시가 비밀리에 특정한 복잡한 기계에 대해 써야 한다고 요구하는 것과 같습니다. AI 가 이를 해낼 수 있다면, 그것은 동시에 광범위하게 사고하고 논리적으로 사고할 수 있음을 증명합니다.

3. 결과

이 새로운 DRAT 도구를 테스트했을 때:

  • 성공했습니다! 이는 어떤 AI 모델이 과학적 아이디어를 생각해 내는 데 능한지 성공적으로 예측할 수 있는 첫 번째 테스트였습니다.
  • 단순한 부분의 합이 아니었습니다: 연구자들은 기존의 '부수기' 테스트와 '나사 조이기' 테스트를 결합하여 이것이 작동하는지 확인해 보았습니다. 작동하지 않았습니다. 새로운 DRAT 도구는 두 가지 기존 도구로는 불가능했던 특별한 일을 해냈습니다. 이는 과학적 창의성을 측정하려면 광범위하고 논리적인 사고 능력을 동시에 테스트해야 함을 증명했습니다.

핵심 교훈

이 논문은 AI 창의성을 평가하기 위해 기존의 인간용 테스트를 그대로 사용할 수 없다고 결론 내립니다.

  • AI 가 이야기 쓰기에 능한지 알고 싶다면, "수렴적 연관 과제 (Divergent Association Task)" (기발한 단어 목록) 를 사용하세요.
  • AI 가 수렴적 사고 (많은 옵션 나열) 에 능한지 알고 싶다면, "조건부 수렴적 연관 과제 (Conditional Divergent Association Task)"를 사용하세요.
  • 하지만 AI 가 새로운 과학을 발명할 수 있는지 알고 싶다면, 새로운 DRAT 테스트가 필요합니다. 이는 기계가 동시에 광범위한 상상력과 논리적 연결성을 가질 수 있는지 확인하기 때문입니다.

간단히 말해: 로봇의 과학적 천재성을 측정하려면, 불을 다루며 (수렴적) 좁은 줄타기를 하도록 (수렴적) 강요하는 테스트가 필요합니다. 기존 테스트는 로봇에게 둘 중 하나만 하도록 요청했을 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →