Beyond Divergent Creativity: A Human-Based Evaluation of Creativity in Large Language Models
이 논문은 적절성을 무시함으로써 거대 언어 모델을 평가하는 확산 연상 과제(Divergent Association Task, DAT)의 한계를 비판하고, 진정한 창의성과 노이즈를 더 잘 구별하기 위해 인간의 창의성 이론에 근거한 새로운 조건부 확산 연상 과제(Conditional Divergent Association Task, CDAT)를 제안하며, 고도화된 모델들이 학습과 정렬로 인해 흔히 적절성을 위해 참신함을 희생한다는 점을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 일련의 사람들(이 경우에는 컴퓨터 프로그램들)이 얼마나 창의적인지를 판단하려고 한다고 상상해 보십시오. 당신은 그들에게 간단한 과제를 줍니다: "서로 최대한 다른 단어 10개를 말하시오."
이것이 **발산적 연상 과제(Divergent Association Task, DAT)**입니다. 만약 당신이 "사과", "자동차", "구름", "신발"이라고 말한다면, 이 단어들은 의미상 매우 멀리 떨어져 있기 때문에 높은 점수를 받게 됩니다. 하지만 만약 "사과", "바나나", "체리", "포도"라고 말한다면, 이들은 모두 과일이라는 범주에 속하므로 낮은 점수를 받게 됩니다.
이 논문의 연구자들은 질문했습니다: 이것이 인공지능(AI)을 테스트하기 위한 공정한 방법인가?
문제점: "무작위 노이즈"의 함정
저자들은 현재 우리가 AI의 창의성을 테스트하는 방식에 중대한 결함이 있음을 발견했습니다. 그들은 단순히 AI에게 "다르게 행동하라"고 요구하면, AI가 **무작위성(randomness)**을 이용해 속임수를 쓸 수 있다는 것을 발견했습니다.
이것을 "사이먼 가라사대(Simon Says)" 게임에 비유해 봅시다. 규칙이 단지 "다르게 행동하라"는 것이라면, 눈을 감고 페이지 위의 단어들을 무작위로 가리키는 사람이 뛰어난 시인보다 더 높은 점수를 받을 수도 있습니다. AI는 의미가 없는 횡설수설을 내뱉더라도, 결과적으로 서로 멀리 떨어진 단어들을 뱉어냄으로써 점수를 높일 수 있습니다. 즉, 의미 있는 차이를 만드는 것이 아니라 그냥 무작위적인 단어들을 쏟아내는 것입니다.
실험에서 저자들은 두 가지 유형의 "속임수"를 테스트했습니다:
- 무작위 속임수(The Random Cheater): 사전에서 무작위로 단어 10개를 뽑는 컴퓨터 프로그램입니다.
- 게임 최적화 속임수(The "Game-Optimizer" Cheager): "의미는 무시하고, 이 테스트에서 가장 높은 점수를 받을 수 있는 단어들을 골라라"라는 특명을 받은 AI입니다.
충격적인 결과: 이 두 "속임수" 모델들은 가장 발전되고 똑똑한 AI 모델들보다 더 높은 점수를 받았습니다. 이는 기존의 테스트(DAT)가 실제 창의성을 측정하는 것이 아니라, 단순히 모델이 얼마나 무작위적일 수 있는지, 혹은 시스템을 얼마나 잘 이용하는지를 측정하고 있다는 것을 의미합니다.
해결책: "맥락적" 테스트 (CDAT)
이를 해결하기 위해 연구자들은 CDAT(조건부 발산적 연상 과제, Conditional Divergent Association Task)라는 새로운 테스트를 고안했습니다.
비유:
기존의 테스트가 누군가에게 "무작위로 10가지를 말해보라"고 요청하는 것이었다면,
새로운 테스트는 다음과 같습니다: "'고양이'와 관련된 서로 다른 10가지를 말하시오."
이제 AI는 두 가지 일을 동시에 수행해야 합니다:
- 적절성(Be Appropriate): 단어들이 반드시 주어진 단서와 관련이 있어야 합니다 (예: "수염", "발바닥", "레이저 포인터"). 만약 "토스터"나 "화산"이라고 말한다면 탈락입니다.
- 다양성(Be Diverse): 단어들은 여전히 서로 달라야 합니다. "고양이", "새끼 고양이", "고양이과 동물"은 모두 관련이 있지만, 서로 너무 유사합니다. "고양이", "물고기", "개"가 더 나은 답변입니다.
이 새로운 테스트는 진정한 창의성(독특하면서도 말이 되는 것)과 무작위 노이즈(독특하지만 말이 안 되는 것)를 구분해 냅니다.
연구 결과
이 새로운 테스트를 실행했을 때, 결과는 완전히 바뀌었습니다:
- "똑똑한" AI들은 너무 안전한 길을 택했습니다: 가장 발전된 대형 AI 모델들은 (도움이 되고 규칙을 완벽히 따르도록 훈련되었기 때문에) 지나치게 안전한 답변을 내놓는 경향이 있었습니다. 그들은 매우 적절한 답을 내놓았지만, 다소 지루하고 창의적이지 못했습니다. 마치 교과서는 완벽하게 알지만 틀리는 것을 두려워하여 사고의 틀을 깨지 못하는 학생과 같았습니다.
- "작은" AI들이 더 창의적이었습니다: 놀랍게도, 덜 발전된 작은 모델들이 종종 더 높은 창의성 점수를 기록했습니다 주제에서 벗어나지 않으면서도 더 독특하고 다양한 아이디어를 제안하며 위험을 감수하는 경향을 보였기 때문입니다.
저자들은 AI 모델이 커지고 더 "안전"하며 유용하도록 훈련될수록, 실제로 창의적인 불꽃을 조금씩 잃어버린다고 제안합니다. 그들은 올바르게 행동하는 데 너무 집중한 나머지, 흥미로워지는 데에는 소홀해집니다.
시사점
이 논문은 우리가 창의성을 측정하기 위해 단순히 AI에게 "다르게 행동하라"고 요구해서는 안 된다고 결론짓습니다. 우리는 특정 맥락 안에서 다르게 행동하라고 요구해야 합니다.
- 기존 방식: "무작위로 해라!" (AI는 횡설수설함으로써 속임수를 쓴다).
- 새로운 방식: "창의적이되, 말이 되게 해라!" (AI는 독특함과 유용함 사이의 균형을 잡아야 한다).
이 새로운 방법은 어떤 AI 모델이 실제로 창의적인지, 아니-면 단순히 지시를 잘 따르거나 무작위로 추측하는 데 능숙한 것인지를 훨씬 더 명확하게 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.