Evaluating the Creativity of LLMs in Persian Literary Text Generation
이 논문은 토런스 창의성 검사에 기반한 4 가지 차원과 4 가지 문학적 장치를 평가 기준으로 삼아, 인간 판정과 높은 일치도를 보이는 LLM 을 심사자로 활용하여 페르시아어 문학 텍스트 생성에서 LLM 의 창의성과 문화적 표현 능력을 종합적으로 평가했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
🎨 페르시아어 시와 소설을 쓴 AI: 창의성은 진짜일까?
이 논문은 **"인공지능 (AI) 이 페르시아어 (이란어) 로 시나 짧은 글을 쓸 때, 정말로 '창의적'일 수 있는가?"**라는 흥미로운 질문을 던집니다.
마치 AI 가 이란의 전통적인 정원 (시) 을 가꾸는 정원사가 되어, 새로운 꽃을 피울 수 있는지 확인하는 실험이라고 상상해 보세요. 연구팀은 AI 가 단순히 책에서 배운 문장을 반복하는지, 아니면 정말로 새로운 감정을 표현하는지 살펴봤습니다.
1. 🌍 왜 페르시아어인가? (새로운 정원 찾기)
지금까지 AI 의 창의성 연구는 거의 영어라는 거대한 대륙에서만 이루어졌습니다. 하지만 이 연구팀은 **"영어만 잘한다고 해서 전 세계의 모든 꽃을 가꿀 수 있는 건 아니다"**라고 생각했습니다.
- 페르시아어는 시와 문학이 매우 발달한 언어입니다. 마치 고급 향수처럼 은유와 비유가 풍부하죠.
- 연구팀은 이 복잡한 언어에서 AI 가 얼마나 창의적인지, 그리고 **이란 문화의 정서 (사랑, 희망, 설렘 등)**를 얼마나 잘 담아내는지 평가하기 위해 새로운 도구를 만들었습니다.
2. 📏 창의성을 재는 자: '토런스 테스트'의 변형
창의성을 측정하는 것은 맛있는 요리의 맛을 점수화하는 것처럼 어렵습니다. 연구팀은 인간의 창의성을 측정하는 유명한 방법인 **'토런스 창의성 사고 검사 (TTCT)'**를 페르시아어에 맞게 변형했습니다.
이들은 AI 가 쓴 글을 다음 4 가지 기준으로 평가했습니다:
- 독창성 (Originality): "이 문장은 cliché(진부한 표현) 이 아닌, 정말 새롭고 독특한가?" (예: "사랑은 꽃이다" 대신 "사랑은 숨 쉬는 침묵이다")
- 유창성 (Fluency): "문장이 자연스럽고 매끄러운가?" (문법 오류가 없고 이란 사람이 읽었을 때 어색하지 않은가?)
- 유연성 (Flexibility): "한 가지 주제를 다양한 각도에서 바라보는가?" (예: '희망'을 철학적으로, 유머러스하게, 혹은 슬프게 다르게 표현하는가?)
- 구체성 (Elaboration): "상세한 묘사로 독자의 머릿속에 그림을 그리는가?" (단순히 "슬프다"가 아니라 "마음속의 가을 바람이 마지막 희망의 잎을 재로 만든다"처럼 구체적인가?)
3. 🤖 AI 심판단 vs 인간 심판단
창의성을 점수 매기는 일은 매우 주관적입니다. 그래서 연구팀은 6 개의 최신 AI 모델 (GPT-4, DeepSeek-R1 등) 을 시험대에 올렸습니다.
- 실험 과정: AI 들에게 '사랑', '희망', '아버지' 같은 주제로 1 문장씩 시를 쓰게 했습니다.
- 심사위원: 처음에는 사람이 직접 점수를 매겼지만, 비용과 시간을 줄이기 위해 Claude 3.7 Sonnet이라는 AI 를 '심판 (Judge)'으로 세웠습니다.
- 결과: 놀랍게도 이 AI 심판은 사람 심판과 매우 유사한 점수를 매겼습니다. 마치 맛있는 요리를 평가하는 미식가 AI가 인간 미식가와 거의 같은 입맛을 가진 셈이죠.
4. 🏆 누가 가장 창의적인가? (결과 분석)
모든 AI 가 똑같이 잘한 것은 아니었습니다. 마치 각기 다른 재능을 가진 예술가들처럼요.
- DeepSeek-R1 (최고의 예술가): 전체적으로 가장 높은 점수를 받았습니다. 특히 구체성과 유연성이 뛰어났습니다. 이 모델은 "생각한 뒤 답을 낸다 (Reasoning)"는 훈련을 받아, 더 풍부하고 다양한 비유를 사용했습니다.
- 예시: "절망은 가을 바람의 고요함 속에서 희망의 마지막 잎을 재로 만드는 무거운 그림자다." (매우 시적이고 구체적)
- GPT-4.1 (유창한 화가): 문장이 매우 매끄럽고 자연스러웠지만, 독창성은 다소 부족했습니다. 너무 익숙한 표현들을 많이 썼죠.
- Qwen2.5 (독창적이지만 어색한 초보): 아주 새로운 아이디어를 냈지만, 문장이 이란 사람들에게는 다소 어색하거나 이해하기 어려웠습니다.
5. 🔍 흥미로운 발견: "비유"의 함정
연구팀은 AI 들이 **비유 (은유, 직유 등)**를 어떻게 사용하는지 분석했습니다.
- 인간: 한 문장 안에 은유와 대조, 과장법 등을 균형 있게 섞어 사용합니다. 마치 색다른 재료를 섞어 만든 스프처럼요.
- AI: 대부분 은유와 직유만 남발했습니다. 특히 '빛/어둠', '희망/절망' 같은 진부한 대비를 너무 자주 썼습니다.
- 비유: AI 는 마치 레시피를 그대로 따라 하는 요리사처럼, 가장 익숙한 재료 (비유) 만 반복해서 사용합니다. 반면 인간은 그날의 기분과 상황에 따라 완전히 새로운 재료를 찾아냅니다.
6. 💡 결론: AI 는 훌륭한 도구지만, 아직 인간은 아니다
이 연구는 AI 가 페르시아어 문학도 쓸 수 있지만, 아직 인간의 깊이와 문화적 뉘앙스를 완벽하게 따라잡지는 못한다는 것을 보여줍니다.
- AI 의 역할: 창의적인 아이디어를 내거나, 다양한 표현을 제안하는 도구로는 훌륭합니다.
- 한계: 하지만 진정한 예술적 영감이나 문화적 정서를 깊이 있게 이해하고 표현하는 데는 아직 갈 길이 멉니다.
한 줄 요약:
"AI 는 이제 페르시아어 시를 쓸 수 있지만, 그 시가 진짜 인간의 마음에서 우러나온 것인지, 아니면 책에서 배운 레시피를 따른 것인지를 구별하는 것은 여전히 인간의 몫입니다."
이 연구는 앞으로 AI 가 다양한 문화와 언어를 이해하며 더 창의적으로 성장할 수 있도록, 문화에 민감한 평가 기준이 필요함을 일깨워 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.