이 논문은 **"챗GPT 같은 인공지능이 현대 중국 시를 정말로 '이해'하고 있을까?"**라는 궁금증에서 시작합니다. 과거에는 AI 가 시를 쓰거나 번역하는 능력만 연구했지만, 이번 연구는 **"AI 가 시의 진짜 의미를 파악할 수 있는가?"**를 전문 시인들과 함께 검증했습니다.
이 복잡한 연구를 누구나 쉽게 이해할 수 있도록 세 가지 핵심 비유로 설명해 드리겠습니다.
1. 연구 방법: "작가에게 직접 물어보기" (가장 중요한 부분)
일반적으로 AI 의 능력을 평가할 때는 점수나 통계로만 봅니다. 하지만 시는 숫자로 재기 어려운 예술입니다.
비유: 만약 AI 가 그린 그림을 평가할 때, "색칠이 얼마나 깔끔한가?"만 본다면 그 그림의 '영혼'은 놓치게 됩니다. 이 연구는 그 그림을 그린 화가 (원작 시인) 본인에게 "내 그림을 AI 가 얼마나 잘 이해했나요?"라고 직접 물어보는 방식을 썼습니다.
방법: 연구팀은 6 명의 전문 시인과 협력했습니다. 시인들은 AI 가 자신의 시를 해석한 내용을 보고 5 가지 기준 (내용, 표현 기법, 생각과 감정, 현대성, 시적 맛) 으로 점수를 매겼습니다.
2. AI 의 실력: "훌륭한 분석가지만, '시적 맛'은 못 느낀다"
결과를 보면 AI 는 놀라운 실력을 보였지만, 치명적인 약점도 있었습니다.
✅ 잘하는 점: "명확한 것은 잘 파악한다"
내용과 이미지: AI 는 시가 "무슨 이야기인지"나 "어떤 그림이 그려져 있는지"는 80% 이상 정확하게 이해했습니다.
비유: 마치 정밀한 카메라처럼 시에 등장하는 사물, 비유, 문장 구조를 아주 정확하게 찾아내고 설명합니다. "이 시는 술에 취한 남자의 이야기를 하고 있어"라고 정확히 짚어냅니다.
현대성: 시가 가진 '현대적인 느낌'이나 '사회적 메시지'도 잘 알아챘습니다.
❌ 못하는 점: "시적인 맛 (Poeticity) 을 못 느낀다"
가장 큰 문제: AI 는 시에서 **"가장 시적인 문장"**을 고르라는 임무를 맡으면 엉뚱한 것을 고르는 경우가 많았습니다.
비유: AI 는 요리 레시피를 완벽하게 분석할 수는 있지만, "이 요리의 가장 맛있는 한 입"을 찾아내는 미각은 없습니다.
시인들은 "이 문장이 가장 아름답고 감동적이야"라고 생각하는데, AI 는 "아, 이 문장은 문법적으로 괜찮네"라고 생각해서 다른 문장을 골라버립니다. 전체적인 맥락이나 분위기보다는 문장 하나하나를 따로 떼어놓고 분석하는 경향이 강합니다.
3. 결론: "73% 는 이해하지만, 100% 는 아니다"
종합 점수: AI 가 시인의 의도를 이해한 비율은 **약 73%**였습니다. 즉, 대부분의 경우 시인이 말하고 싶었던 바를 잘 알아챘습니다.
한계: 하지만 시의 핵심인 **'시적 맛 (Poeticity)'**이나 미묘한 언어의 뉘앙스에서는 아직 인간 시인만큼 깊게 공감하지 못했습니다.
AI 평가의 함정: 흥미롭게도, 다른 AI 모델들이 이 결과를 평가해보려 했을 때, 전문 시인의 평가와는 많이 달랐습니다. 즉, 시를 이해하고 평가하는 일은 아직 인간의 직관과 문화적 배경이 필수적이라는 뜻입니다.
📝 한 줄 요약
"챗GPT 는 시의 '뼈대'와 '내용'을 아주 잘 분석하는 똑똑한 비서이지만, 시의 '영혼'과 '맛'을 느끼는 예술가는 아직 아닙니다. 그래서 시를 제대로 이해하려면 결국 인간의 눈과 마음이 필요합니다."
이 연구는 AI 가 시를 다루는 데 있어 어디까지가 가능하고 어디가 한계인지를 명확히 보여주는 첫걸음이며, 앞으로 AI 가 시를 더 잘 이해하도록 돕는 중요한 기준이 될 것입니다.
논문 제목: ChatGPT 가 현대 중국시를 진정으로 이해할 수 있는가?
저자: Shanshan Wang, Derek F. Wong, Jingming Yao, Lidia S. Chao (마카오 대학교)
1. 연구 배경 및 문제 제기 (Problem)
현황: ChatGPT 를 포함한 대규모 언어 모델 (LLM) 은 시 생성 (Generation) 과 번역 (Translation) 과 같은 작업에서 뛰어난 성능을 보여주고 있습니다.
문제점: 기존 연구들은 주로 ChatGPT 가 생성한 시의 결과물 자체를 분석하는 데 그쳤을 뿐, 모델이 시의 본질적인 의미와 의도를 진정으로 '이해'하는지에 대한 근본적인 질문을 다루지 못했습니다.
필요성: 시 생성이나 번역과 같은 모든 시 관련 작업의 전제 조건은 '시 이해 (Poetry Understanding)' 능력입니다. 따라서 LLM 의 시 이해 능력을 체계적으로 평가하고 한계를 파악하는 것이 필수적입니다.
2. 제안된 방법론 (Methodology)
저자들은 ChatGPT 의 현대 중국시 이해 능력을 평가하기 위해 ECUMP(Evaluation of ChatGPT's Understanding of Modern Poetry) 라는 종합적인 평가 프레임워크를 제안했습니다.
가. 평가 차원 (Dimensions) 정의
전문 시인 8 명과의 협의를 통해 시 이해를 위한 5 가지 핵심 차원을 정의했습니다.
내용 (Content): 시가 묘사하는 주제와 사물.
표현 기법 (Expression Methods):
언어 (Language), 이미지 (Imagery), 수사법 (Rhetorical Techniques), 리듬 (Rhythm), 낯설게 하기 (Defamiliarization) 등 5 가지 하위 요소 포함.
사상 및 감정 (Thought & Emotion): 시가 전달하는 아이디어와 정서.
현대성 (Modernity): 시에 내재된 현대적 의식이나 감수성.
시적 성질 (Poeticity): 시의 본질적인 미적 가치를 가장 잘 나타내는 문장 (가장 시적인 문장) 을 식별하는 능력.
나. 실험 설계
데이터셋: 전문 현대 중국 시인 6 명과 협력하여 최근 창작된 48 편의 현대 중국시를 수집 (일반 시 40 편, 고전적 소재를 활용한 특수 시 8 편).
프롬프트 설계: ChatGPT 가 위 5 가지 차원에 따라 시를 해석하도록 최적화된 프롬프트를 설계 (예: "이 시는 완전한 현대시입니다"라는 문구 추가 등).
평가 주체:
1 차 평가 (Human Evaluation):원작 시인이 ChatGPT 의 해석을 직접 평가 (가장 신뢰할 수 있는 기준).
2 차 평가 (LLM Evaluation): 다른 LLM 들을 평가자로 사용하여 ChatGPT 의 해석을 평가 (인간 평가자와의 비교).
3. 주요 결과 (Results)
가. 인간 평가 (시인 평가) 결과
전반적 일치도: ChatGPT 의 해석이 원작 시인의 의도와 73% 이상 일치하는 것으로 나타났습니다.
강점:
이미지 (Imagery) 와 내용 (Content): 가장 높은 점수를 기록 (평균 80 점대). 구체적인 묘사와 명확한 서사 구조를 가진 시에서 우수한 성능을 보였습니다.
수사법 (Rhetorical Techniques): 명시적인 단서 (예: "처럼", "과 같다") 가 있는 경우 정확히 식별했습니다.
현대성 (Modernity): 표면적 이미지뿐만 아니라 시에 내재된 현대적 의식도 어느 정도 파악했습니다.
약점:
시적 성질 (Poeticity): 가장 낮은 성능을 보였습니다. 48 편의 시 중 '가장 시적인 문장'을 고르는 과제의 경우, 50% 이상에서 실패하거나 전혀 시적이지 않은 문장을 선택했습니다. 이는 문맥을 고려하지 않고 문장을 단편적으로 분석하는 경향이 있음을 시사합니다.
언어 (Language): 고전적 어휘와 문화적 맥락이 포함된 '특수 시 (Spe-Poems)'의 경우 언어 이해도가 상대적으로 낮았습니다 (73.75 점).
나. LLM 평가 결과
다른 LLM 들 (GPT-4o, Qwen 등) 을 평가자로 사용했을 때, 전문 시인의 평가 결과와 큰 편차가 발생했습니다.
이는 시와 같은 문화적, 정서적 뉘앙스가 깊은 작업에서는 현재 LLM 기반 자동 평가가 인간 평가 (특히 원작자 평가) 를 대체할 수 없음을 보여줍니다.
4. 주요 기여 (Key Contributions)
최초 체계적 평가: ChatGPT 의 시 이해 능력을 체계적으로 평가한 최초의 연구입니다.
종합적 프레임워크 (ECUMP): 현대 중국시 이해를 위한 5 가지 핵심 차원과 평가 방법론을 정립했습니다.
전문가 참여 평가: 원작 시인을 평가자로 참여시켜 신뢰성 있고 세밀한 평가를 가능하게 했습니다.
실증적 통찰: LLM 이 시의 '표면적 요소 (이미지, 내용)'는 잘 이해하지만, '본질적 요소 (시적 성질, 문맥적 뉘앙스)'에서는 한계가 있음을 입증했습니다.
5. 의의 및 결론 (Significance & Conclusion)
의의: 본 연구는 LLM 이 시 생성이나 번역을 넘어 시를 '이해'하는 데 있어 현재 어느 수준에 도달했는지, 그리고 어떤 부분이 개선되어야 하는지를 명확히 했습니다. 특히 **시적 성질 (Poeticity)**과 문화적 맥락에 대한 이해 부족은 향후 연구의 중요한 과제로 제시되었습니다.
결론: ChatGPT 는 현대 시의 내용을 이해하는 데 있어 73% 이상의 높은 일치도를 보이며 유용한 도구로 작용할 수 있으나, 시의 본질적인 미적 가치를 파악하는 능력은 여전히 부족합니다. 따라서 시 관련 작업에서 LLM 의 활용은 인간 (특히 시인) 의 검증과 결합되어야 합니다.
향후 연구: 본 프레임워크는 LLM 과 시 관련 작업 (번역, 생성, 분석) 에 대한 향후 연구의 견고한 기초를 마련했습니다.
요약: 이 논문은 ChatGPT 가 현대 중국시를 얼마나 잘 이해하는지 전문 시인의 평가를 통해 다차원적으로 분석한 연구로, 모델은 시의 내용과 이미지를 잘 파악하지만 시의 본질적인 미적 가치 (Poeticity) 와 복잡한 문화적 뉘앙스 이해에는 한계가 있음을 밝혔습니다.