← 최신 논문
💬 NLP

Do Large Language Models Perform Well on Comprehending Poetic Logic in Modern Chinese Poetry?

이 논문은 연, 행, 이미지 차원에서 현대 중국 시의 '시적 논리'를 평가하기 위해 설계된 최초의 벤치마크인 Peony를 소개하며, 이러한 텍스트를 총체적 추론을 통해 이해하는 데 있어 현재 대규모 언어 모델들이 가진 상당한 한계를 드러낸다.

원저자: Tian Lan, Shanshan Wang, Zehua Duo, Jiang Li, Guanglai Gao, Derek F. Wong, Xiangdong Su

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tian Lan, Shanshan Wang, Zehua Duo, Jiang Li, Guanglai Gao, Derek F. Wong, Xiangdong Su

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

언어는 단순히 사실을 교환하기 위한 도구 그 이상이다. 그것은 감정, 이미지, 그리고 인간의 경험을 정의하는 미묘하고도 종종 비논리적인 연결들을 담아내는 그릇이다. 수십 년 동안 인공지능은 방대한 뉴스 기사, 과학 논문, 그리고 일상적인 대화의 도서관을 학습하며 읽고 쓰는 법을 배워왔다. 이러한 텍스트에서 의미는 대개 직선을 따른다. 원인이 결과를 이끌고, 진술 뒤에는 증거가 따르며, 목표는 명료함에 있다. 하지만 규칙이 역전되는 또 다른 종류의 글쓰기가 존재한다. 특히 현대 중국 시(詩)는 침묵, 갑작스러운 시간의 도약, 그리고 현실 세계에서는 서로 어울리지 않지만 독자의 마음속에서는 완벽하게 이해되는 이미지들에 의존한다. 이러한 양식은 겉보기에는 서로 무관해 보이는 파편들을 모아 하나의 전체 이야기를 구성해내는 독특한 형태의 추론을 요구한다.

최근까지 가장 진보된 컴퓨터 프로그램들이 이러한 종류의 글을 이해할 수 있는지 여부는 불분식했다. 거대 언어 모델(LLM)로 알려진 이 프로그램들은 뉴스를 요약하거나 코드를 작성하는 데는 매우 능숙해졌지만, 시의 복잡하고 감정적인 논리를 테스트하는 일에는 거의 시험대에 오르지 않았다. 질문은 단순히 기계가 시를 암송할 수 있느냐가 아니라, 시들어가는 꽃에 대한 구절과 깊은 슬픔 사이를 잇는 숨겨진 실마리를 파악할 수 있는지, 혹은 왜 시인이 밤이 땅에서 솟아오른다고 묘사하는지를 이해할 수 있느냐는 것이었다. 이에 답하기 위해 중국과 일본의 대학 연구진들은 이 기계들의 능력을 측정하기 위한 특화된 도전 과제를 설계하여, 현대 중국 시의 독특한 논리를 탐색할 수 있는 새로운 방법을 구축하고자 했다.

연구진은 인공지능이 현대 중국 시의 숨겨진 구조를 진정으로 이해할 수 있는지 확인하기 위해, 시에서 자주 발견되는 꽃의 이름을 딴 '피오니(Peony)'라는 새로운 테스트 환경을 만들었다. 그들은 동시대 시인들이 쓴 800편의 고품질 시를 수집했는데, 이는 컴퓨터가 학습 데이터에서 정답을 단순히 암기하지 못하도록 충분히 신선한 자료를 확보하기 위함이었다. 연구진은 기계에게 시를 쓰거나 번역하게 하는 대신, 모델이 독자처럼 생각하도록 강제하는 네 가지 특정한 퍼즐을 설계했다. 처음 두 퍼즐은 섞여 있는 시의 조각들을 행 단위 또는 연 단위로 올바른 순서대로 다시 배치하도록 요구했다. 나머지 두 퍼즐은 모델이 시의 정서적, 논리적 흐름에 부합하는 단어나 문장을 선택하고, 소리는 비슷하지만 시의 내부 논리를 깨뜨리는 다른 선택지들을 배제하며 빈칸을 채우도록 설계되었다.

연구진이 사용 가능한 가장 강력한 6개의 언어 모델을 대상으로 이 테스트를 실행한 결과, 인간의 이해와 기계의 처리 능력 사이에 상당한 격차가 있음이 드러났다. 일부 모델은 단순한 이미지를 매칭하는 작업에서는 준수한 성능을 보였으나, 시의 더 깊은 서사나 감정적 여정을 따라가는 데는 큰 어려움을 겪었다. 문제를 단계별로 추론하는 '사고(thinking)' 과정을 사용하는 가장 유능한 모델들이 즉각적으로 답변하는 모델들보다 더 나은 성과를 보였지만, 가장 뛰어난 성능을 보인 모델조차 일관되게 논리를 맞추는 데는 실패했다. 모델이 시의 두 먼 구절 사이의 연결성을 추론해야 하는 가장 어려운 과제에서 성공률은 놀라울 정도로 낮았다. 데이터에 따르면, 이 기계들은 개별적인 단어나 구절을 고립된 상태에서 식별할 수는 있었지만, 시 전체를 한꺼번에 마음속에 담아두고 전체적인 맥락을 유지하는 데는 자주 실패했다. 그들은 개별 벽돌은 볼 수 있었지만, 건물의 형상은 이해하지 못하는 경우가 많았다.

또한 이 연구는 이러한 모델들이 해당 장르를 정의하는 '시적 논리'를 다루는 방식에 있어 특정 약점이 있음을 강조했다. 현대 중국 시는 밤이 땅에서 솟아오르거나 얼굴이 연꽃이 피고 지는 것과 같다는 식의, 서로 모순되어 보이는 이미지들을 병치하는 것에 의존하는 경우가 많다. 연구진은 모델들이 인간 독자가 만드는 깊고 추상적인 정서적 연결보다는 표면적인 의미와 흔한 연상에 의존하는 경향이 있다는 것을 발견했다. 예를 들어, 시가 유명한 역사적 인물이나 문화적 개념을 언급할 때, 모델들은 그 참조가 시의 주제와 맺고 있는 미묘한 연결고리를 놓치고, 단어를 의미의 전달체가 아닌 단순한 데이터 포인트로 취급하는 경우가 많았다. 이는 인공지능이 언어의 메커니즘은 숙달했을지라도, 시인들이 거주하는 추상적이고 감정적인 풍경을 항해하는 직관적 능력은 여전히 부족함을 시사한다.

연구진은 현재의 인공지능 시스템이 현대 중국 시의 시적 논리를 완전히 이해할 준비가 아직 되지 않았다고 결론지었다. 모델들은 형식을 흉내 내거나 익숙한 패턴을 포착하여 우연히 정답을 맞힐 수는 있지만, 이미지, 감정, 그리고 침묵의 상호작용으로부터 발생하는 총체적인 의미를 재구성하는 데는 어려움을 겪는다. '피오니' 벤치마크는 이러한 시스템들의 현재 위치를 보여주는 명확한 지도 역할을 하며, 단어를 처리하는 것에서 시의 영혼을 이해하는 것으로 넘어가는 과정이 여전히 거대한 거리임을 보여준다. 기술이 계속 진화함에 따라, 이 새로운 테스트는 기계가 얼마나 말을 잘하는지가 아니라, 시를 독특한 인간적 예술 형식으로 만드는 말하지 않은 연결들을 얼마나 깊이 느낄 수 있는지를 측정하는 방법이 될 것이다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →