← 최신 논문
💬 NLP

Can Language Models Imagine Without Seeing? Ekphrasis: Measuring Visual Creative Ideation in Text-Only LLMs

이 논문은 텍스트 전용 언어 모델의 유창한 산문 능력과 유용하고 표현력이 풍부하며 인구 통계학적으로 새로운 시각적 계획을 생성하는 실제 능력 사이를 구분함으로써, 텍스트 전용 언어 모델의 시각적 창의적 아이디어 구상 능력을 분리하여 측정하는 새로운 벤치마크이자 평가 프레임워크인 Ekphrasis를 소개한다.

원저자: Hongyu Luo, He Wang, Huihao Jing, Hong Ting Tsang, Yuxuan Liu, Wuganjing Song, Yauwai Yim, Chunyang Li, Yangqiu Song

게시일 2026-08-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hongyu Luo, He Wang, Huihao Jing, Hong Ting Tsang, Yuxuan Liu, Wuganjing Song, Yauwai Yim, Chunyang Li, Yangqiu Song

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 영화를 캐스팅하려는 감독이라고 상상해 보십시오. 하지만 당신은 아직 배우들을 볼 수 없습니다. 오직 장면을 글로 설명하는 시나리오 작가만이 있을 뿐입니다. 여기서 중요한 질문은 이것입니다. 이 시나리오 작가가 정말로 새롭고 흥미로운 장면을 '상상'할 수 있는가, 아니면 그저 화려한 말들을 엮어내어 창의적인 것처럼 들리게 할 뿐이지만 실제로는 누구나 천 번은 봤을 법한 똑같은 진부한 것들을 묘사하고 있는 것인가? 이것이 바로 인공지로 지능(AI), 특히 '거대 언어 모델(LLM)'의 세계에서 진행된 새로운 연구의 핵심에 있는 퍼즐입니다. 이야기를 쓰고, 질문에 답하며, 우리와 대화하는 이 초지능 컴퓨터 프로그램들에 대해 말입니다. 과학자들은 이 텍-전용 기계들이 이미지가 만들어지기 전에 아이디어를 진정으로 '시각화'할 수 있는지, 아니면 그저 유려한 언어로 속임수를 쓰고 있는 것인지 오랫동안 궁금해해 왔습니다. 이를 알아내기 위해, 연구자들은 AI의 묘사가 진정한 시각적 발명의 불꽃인지, 아니면 턱시도를 입은 채 재활용된 안전한 아이디어인지를 테스트할 방법이 필요했습니다.

여기에 홍콩 과학기술대학교(The Hong Kong University of Science and Technology)의 연구진이 설계한, 정확히 그것을 테스트하기 위한 새로운 '시험'인 EKPHRASIS가 등장합니다. EKPHRASIS를 AI를 위한 '창의력 체육관'이라고 생각하십시오. 연구진은 AI에게 그림을 그리라고 요구하는 대신(이 테스트에서는 직접 그릴 수 없으므로), 14개의 서로 다른 AI 모델에게 400개의 구체적인 창의적 과제를 부여했습니다. 이 과제들은 모델들에게 '시간 압박'과 같은 추상적인 개념을 시각적 장면으로 바꾸거나, 서로 관련 없는 두 아이디어를 결합하거나, 사물을 새로운 방식으로 재구성하도록 요구했습니다. 목표는 단순히 AI가 예쁜 문장을 쓰는지를 보는 것이 아니라, AI가 시각적 창의적 아이디어 생성(Visual Creative Ideation, VCI) 계획을 낼 수 있는지, 즉 과제에 유용하고, 머릿속에 선명한 그림을 그려낼 만큼 표현력이 풍부하며, 무엇보다도 중요한 점은, 다른 AI들이 늘 내놓는 지루하고 흔한 아이디어를 반복하지 않는 '새로움'을 갖춘 묘사를 할 수 있는지를 보는 것이었습니다.

연구 결과, 유창하고 아름다운 글쓰기는 일종의 함정이라는 사실이 밝혀졌습니다. AI는 믿기 힘들 정도로 창의적이고 생생한 단락을 쓸 수 있지만, 정작 내용은 시간을 나타내기 위해 모래시계를 사용하거나 슬픔을 나타내기 위해 폭풍우 구름을 사용하는 것과 같은 똑같은 오래된 시각적 진부함(clichés)을 묘사할 수 있습니다. 이 '새로움의 착각(novelty illusion)'을 잡아내기 위해, 연구팀은 특별한 채점 시스템을 구축했습니다. 그들은 단순히 "이것이 창의적인가?"라고 묻지 않았습니다. 대신 "이것이 유용한가? 머릿속에 그려지기 쉬운가? 그리고 다른 13개의 AI가 말했을 내용과 다른가?"라고 물었습니다. 그들은 모든 모델이 반복하는 흔하고 지루한 패턴을 지도화하기 위해 '타입 아이디어 그래프(Typed Idea Graphs)'라는 영리한 방법을 사용했으며, 새로운 답변들이 그러한 함정을 피했는지 확인했습니다.

결과는 매우 흥ersful하고 미묘했습니다. 연구는 '시각적 아이디어 생성'에 능숙하다는 것이 단 하나의 슈퍼파워가 아니라는 것을 발견했습니다. 어떤 AI들은 지시를 따르고 유용한 계획을 세우는 데는 뛰어났지만 매우 진부했습니다. 반면 어떤 AI들은 엄청나게 독창적이었지만 때때로 과제의 본질을 놓치기도 했습니다. 최상위 성적을 거둔 모델들, 예를 들어 Gemini 3.1 Pro와 GPT-5.4는 이 세 가지 특성을 모두 조절해 냈지만, 각기 다른 방식으로 해냈습니다. 결정적으로, 연구진은 가장 뛰어난 텍스트 묘사들을 가져와 별도의 도구를 사용하여 실제로 이미지를 생성했습니다. 인간들이 원본 텍스트를 보지 못한 채 이 이미지들을 보았을 때, 그들은 여전히 '높은 VCI'를 가진 텍스트 계획으로부터 생성된 이미지를 선호했습니다. 이는 AI가 단순히 예쁜 산문을 쓰는 것이 아니라, 정말로 시각적인 계획을 세우고 있었음을 시사합니다.

하지만 논문은 이것이 AI가 인간과 같은 '마음의 눈'이나 사적인 상상력을 가지고 있다는 것을 의미하지는 않는다고 신중하게 언급합니다. 이는 단지 이러한 텍-전용 모델들이 상세하고 이미지화할 준비가 된 청사진을 만들 수 있다는 것을 의미할 뿐입니다. 즉, 텍스트에서 이미지로 가는 여정에서 살아남는 청사진을 만든다는 것입니다. 이 연구는 현재의 모델들이 시각적 계획을 세우는 데 점점 더 나아지고 있지만, 여전히 그들이 사랑하도록 학습 데이터가 가르쳐준 '안전한' 아이디어들로부터 벗어나는 데 어려움을 겪고 있음을 시사합니다. 교훈은 명확합니다. AI가 창의적인 이야기를 쓴다고 해서 반드시 창의적인 시각적 아이디어를 가진 것은 아닙니다. 진정한 시각적 창의성을 측정하려면, 우리는 화려한 말들을 넘어 그 청사진이 실제로 새롭고, 유용하며, 제작될 준비가 되어 있는지 확인해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →