Simile Understanding in Text-to-Image Models: An Evaluation Framework
본 논문은 통제된 데이터셋, 자동 탐지 지표 및 인코더 레이어 분석을 통해 비유적 언어 이해와 시각적 접지 사이의 간극을 드러냄으로써, 텍스트-이미지 모델이 직유를 올바르게 해석하는 데 있어 지속적으로 실패하는 현상을 체계적으로 평가하고 진단하기 위한 확장 가능한 평가 프레임워크를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 수백만 장의 그림을 보았고 당신이 묘사하는 거의 모든 것을 그릴 줄 아는 초지능 로봇 예술가에게 말을 걸고 있다고 상상해 보세요. 이 로봇은 "모자를 쓴 고양이"와 같은 문장을 입력하면 그림을 그려내는 "텍스트-투-이미지(text-to-image)" 모델의 세계에 살고 있습니다. 하지만 "구름처럼 폭신폭신한 고양이"와 같이 더 시적인 요청을 할 때는 어떻게 될까요? 여기서 까다로운 문제가 발생합니다. 당신은 그림 속에 구름이 나타나기를 바라는 것이 아니라, 구름의 '폭신폭신함'이라는 느낌을 빌려와 고양이에게 부여해 달라고 요청하는 것입니다. 이것을 "직유법(simile)"이라고 부릅니다. 이는 무언가를 다른 것에 비유하여 설명하는 방법으로, 예를 들어 "그는 바람처럼 달린다"라고 말하는 것과 같습니다 (옆에서 바람이 함께 달리고 있다는 뜻이 아니라, 그가 매우 빠르다는 것을 의미하죠).
큰 질문은 바로 이것입니다. 이 로봇 예술가가 정말로 농담을 이해하고 있는 걸까요, 아니면 혼란에 빠져 "오, 고양이와 구름을 원하는구나?"라고 생각하며 둘 다 그려버리는 걸까요? 이 논문은 바로 이 문제에 대해 깊이 파고듭니다. 연구진은 로봇의 혼란을 "직유 대상의 문자 그대로의 구현 편향(literalization bias)"이라는 구체적인 실수로 취급합니다. 즉, 모델이 비교 대상(직유의 '매개체')을 단순히 그 속성으로 사용하는 대신, 그것을 실제의 물리적인 사물로 그려버리는 현상을 말합니다. 연구진은 이 현상이 얼마나 자주 발생하는지, 그리고 왜 발생하는지를 알아내기 위해 테스트를 구축하고자 했습니다. 왜냐하면 로봇이 은유를 이해하지 못한다면, 인간이 사용하는 창의적이고 다채로운 언어 방식을 이해할 수 없기 때문입니다.
위대한 "돌 빵" 테스트
이 AI 예술가들이 진정으로 창의적인지, 아니면 그저 글자 그대로만 따라 하는 복사기인지 알아내기 위해 연구진은 거대하고 통제된 놀이터를 만들었습니다. 연구진은 단순히 로봇에게 무작위적인 것을 그리라고 요청한 것이 아니라, "직유 프롬프트"라고 불리는 특정한 일련의 지침을 만들었습니다. 컴퓨터가 쉽게 인식할 수 있는 80가지의 서로 다른 대상(돌, 구름, 가위 등)을 선정하고, 이를 14가지의 서로 다른 문장 템플릿과 결합했습니다.
예를 들어, 로봇에게 "돌처럼 딱딱한 빵을 먹는 사람"을 그려달라고 요청할 수 있습니다. 정답은 테이블 위에 실제 돌이 놓여 있지 않으면서도, 딱딱하고 바삭해 보이는 빵의 모습입니다. 만약 로봇이 돌을 그린다면, 그것은 테스트에 실패한 것입니다. 연구진은 이 실패를 "직사적 구현 편향(literalization bias)"이라고 부릅니다. 이는 마치 아이에게 "나 곰처럼 배고파"라고 말했을 때, 아이가 당신이 매우 배고프다는 것을 이해하는 대신 실제로 주방에 진짜 곰을 데려오는 것과 같습니다.
탐정 작업: 로봇을 잡아내는 법
연구팀은 다섯 가지의 인기 있는 AI 이미지 생성기를 테스트했습니다. 로봇이 지시를 오해하고 있는지 확인하기 위해, 그들은 YOLO( "You Only Look Once"의 약자로, 매우 빠른 객체 탐지 도구)라는 디지털 탐정 도구를 사용했습니다. 이 도구는 로봇이 만든 모든 그림을 스캔하여 "비교 대상"(돌 빵 예시에서의 돌과 같은)이 실수로 이미지에 나타났는지 확인했습니다.
결과는 다소 엇갈렸지만, 로봇의 이해 능력에 있어서는 대체로 나쁜 소식이었습니다.
- 높은 실패 그룹: Qwen-Image라는 모델이 가장 심각한 위반자였습니다. 약 61.4%의 그림에서 이 모델은 속성 대신 직유 대상(돌, 구름 등)을 직접 그렸습니다. PixArt 모델은 약 49.5%의 확률로 실수를 저질렀습니다.
- 더 낫지만 여전히 결함이 있는 그룹: 다른 모델들(Dreamlike, FLUX, SD3.5)은 더 나은 모습을 보였지만, 여전히 약 30%에서 35% 정도의 확률로 실수를 범했습니다.
연구진은 또한 인간 심사위원들에게 그림을 보여주었습니다. 인간들은 컴퓨터 탐지기와 의견이 일치했습니다. 그림에 "돌"이나 "구름"이 보일 때, 인간들은 그 이미지를 직유에 대한 잘못된 해석이라고 평가했습니다. 흥미롭게도, 로봇이 "직설적인" 부분을 더 많이 틀릴수록, 문장의 실제 의미를 포착하는 능력도 떨어지는 것으로 나타났습니다. 즉, 트레이드오프 관계가 존재합니다. 추가적인 사물을 더 많이 그릴수록, 문장의 의미를 덜 이해하게 되는 것입니다.
표준 테스트가 놓친 실수들
여기 재미있는 반전이 있습니다. 연구진은 CLIPScore나 PickScore와 같이 AI 예술을 채점할 때 흔히 쓰이는 표준적인 "성적표"를 사용해 보았습니다. 이 도구들은 그림이 문장과 얼마나 잘 일치하는지를 알려주는 역할을 합니다. 하지만 이 도구들은 완전히 실패했습니다! 이 도구들은 잘못된 사물이 포함된 그림에도 높은 점수를 주었습니다. 이는 마치 학생에게 배고픔에 대해 쓰라고 했는데 곰을 그려온 학생에게, 그림의 품질이 높다는 이유만으로 "A"를 주는 선생님과 같습니다. 이 논문은 은유를 위한 새로운 종류의 테스트가 필요함을 증명합니다. 기존의 테스트들은 이러한 특정한 혼란을 포착하기에는 너무 눈이 멀어 있기 때문입니다.
로봇의 뇌 내부 들여다보기
로봇이 왜 이러한 실수를 저지르는지 이해하기 위해, 연구진은 "디퓨전 렌즈(Diffusion Lens)"라는 특별한 도구를 사용했습니다. 로봇의 뇌를 여러 층의 케이크라고 상상해 보세요. 아래쪽 층은 기본적인 형태에 대해 생각하는 곳이고, 위쪽 층은 최종적인 세부 사항을 배치하는 곳입니다.
연구진은 서로 다른 로봇들이 서로 다른 시점에 잘못된 대상에 대해 "생각"한다는 것을 발견했습니다.
- 조기 사고형 (The Early Thinkers): 일부 모델(FLUX, SD3.5 등)은 뇌의 아주 낮은 층 단계에서부터 거의 즉시 "돌"이나 "구름"에 대해 생각하기 시작했습니다. 일단 이 대상에 대해 생각하기 시작하면 멈출 수 없었고, 결국 최종 그림에 나타나게 되었습니다.
- 후기 사고형 (The Late Thinkers): 다른 모델들(Qwen-Image 등)은 뇌의 아주 높은 층까지 기다렸다가 대상을 생각했습니다. 그들이 생각을 마쳤을 때는 이미 그림에 나타나는 것을 막기에 너무 늦은 상태였습니다.
- 억제형 (The Suppressors): 몇몇 모델(Dreamlike 등)은 중간 층에서 해당 대상에 대해 생각했지만, 최종 그림이 완성되기 전에 성공적으로 이를 "억제"하거나 삭제했습니다. 이것이 그들이 실수를 적게 저지른 이유입니다 именно입니다.
해결할 수 있을까?
연구진은 지시어를 바꾸지 않고도 로봇이 잘못된 사물을 그리는 것을 멈추게 할 수 있는지 확인하기 위해 두 가지 기술을 시도했습니다.
- 주사위 굴리기 (무작위 재생성): 로봇에게 무작위 "시드(seed)" 번호(주사위를 굴리는 것과 같은)를 바꾸어 그림을 다시 그려보라고 요청했습니다. 이는 약간의 도움이 되었습니다. 가장 성능이 좋지 않았던 Qwen-Image의 경우, 실수율이 61.4%에서 24.4%로 떨어졌습니다. 이는 혼란에 빠진 예술가에게 다시 해보라고 요청하는 것과 같습니다. 운이 좋으면 가끔 제대로 해내기도 하니까요.
- 뇌 층 변경하기 (층 기반 재생성): 결정 과정에서 로봇이 다른 뇌 층을 사용하도록 강제했습니다. 이것은 일부 모델에 더 효과적이었습니다. PixArt의 경우, 실수율이 49.5%에서 17.6%로 떨어졌습니다.
하지만 논문은 이것이 마법 같은 해결책은 아니라고 주의를 줍니다. 로봇이 직설적인 돌을 그리는 것을 멈췄다고 해서, 빵의 "딱딱함"을 완벽하게 이해했다는 뜻은 아닙니다. 단지 그 명백하고 뻔한 실수를 저지르지 않게 되었을 뿐입니다.
결론
이 논문은 가장 발전된 AI 이미지 생성기들조차 여전히 직유의 기술로 고군분투하고 있음을 보여줍니다. 그들은 종 часто 비교 대상을 속성으로 사용하는 대신, 그 대상을 문자 그대로 그려버립니다. 우리는 재생성을 요청하거나 생각하는 방식을 미세하게 조정함으로써 이러한 실수를 줄일 수는 있지만, 아직 완전히 숙달하지는 못했습니다. 연구진은 이 문제를 측정하는 새로운 방법을 구축함으로써, 표준적인 테스트만으로는 이러한 창의적인 오해를 잡아낼 수 없음을 입증했습니다. 이는 로봇이 진정으로 인간의 언어를 이해하기 위해서는, 단어의 의미뿐만 아니라 우리가 마음속으로 그림을 그리기 위해 언어를 어떻게 사용하는지도 배워야 한다는 점을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.