Benchmarking Frontier Text-to-Image Models on Image-Description Prompts
이 논문은 48개의 매우 복잡한 프롬프트를 통해 네 가지 최첨단 텍스트-이미지 모델(Gemini 3 Pro Image, FLUX.2, Ideogram 3.0, Hunyuan 3.0)을 벤치마킹하여, Gemini 3 Pro Image가 84.8/100점으로 앞서고 있음을 밝히는 동시에 현재의 시스템들이 주로 객체 수 세기, 기하학적 정확도, 그리고 텍스트 가독성 측면에서 어려움을 겪고 있다는 점을 강조한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 컴퓨팅의 고요한 웅성거림 속에서, 붓이나 점토가 아닌 단어로 그림을 그리는 새로운 종류의 예술가가 등장했습니다. 이들은 텍스트-투-이미지(text-to-image) 시스템으로, 인간의 설명을 듣고 그에 부합하는 그림을 그리려고 시도하는 컴퓨터 프로그램입니다. 수년 동안 이러한 시스템은 "매트 위에 앉아 있는 고양이"와 같은 단순한 요청을 대상으로 테스트되어 왔으며, 그 과정에서 놀라운 우아함을 보여주었습니다. 하지만 현실 세계는 결코 그렇게 단순하지 않습니다. 사용자가 정확히 네 개의 빨간 의자, 명확한 글자로 "OPEN"이라고 적힌 표지판, 그리고 물리 법칙을 따르는 물웅덩이의 반사광과 같이 구체적이고 복잡한 것을 요구할 때, 프로그램들은 종-종 비틀거리곤 합니다. 그들은 의자를 네 개 대신 세 개를 그리거나, 표지판의 글자를 뒤섞거나, 반사된 모습이 공중에 떠 있게 만들 수도 있습니다. 왜 이러한 시스템들이 실패하는지, 그리고 어떤 시스템이 가장 적게 실패하는지를 이해하는 것은 광고 디자인부터 스토리보드 제작에 이르기까지, 이들을 진지한 작업에 활용하고자 하는 모든 이들에게 매우 중요합니다. 쉬운 과제에는 잘 작동하는 시스템과 현실의 무질서하고 세밀한 요구를 처리할 수 있는 시스템 사이의 간극이야말로 진정한 지능의 시험대입니다.
한 연구팀은 가장 발전된 네 가지 이미지 생성 시스템을 엄격하게 테스트하여 이 간극을 측정하기 위해 나섰습니다. 그들은 컴퓨터에게 단순한 그림을 그리라고 요구하지 않았습니다. 대신, 실제 세계의 이미지 캡션 모음 중 가장 어려운 48개의 묘사를 입력했습니다. 이 프롬프트들은 정밀함을 요구하기 때문에 선택되었습니다. 즉, 물체의 정확한 개수, 특정 공간 배치, 그리고 장면 내에 삽입된 읽을 수 있는 텍스트 등을 요구하는 것들입니다. 테스트된 시스템은 Hunyuan 3.0, Gemini 3 Pro Image, Black Forest Labs FLUX.2, 그리고 Ideogram 3.0이었습니다. 공정하고 편향되지 않은 판단을 보장하기 위해, 연구진은 영리한 2단계 프로세스를 채택했습니다. 먼저, 하나의 인공지능 모델이 작가 역할을 하여 각 특정 프롬프트에 대해 완벽한 이미지가 갖추어야 할 모습에 대한 상세한 체크리스트를 작성하는 동시에, 실제 생성된 이미지를 살펴보고 명백한 결함을 기록했습니다. 그다음, 완전히 다른 인공지능 모델이 심판 역할을 맡아 그 체크리스트를 바탕으로 이미지를 채점했습니다. 이러한 분리는 무엇을 살펴볼지 결정하는 모델이 테스트 통과 여부를 결정하는 모델과 동일하지 않도록 함으로써, 시스템이 자신의 작업을 스스로 채점할 때 발생할 수 있는 편향을 제거했습니다.
결과는 능력의 명확한 차이를 드러냈습니다. 두 시스템, Gemini 3 Pro Image와 FLUX.2가 각각 100점 만점에 84.8점과 82.3점을 기록하며 선두로 떠올랐습니다. 그 뒤를 이어 Ideogram 3.0이 65.7점, Hunyuan 3.0이 63.3점을 기록하며 상당한 격차가 나타났습니다. 상위권과 하위권의 차이는 단순히 작은 오류의 문제가 아니라, 복잡성을 다루는 방식의 근본적인 차이였습니다. 선두 그룹의 시스템들은 대체로 큰 그림은 제대로 잡아냈지만, 물체의 개수를 잘못 세거나 바퀴가 프레임과 이상하게 합쳐지는 등의 미세한 기하학적 결함을 도입하기도 했습니다. 반면, 뒤처진 시스템들은 기초적인 부분에서 고전했습니다. 그들은 요청된 요소를 아예 누락하거나, 텍스트를 명확한 글자가 아닌 읽을 수 없는 낙서처럼 엉망으로 만드는 등 요청된 요소를 포함하는 데 자주 실패했습니다. 예를 들어, 자동차 모양의 우체통에 특정 주소가 적혀 있는 그림을 요청했을 때, 상위 시스템은 모든 세부 사항을 정확하게 구현했지만, 최하위 점수를 받은 시스템은 우체통을 자동차처럼 만들지도 못했고, 주소도 놓쳤으며, 네 개의 타이어 대신 두 개의 타이어만을 그렸습니다.
이 연구는 이러한 시스템들이 개선되고는 있지만, 여전히 이산적(discrete)이고 상징적인 규칙을 본질적으로 이해하는 데는 부족하다는 점을 강조합니다. 이들은 장면의 전반적인 분위기, 색상, 구도를 포착하는 데는 뛰어나지만, 물체의 개수를 세거나 단어를 정확하게 쓰는 데 필요한 정밀한 논리를 다루는 데는 어려움을 겪습니다. 연구진은 모든 시스템에게 가장 힘들었던 과제가 5번부터 8번까지 번호가 매겨진 출발대를 그리는 것과 같은 정확한 순차적 라벨링과, 특정 숫자의 사람이나 물체를 세는 것이라는 점을 발견했습니다. 가장 성적이 좋은 Gemini 3 Pro Image조차 이러한 과제에서 점수를 잃었으나, 다른 시스템들에 비해서는 훨씬 적게 발생했습니다. 특히 Ideogram 3.0과 같은 하위 시스템들은 요청된 요소 전체를 누락하는 패턴을 보였는데, 이는 그들이 세부 사항을 틀리게 시도하기보다는 복잡한 지시 사항에 대해 아예 포기해 버리는 경우가 있음을 시사합니다. 이러한 차이점은 사용자에게 매우 중요합니다. 만약 프로젝트가 많은 별개의 물체가 포함된 장면을 필요로 한다면 선두 그룹의 시스템이 훨씬 더 신뢰할 수 있지만, 이미지 내에 텍ks트를 생성하는 것이 목표라면 가장 좋은 시스템이라 할지라도 매번 완벽하게 해내기는 어렵습니다.
궁극적으로 이 연구는 복잡한 지시를 따르는 능력이 이미지 생성의 새로운 개척지임을 입증합니다. 최고와 나머지 사이의 간극은 스타일이나 예술적 기교의 문제가 아니라 논리적 일관성의 문제입니다. 두 선두 시스템은 구성적 요구 사항의 중책을 감당할 수 있음을 증명한 반면, 나머지 시스템들은 현실의 환상을 깨뜨리는 근본적인 오류를 범하기 쉽습니다. 이러한 도구들이 실험적인 호기심을 넘어 생산 도구로 이동함에 따라, 어떤 시스템을 사용할지에 대한 선택은 구체적인 작업 내용에 크게 좌우될 것입니다. 단순하고 분위기 있는 이미지를 위해서는 차이가 미미할 수 있지만, 정밀함을 요구하는 요청의 경우, 선두 그룹은 다른 시스템들이 아직 도달하지 못한 수준의 신뢰성을 제공합니다. 앞으로의 과제는 이러한 시스템들이 숫자, 텍스트, 공간의 규칙을 더 잘 이해하도록 다듬어, 세부 사항을 짐작하는 예술가에서 그것들을 확실하게 실행할 수 있는 도구로 변모시키는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.