← 최신 논문
💻 computer science

TIIF-Bench: How Does Your T2I Model Follow Your Instructions?

이 논문은 자동화된 시각-언어 모델 평가기를 사용하여 텍스트-이미지 생성 모델의 세밀한 지시 이행 능력을 체계적으로 평가하기 위해, 5,000개의 다양한 프롬프트와 새로운 전역 정규화 편집 거리(Global Normalized Edit Distance) 지표를 특징으로 하는 포괄적인 벤치마크인 TIIF-Bench를 소개한다.

원저자: Xinyu Wei, Jinrui Zhang, Zeqing Wang, Hongyang Wei, Zhen Guo, Bairui Li, Lei Zhang

게시일 2026-07-14
📖 5 분 읽기🧠 심층 분석

원저자: Xinyu Wei, Jinrui Zhang, Zeqing Wang, Hongyang Wei, Zhen Guo, Bairui Li, Lei Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇 화가에게 매우 구체적인 대본을 주는 감독이라고 상상해 보세요. 당신은 이렇게 말합니다. "빨간 모자를 쓴 고양이가 파란 의자에 앉아 왼쪽을 바라보고 있는 그림을 그려줘." 만약 로봇이 초록색 모자를 쓰고 빨간 의자에 앉아 오른쪽을 바라보는 고양이를 그린다면, 그것은 당신의 지시를 어긴 것입니다. 오랫동안 우리는 이 로봇 화가들(텍스트-투-이미지 또는 T2I 모델이라 불리는)이 우리의 말을 얼마나 잘 듣는지 파악하기 위해 노력해 왔습니다. 하지만 우리가 사용해 온 테스트들은 마치 고장 난 자와 같습니다. 너무 짧고, 엉뚱한 것을 측정하며, 종종 점수를 잘못 매기기도 합니다.

여기에 TIIF-Bench가 등장합니다. 연구자들이 AI 화가들이 우리의 지시 사항 중 세부적인 디테일까지 실제로 따라 할 수 있는지 확인하기 위해 만든, 아주 정밀하고 새로운 자입니다.

문제점: 기존의 자들은 고장 나 있었다

기존의 테스트 방식은 심사위원이 전체적인 큰 그림만 보고 판단하는 "그림 맞히기 게임"과 같습니다.

  • "일률적인 적용"의 결함: 기존 테스트는 보통 AI에게 단 한 가지 버전의 프롬프트만을 제공했습니다. 이는 어떤 AI가 기분 변화가 심한 것과 같다는 사실을 놓치게 만듭니다. 즉, 짧은 문장을 주면 완벽한 그림을 그리지만, 의미는 같더라도 몇 개의 묘사적인 단어를 더 추가하면 완전히 망쳐버리는 특성을 말합니다. 기존 테스트는 프롬프트 길이에 따른 모델의 대응 방식을 체계적으로 테스트하지 못했기 때문에 이를 잡아낼 수 없었습니다.
  • "중복성"의 결함: 많은 기존 벤치마크는 같은 노래를 볼륨만 약간씩 바꿔서 1,000번 재생하는 플레이리스트와 같았습니다. 논문에 따르면 많은 기존 벤치마크에는 엄청난 양의 **의미론적 중복(semantic redundancy)**이 존재합니다. 즉, 프롬프트들이 너무 유사해서 AI가 새로운 아이디어를 이해하는지 테스트하지 못한다는 것입니다. 실제로 일부 기존 벤치마크는 의미론적으로 고유한 프롬프트가 60% 미만이었습니다!
  • "게으른 심사위원"의 결함: 기존의 심사위원들은 학생의 에세이를 첫 문장만 훑어보고 성적을 매기는 선생님과 같았습니다. 그들은 단어의 순서나 논리는 무시한 채, 단어가 얼마나 일치하는지만 세는 "단어 가방(bag of words)" 방식의 단순한 도구(CLIP 등)를 사용했습니다. 만약 당신이 "소년 위에 있는 벌"과 "벌 위에 있는 소년"을 요청한다면, 이 기존 심사위원들은 둘을 구분하지 못하는 경우가 많았습니다!

새로운 해결책: TIIF-Bench

연구자들은 TIIF-Bench(Text-to-Image Instruction Following Benchmark)라는 5,000개의 질문으로 구성된 거대한 테스트를 구축했습니다. 이것은 주의를 기울이지 않는 AI를 골탕 먹이기 위해 설계된 거대한 장애물 코스와 같습니다.

1. "짧은 버전 vs 긴 버전"의 도전
이 테스트의 모든 지시는 짧은 버전과 화려한 버전, 두 가지 형태로 제공됩니다.

  • 짧은 버전: "새들이 물고기보다 더 많다."
  • 긴 버전: "새들이 새벽의 부드러운 빛을 받는 깃털을 휘날리며, 물결치는 수면 아래를 조용히 헤엄치는 수중 생물인 물고기보다 훨씬 더 많이 존재한다..."
    논문은 만 만약 AI가 동일한 의미를 유지하면서도 이 길고 화려한 버전을 처리하지 못한다면, 그것은 진정으로 "지시를 따르는 것"이 아니라고 제안합니다. 연구진은 최상위 모델들은 일관성을 유지하지만, 성능이 낮은 모델들은 추가된 단어들 때문에 혼란을 겪는다는 것을 발견했습니다.

2. "세 단계의 난이도"
테스트는 세 단계의 비디오 게임처럼 구성되어 있습니다:

  • 기초 따르기 (Basic Following): "빨간 개"와 같은 단순한 조합입니다.
  • 심화 따르기 (Advanced Following): "파란 고양이 옆에서 달리고 있는 빨간 개"처럼 요소를 섞거나, 심지어 이미지 안에 텍스트를 그려 넣는 것(예: 케이크 위에 "CAKE"라고 쓰기)을 요구합니다.
  • 디자이너 레벨 (Designer Level): 이것은 "보스전"입니다. "금발 머리의 남자가 다른 남자에게 메달을 수여하고 있으며, 그들의 셔츠에는 특정 텍st가 적혀 있다"와 같이 인간 디자이너들의 복잡하고 실제적인 요청들입니다. 여기에는 100개의 고품질 인간 큐레이션 프롬프트가 포함됩니다.

3. 새로운 "스마트 심사위원" (TIIF Evaluator)
게으른 선생님 대신, 논문은 탐정처럼 행동하는 초스마트 AI 심사위원(시각-언어 모델, VLM)을 사용합니다.

  • 체크리스트: 심사위원은 단순히 "잘했다" 또는 "못했다"라고 말하는 대신, 프롬프를 예/아니오 질문으로 이루어진 체크리스트로 분해합니다. 새/물고기 프롬프트의 경우, 심사위원은 "새가 있는가?", "물고기가 있는가?", "새가 물고기보다 더 많은가?"라고 묻습니다.
  • 추론 과정: 이 심사위원은 단순히 추측하는 것이 아니라, 답변을 내놓기 전에 자신의 추론 과정(Chain-of-Thought)을 작성합니다. 논문은 이 방식이 단순히 AI에게 "이 이미지가 좋은가?"라고 묻는 것보다 훨씬 더 신뢰할 수 있다는 것을 발견했습니다.
  • "환각(Hallucination)"의 함정: 논문은 심사위원의 질문에 전체 프롬프트를 그대로 붙여넣는 것에 대해 명시적으로 반대합니다. 연구진은 심사위원에게 전체 프롬프트를 보여주면, 프롬프트에 적혀 있다는 이유만으로 존재하지 않는 것을 상상해내는 "환각" 현상이 발생한다는 것을 발견했습니다. 새로운 방식은 구체적이고 고립된 질문을 던짐으로써 이를 방지합니다.

4. 특수 기술: 텍스트와 스타일

  • 텍스트 렌더링: 단어를 그리는 것은 AI에게 어렵습니다. 논문은 AI가 단어 철자를 얼마나 잘 쓰는지 측정하기 위해 GNED(Global Normalized Edit Distance)라는 새로운 지표를 도입했습니다. 이는 누락되거나 추가된 글자 수를 세는 맞춤법 검사기와 같습니다. 연구진은 일부 모델이 개선되고는 있지만, 여나는 여전히 많은 모델이 특히 긴 프롬프트에서 명확한 단어를 쓰는 데 어려움을 겪고 있다는 것을 발견했습니다.
  • 스타일 제어: 테스트에는 AI가 단순히 사물뿐만 아니라 "사이버펑크 도시"와 같은 참조 이미지의 분위기와 스타일을 복제할 수 있는지 확인하기 위한 참조 이미지가 포함됩니다.

무엇을 발견했는가: 승자와 패자

수십 개의 모델을 통해 5,000개의 프롬프트를 실행한 결과, 데이터는 다음과 같이 시사합니다:

  • 헤비급 모델: 다운로드할 수 없는 폐쇄형 모델(예: Nano-Banana, GPT-Image-1)이 현재 왕좌를 차지하고 있습니다. 이들은 특히 어려운 "디자이너 레벨" 프롬프트에서 가장 높은 점수를 받았습니다. 이들은 복잡한 지시와 긴 문장을 다른 모델들보다 더 잘 이해하는 것으로 보입니다.
  • 오픈 소스의 영웅들: 누구나 다운로드할 수 있는 모델 중에서는 Qwen-ImageFLUX.2가 가장 강력합니다. 이들은 거대 상업 모델들을 빠르게 추격하고 있습니다.
  • "통합형"의 놀라움: 어떤 모델들은 하나의 뇌(통합 모델) 안에서 텍스트 이해와 이미지 생성을 모두 수행하려고 합니다. 논문은 이러한 통합 모델들이 때때로 사진 같은 실사 느낌(photorealistic)은 덜할지라도, 지시를 따르는 능력에 있어서는 놀라울 정도로 뛰어나다고 제안합니다. 예를 들어, 자기회귀 모델인 Janus-Pro는 "차이(differentiation)"나 "부정(negation)"과 같은 논리 작업에서 확산 모델(diffusion model)인 PixArt-Sigma를 앞질렀습니다.
  • 길이 민감도: 논문은 높은 점수를 받은 모델들은 대개 프롬프트 길이에 대해 **강건(robust)**하다는 것을 측정했습니다. 프롬프트가 길어져도 점수가 높게 유지됩니다. 반면, 약한 모델들은 단어가 추가되면 점수가 급락합니다. 이는 언어를 깊이 이해하는 것이 좋은 그림을 그리는 것과 연결되어 있음을 시사합니다.

아직 알지 못하는 것들

논문은 자신들의 한계를 솔직하게 밝히고 있습니다.

  • 어휘 격차: 테스트는 주로 흔한 사물(고양이, 개, 의자)을 사용합니다. 저자들은 우리가 이 모델들이 생소하거나 희귀한 단어를 어떻게 다루는지 아직 모른다고 제안합니다.
  • 언어 장벽: 모든 프롬프트는 영어로 되어 있습니다. 논문은 이 결과가 다른 언어에도 적용될지는 아직 알 수 없다고 언급합니다.
  • 스타일의 뉘앙스: 격식 있는 언어와 대화체 언어가 결과에 어떤 차이를 만드는지에 대해서는 테스트하지 않았습니다.

결론

이 논문은 AI 예술을 "해결했다"고 주장하는 것이 아닙니다. 대신, 기존의 테스트 방식이 고장 났음을 시사합니다. 5,000개의 프롬프트, 짧은 버전과 긴 버전, 구체적인 체크리스트, 그리고 추론 기반의 심사위원을 사용하는 TIIF-Bench는 우리에게 훨씬 더 명확한 그림을 제공합니다. 이는 오늘날 최고의 모델들이 복잡하고 장황한 지시를 처리하면서도 평정심을 잃지 않는 모델들이며, "그림을 잘 그리는 것"과 "말을 잘 듣는 것" 사이의 간극이 새로운 세대의 AI에 의해 마침내 메워지고 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →