← 최신 논문
💬 NLP

Do Composed Image Retrieval Benchmarks Require Multimodal Composition?

본 논문은 현재 결합 이미지 검색 (CIR) 벤치마크가 다중 모달 조합 능력을 과대평가하고 있는데, 그 이유는 상당수의 쿼리가 단일 모달 단축경로를 통해 해결되거나 형성이 부실하기 때문이며, 따라서 모델이 이미지와 텍스트 입력을 진정으로 결합하는지 확인하기 위해 검증된 부분집합이 필요함을 밝힌다.

원저자: Matteo Attimonelli, Alessandro De Bellis, Aryo Pradipta Gema, Rohit Saxena, Monica Sekoyan, Wai-Chung Kwan, Claudio Pomo, Alessandro Suglia, Dietmar Jannach, Tommaso Di Noia, Pasquale Minervini

게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Matteo Attimonelli, Alessandro De Bellis, Aryo Pradipta Gema, Rohit Saxena, Monica Sekoyan, Wai-Chung Kwan, Claudio Pomo, Alessandro Suglia, Dietmar Jannach, Tommaso Di Noia, Pasquale Minervini

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"그림 맞추기" 게임을 한다고 상상해 보세요.

이 게임에서는 수백만 장의 이미지가 담긴 거대한 도서관에 숨겨진 특정 사진을 찾기 위해 두 가지 단서가 제공됩니다:

  1. 시작 사진 (예: 빨간 드레스 사진).
  2. 텍스트 지시 (예: "파란색으로 바꾸고 긴 소매를 추가하세요").

목표는 목표 사진 (긴 소매가 달린 파란 드레스) 을 찾는 것입니다. 이를 구성된 이미지 검색 (Composed Image Retrieval, CIR) 이라고 합니다. 핵심은 지능형 컴퓨터가 시각적 단서 (빨간 드레스) 와 텍스트 단서 (지시 사항) 를 결합하여 퍼즐을 풀어야 한다는 점입니다. 이를 수행하지 못한다면, 이미지와 단어를 어떻게 혼합하는지 진정으로 "이해"하고 있다고 볼 수 없습니다.

문제: 치트 코드

이 논문의 저자들은 AI 모델이 이 작업을 얼마나 잘 수행하는지 테스트하는 데 사용되는 네 가지 인기 있는 "그림 맞추기" 게임 (벤치마크) 을 조사했습니다. 그들은 이 게임들이 치트 코드로 조작되어 있다고 의심했습니다.

그들은 수많은 퍼즐에서 AI 가 실제로 이미지와 텍스트를 결합할 필요가 없다는 사실을 발견했습니다. AI 는 단 하나의 단서만으로도 승리할 수 있었습니다:

  • 텍스트 치트: 때로는 텍스트 지시가 너무 구체적이어서 ("긴 소매가 달린 파란 드레스 사진 찾기") AI 가 시작 사진을 완전히 무시하고 텍스트 설명만 검색할 수 있었습니다. AI 는 이미지를 한 번도 보지 않고 정답을 찾았습니다.
  • 이미지 치트: 때로는 텍스트 지시가 너무 모호하거나 도움이 되지 않아 ("더 좋게 만들어 주세요") AI 가 텍스트를 무시하고 시작 사진만으로 추측할 수 있었습니다.

은유:
선생님이 학생에게 "5 로 시작해서 3 을 더하세요"라는 수학 문제를 준다고 상상해 보세요.

  • 진정한 학습: 학생이 5+3=85 + 3 = 8을 계산합니다.
  • 치트: 학생은 "5 로 시작"이라는 부분을 무시하고 "3 을 더하면 항상 8 이다"라고 암기하거나, 수학 계산은 무시하고 선생님이 항상 8 을 정답으로 고른다는 사실만 기억하여 추측합니다.

이 논문은 이러한 AI 벤치마크에서 질문의 32% 에서 83% 가 실제로 학생 (AI) 이 실제 수학 계산 (이미지와 텍스트 결합) 을 수행할 필요 없이, 하나의 단서 (치트) 만으로도 해결 가능했음을 발견했습니다. 이는 AI 모델이 얻은 높은 점수가 종종 가짜였다는 것을 의미합니다. 그들은 배우는 것이 아니라 치트 코드를 사용하고 있었던 것입니다.

두 번째 문제: 깨진 퍼즐

그런 다음 저자들은 질문했습니다: "좋습니다. 치트 질문을 모두 제거합시다. 이제 두 가지 단서가 모두 필요한 어려운 퍼즐만 남았습니다. 그것들이 공정한가요?"

그들은 인간에게 남은 "어려운" 퍼즐들을 살펴보도록 요청했습니다. 그들은 많은 퍼즐이 깨져 있음을 발견했습니다:

  • 너무 모호함: 지시가 "더 어둡게 만들어 주세요"였지만, 도서관에는 드레스의 어두운 버전이 50 가지나 있었습니다. 어느 것이 "정답"일까요? 이 퍼즐에는 유일한 정답이 없었습니다.
  • 불일치: 지시가 "모자를 추가하세요"였지만, "정답" 사진에는 모자가 전혀 없었습니다. 이 퍼즐은 처음부터 깨져 있었습니다.

은유:
선생님이 학생에게 "둥글고 빨간 것은 무엇인가요?"라는 수수께끼를 준 것과 같습니다.

  • 깨진 퍼즐: 선생님은 정답이 "사과"라고 말하지만, 학생도 "토마토"나 "공"이라고 올바르게 답할 수 있습니다. 정답이 여러 개이므로 이 시험은 불공평합니다.
  • 불일치: 선생님은 정답이 "네모"라고 말하지만, 수수께끼는 둥근 것을 물었습니다. 이 시험은 터무니없습니다.

해결책: CIRCUS

이를 해결하기 위해 저자들은 CIRCUS라는 새로운, 정제된 버전의 테스트를 만들었습니다.

  1. AI 가 하나의 단서만으로 승리할 수 있는 모든 "치트" 질문을 제거했습니다.
  2. 정답이 모호하거나 잘못된 모든 "깨진" 질문을 제거했습니다.

그 결과, 실제로 어려운 퍼즐 1,689 개로 구성된 훨씬 더 작은 세트가 남았습니다.

결과: AI 점수가 훨씬 떨어졌습니다 (하지만 이는 좋은 일입니다)

이 새로운 깨끗한 세트의 퍼즐로 AI 모델을 다시 테스트했을 때:

  • 점수가 극적으로 하락했습니다. 예를 들어, 한 모델의 한 테스트 점수는 70% 에서 24% 로 떨어졌습니다.
  • 왜 이것이 좋은가요? 이는 해당 모델이 이전에 이미지와 텍스트를 결합하는 데 실제로 뛰어났던 것이 아니라, 치트 코드를 찾아내는 데만 능숙했다는 것을 증명합니다.
  • 새로운 깨끗한 테스트에서는 모델이 정답을 맞추기 위해 실제로 이미지와 텍스트를 모두 사용해야만 했습니다. 텍스트만, 이미지만, 그리고 둘 다 사용할 때의 "격차"가 훨씬 더 명확해졌습니다.

결론

이 논문은 "이미지와 텍스트를 혼합하는" 현재의 AI 테스트는 결함이 있다고 결론지었습니다. 이는 핸들을 전혀 돌리지 않고 가속 페달만 밟아도 통과할 수 있는 운전 시험과 같습니다. 저자들은 자동차가 실제로 핸들을 돌리게 만드는 새로운, 더 엄격한 운전 시험 (CIRCUS) 을 구축했습니다. 이러한 테스트를 사용할 때까지는 우리의 AI 가 얼마나 똑똑한지 과대평가하고 있을 가능성이 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →