← 최신 논문
💻 computer science

FlowCIR: Semantic Transport via Flow Matching for Zero-Shot Composed Image Retrieval

FlowCIR은 텍스트 인버전 없이 참조 임베딩과 대상 임베딩 사이의 의미론적 수송(semantic transport)을 수행하기 위해 조건부 플로우 매칭(conditional flow matching)을 활용하는 동시에, 부정 표현이 많은 쿼리를 견고하게 처리하기 위해 다중 부정 스티어링(Multi-Negative Steering) 전략을 채택한 계산 효율적인 제로샷 합성 이미지 검색 프레임워크를 소개한다.

원저자: Zhenqi He, Ziqi Jiang, Yuanpei Liu, Yanghao Wang, Teng Wang, Long Chen

게시일 2026-07-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhenqi He, Ziqi Jiang, Yuanpei Liu, Yanghao Wang, Teng Wang, Long Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 도서관에서 특정 사진을 찾고 있다고 상상해 보세요. 하지만 당신은 그 사진을 처음부터 설명할 수 없습니다. 대신, 당신에게는 참조 사진(예: 강아지 사진)과 텍스트 지시어(예: "강아지가 하늘을 올려다보게 해줘")가 있습니다. 당신의 목표는 지시사항을 적용한 후의 모습과 일치하는 정확한 사진을 찾는 것입니다. 이것을 **구성된 이미지 검색(Composed Image Retrieval)**이라고 부릅니다.

문제는, 특정 사례에 대한 사전 학습 없이(Zero-Shot) 이를 수행하는 것이 매우 어렵다는 점입니다. 기존 방식들은 참조 사진을 몇 개의 "가짜 단어"로 변환한 뒤, 그 단어들을 지시어 옆에 그냥 붙여넣는 방식을 사용했습니다. 이는 마치 복잡한 그림을 단 세 개의 포스트잇으로 설명하려는 것과 같습니다. 필연적으로 세부 사항을 놓치게 되며, 결과물은 엉망이 되기 일쑤입니다.

FlowCIR은 이 판도를 바꾸는 새로운 방법입니다. 이 방식이 어떻게 작동하는지, 몇 가지 간단한 비유를 통해 설명해 드리겠습니다.

1. 옛날 방식 vs 새로운 방식

  • 옛날 방식 (텍ual Inversion): 빨간 자동차 사진이 있다고 가정해 봅시다. 컴퓨터에게 이 사진을 알려주기 위해, 전체 이미지를 "red-car-token"이라는 하나의 단어로 압축하려고 시도합니다. 그런 다음 "파랗게 만들어줘"라는 지시어를 추가합니다. 컴퓨터는 이 두 토큰을 하나로 뭉치려고 노력합니다. 이는 마치 색의 이름을 외치는 것만으로 물감을 섞으려는 것과 같습니다. 결과는 종종 탁하고 부정확합니다.
  • 새로운 방식 (Flow Matching): FlowCIR은 이 과정을 항해처럼 다룹니다. 이미지를 단어로 압축하는 대신, 지시어를 지도 위의 출발점으로, 목표 사진을 목적지로 간주합니다. 이 방식은 지시어를 시작점에서 목표 사진을 향해 부드럽게 밀어주는 "흐름(flow field)"을 학습합니다. 이때 참조 사진(빨간 자동차)을 가이드로 삼아 유지하면서 말이죠. 이는 서투른 도약이 아니라 부드럽고 연속적인 여정입니다.

2. 왜 그렇게 빠르고 효율적인가

대부분의 기존 방식은 이미지를 저런 "가짜 단어"로 변환하기 위해 거대한 컴퓨터와 며칠간의 학습 시간이 필요했습니다.

  • FlowCIR의 비밀: FlowCIR은 이미지와 텍스트를 이해하는 거대한 뇌(AI 모델)를 다시 학습시키지 않습니다. 대신 아주 작고 가벼운 "항해사(navigator)" 모듈만을 학습시킵니다.
  • 비유: 당신에게 이미 도서관 전체를 알고 있는 매우 똑똑한 사서가 있다고 상상해 보세요. 사서에게 새로운 언어를 가르치는 대신, 당신의 요청에 따라 어느 통로로 걸어가야 할지 정확히 아는 작고 효율적인 조수를 고용하는 것입니다. 덕분에 FlowCIR은 다른 방식들이 슈퍼컴퓨터로 며칠이 걸릴 때, 단일 표준 컴퓨터에서 한 시간 미만으로 학습을 마칠 수 있습니다.

3. "부정(Negation)" 문제 ( "아니오"의 함정)

AI 모델은 "아니오"나 "제거"라는 말을 들으면 혼란에 빠지곤 합니다. 만약 당신이 "강아지를 제거해"라고 말하면, AI의 마음속에는 "강아지"와 "강아지 없음"이 너무 가깝게 붙어 있기 때문에 여전히 강아지에 대해 생각하며 갇혀버릴 수 있습니다.

  • 해결책 (Multi-Negative Steering): FlowCIR은 이를 위한 특별한 기술을 가지고 있습니다. "강아지를 제거해"라는 말을 들었을 때, 단순히 듣기만 하는 것이 아니라, 정신적 지도 속에서 "강아지"라는 개념을 적극적으로 밀어냅니다.
  • 비유: 당신이 시끄러운 소음으로부터 멀어지려고 한다고 상상해 보세요. 단순히 앞으로 걷는 것이 아니라, 충분히 멀어지기 위해 적극적으로 반대 방향으로 발을 내디디는 것입니다. FlowCIR은 수학적으로 이 작업을 수행하여, 당신이 원하지 않는 것들로부터 검색 방향을 틀어버림으로써 "줄무늬 없이" 또는 "모자 없이"와 같은 지시어를 훨씬 더 잘 처리합니다.

4. 결과

저자들은 표준 사진 검색 챌린지에 FlowCIR을 테스트했습니다.

  • 성능: 거의 모든 최근 방식들보다 더 정확하게 맞는 사진을 찾아냈습니다.
  • 효율성: 경쟁 모델들이 요구하는 컴퓨팅 파워와 시간의 아주 적은 부분만을 사용하면서도 이 성과를 냈습니다.
  • 강건성(Robustness): 물체를 제거하는 것과 같은 까다로운 지시어를 이전 시스템들보다 훨씬 더 잘 처리했습니다.

요약하자면: FlowCIR은 "전후 사진"과 "변경 지시어"를 바탕으로 사진을 찾는 더 똑똑하고, 빠르고, 효율적인 방법입니다. 단어들을 서투르게 뭉치는 대신, AI의 세상에 대한 이해를 부드럽게 항해하여, 당신이 무언가를 제거해 달라고 요청하더라도 당신이 찾고 있는 바로 그 이미지를 찾아냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →