← 최신 논문
🤖 AI

Decoupling Endpoint and Semantic Transition Learning for Zero-Shot Composed Image Retrieval

본 논문은 저랭크 방향 병합을 통해 엔드포인트 학습과 전환 학습을 별도의 저랭크 어댑터 브랜치로 분리하여 결합함으로써 의미적 전환 병목 현상을 해결하고 추론 복잡성을 증가시키지 않으면서 복잡한 의미적 수정에 대한 성능을 향상시키는 제로샷 합성 이미지 검색을 위한 새로운 투영 기반 프레임워크인 DeCIR을 제안합니다.

원저자: Mingyu Liu, Sihan Huang, Yijia Fan, Yinlin Yan, Quan Zhang, Jian-Fang Hu, Jianhuang Lai

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mingyu Liu, Sihan Huang, Yijia Fan, Yinlin Yan, Quan Zhang, Jian-Fang Hu, Jianhuang Lai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"새로운 그림 찾기" 게임을 한다고 상상해 보세요.

컴퓨터에 참고 사진(예: 나뭇가지에 앉아 있는 초록색 새의 사진)을 보여주고, 텍스트 지시(예: "새를 두 마리 만들어 주세요")를 내립니다. 컴퓨터의 임무는 거대한 라이브러리에서 당신의 설명과 일치하는 목표 사진을 찾아내는 것입니다. 즉, 두 마리의 새를 보여줘야 하지만, 원래 사진처럼 여전히 초록색이고 나뭇가지 위에 있어야 합니다.

이를 **구성된 이미지 검색 (Composed Image Retrieval)**이라고 합니다. 까다로운 점은 'Before(전)', 'Instruction(지시)', 'After(후)' 사진의 수천 가지 예시를 교사에게 보여주고 가르치지 않고 이를 수행하는 것입니다. 이를 Zero-Shot(제로 샷) 학습이라고 합니다.

문제: "단순화"의 함정

이 논문은 현재의 경량 컴퓨터 모델이 게으른 단순화 (shortcut) 를 취한다고 주장합니다.

"새를 두 마리 만들어 주세요"라고 말하면, 표준 모델은 종종 원래 사진의 "초록색 새" 부분을 무시합니다. 그저 "새 두 마리"라는 말만 듣고, 새가 빨간색이든 파란색이든 하늘을 날고 있든 상관없이 새 두 마리가 든 어떤 사진이나 집어냅니다. 이는 당신의 지시를 최종 결과에 대한 단순한 라벨로 취급할 뿐, 원래 이미지를 변경하기 위한 일련의 규칙으로 간주하지 않는 것입니다.

저자들은 이를 **"엔드포인트 단순화 (Endpoint Shortcut)"**라고 부릅니다. 모델은 목적지 (새 두 마리) 는 보지만, 여정 (초록색 새에서 시작) 은 잊어버립니다.

갈등: 두 가지를 동시에 배우려다

이를 해결하기 위해 연구자들은 모델에게 두 가지를 동시에 가르치려 했습니다.

  1. 목적지: "새 두 마리가 있는 사진을 찾아라."
  2. 여정: "초록색 새를 두 마리의 초록색 새로 바꾸는 방법을 이해하라."

그들은 두 가지 교훈을 컴퓨터 뇌의 같은 작은 부분 (텍스트 어댑터라고 함) 에 밀어 넣으려 했습니다. 하지만 이로 인해 교통 체증이 발생했습니다. "목적지 찾기"와 "여정 학습"에 대한 지시가 뇌를 서로 반대 방향으로 밀어 모델이 혼란에 빠지고 두 가지 작업 모두에서 성능이 저하되었습니다.

해결책: DeCIR (Decoupled CIR)

저자들은 DeCIR이라는 새로운 방법을 제안합니다. 이는 같은 학생에게 두 명의 전문 과외 교사를 고용하되, 각자가 다른 과목을 따로 가르친 후 노트를 합치는 것과 같습니다.

  1. "목적지" 과외 교사: 이 교사는 최종 설명 (예: "새 두 마리") 과의 일치에만 집중합니다.
  2. "여정" 과외 교사: 이 교사는 변경 자체에 집중합니다. 이를 가르치기 위해 컴퓨터는 스마트한 AI(대형 언어 모델, LLM) 를 이용해 스스로 연습 문제를 만들어냅니다. 일반적인 사진과 캡션을 가져와서 "전진" 지시 (어떻게 변경할지) 와 "역행" 지시 (그 변경을 어떻게 되돌릴지) 를 만들어냅니다. 이는 모델에게 결과뿐만 아니라 변경의 방향을 가르칩니다.

마법 같은 병합 (LRDM):
두 과외 교사가 각각의 훈련을 마친 후, 연구자들은 **Low-Rank Directional Merge (LRDM, 저랭크 방향 병합)**이라는 특수 기술을 사용합니다.

  • "목적지" 과외 교사는 견고한 배낭 (주요 구조) 을 가지고 있다고 상상해 보세요.
  • "여정" 과외 교사는 구체적인 방향이 적힌 스티키 노트 세트를 가지고 있습니다.
  • 학생이 두 개의 무거운 배낭을 메는 대신, "여정" 노트를 "목적지" 배낭 에 붙입니다.

이제 학생은 실제 게임 도중 두 명의 무거운 과외 교사가 필요 없이, 어디로 가야 하는지 그리고 어떻게 그곳에 도달할지 아는 하나의 가벼운 배낭을 갖게 됩니다.

왜 이것이 중요한가

  • 최종 단계에서 무거운 LLM 불필요: 다른 방법들이 모든 요청을 처리하기 위해 거대하고 느린 AI 가 매번 생각해야 하는 것과 달리, DeCIR 은 모든 무거운 사고를 훈련 중에 수행합니다. 실제로 사용할 때는 빠르고 경량입니다.
  • 더 나은 결과: 패션, 자연, 유전자 이미지 테스트에서 DeCIR 은 이전 방법들보다 훨씬 더 자주 올바른 "변경된" 사진을 찾았습니다. 두 번째 새를 추가하면서도 "초록색 새"의 "초록색"을 성공적으로 유지했습니다.

간단히 말해: DeCIR 은 컴퓨터가 게으른 단순화를 하지 못하게 막습니다. 두 가지 별도의 기술을 훈련한 후 이를 하나의 효율적인 도구로 깔끔하게 병합함으로써, 모델이 단순히 결과가 아닌 이미지 변경의 과정을 이해하도록 가르칩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →