← 최신 논문
💻 computer science

CIRCLED: A Multi-turn CIR Dataset with Consistent Dialogues across Domains

본 논문은 기존 패션에 국한된 데이터셋의 한계를 극복하고 대화 일관성을 보장하며 향후 연구를 위한 견고한 벤치마크를 제공하기 위해 아홉 개의 도메인을 아우르는 대규모 고품질 다회전 Composed Image Retrieval(MTCIR) 데이터셋인 CIRCLED 를 소개합니다.

원저자: Tomohisa Takeda, Yu-Chieh Lin, Yuji Nozawa, Youyang Ng, Osamu Torii, Yusuke Matsui

게시일 2026-05-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tomohisa Takeda, Yu-Chieh Lin, Yuji Nozawa, Youyang Ng, Osamu Torii, Yusuke Matsui

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 끝없는 백화점에서 특정 옷을 찾으려 한다고 상상해 보세요. 하지만 한 문장으로 완벽하게 설명할 수는 없습니다. "빨간 원피스"를 원한다는 것은 알지만, 결과를 보면 "아니, 너무 밝아. 더 어둡게 하고, 긴 소매에 벨트도 붙였으면 좋겠어"라고 생각하게 됩니다.

컴퓨터 과학의 세계에서는 이를 멀티턴 컴포즈드 이미지 검색(Multi-Turn Composed Image Retrieval, CIR)이라고 부릅니다. 이는 하나의 이미지와 텍스트 설명으로 시작하여 원하는 것을 정확히 찾을 때까지 턴별로 검색을 정제해 나가는 시스템입니다.

이 논문은 이러한 종류의 검색을 위한 더 나은 시스템을 구축하는 데 도움을 주는 CIRCLED라는 새로운 도구를 소개합니다. 여기서는 간단한 비유를 사용하여 그들이 무엇을 했는지 요약해 보겠습니다.

문제: "고장 난 지도"

이 논문 이전까지 연구자들은 Multi-turn FashionIQ라는 데이터셋 (연습 문제 모음) 을 가지고 있었습니다. 하지만 저자들은 이 오래된 데이터셋이 마치 고장 난 지도와 같다고 말합니다.

  • 문제점: 오래된 데이터셋에서는 정답을 찾는 단계가 항상 논리적이지 않았습니다. "검은 원피스"를 찾고 있다고 가정해 보세요.
    • 1 턴: "빨간 원피스"를 요청합니다.
    • 2 턴: 시스템이 "화려한 파티 드레스"를 보여줍니다.
    • 3 턴: "검은 원피스"를 요청합니다.
    • 결함: 오래된 데이터셋에는 때때로 검색이 목표에서 실제로 더 멀어지는 단계가 포함되거나, "빨갛게 해"라는 지시를 연속으로 세 번 반복하는 등 지시 사항이 반복되는 무의미한 내용이 포함되기도 했습니다. 마치 목적지에 더 가까워지지 않은 채 북쪽으로 가라고 하다가 남쪽으로, 다시 북쪽으로 가라고 하는 GPS 와 같았습니다.
  • 한계점: 오래된 데이터셋은 의류 (패션) 만 다루었습니다. 시스템이 개, 자동차, 또는 풍경을 찾을 수 있는지 테스트하지는 못했습니다.

해결책: CIRCLED ("완벽한 나침반")

저자들은 CIRCLED를 구축했습니다. 이는 완벽한 나침반처럼 작동하는 새로운 데이터셋입니다.

  1. 일관된 진행: CIRCLED 에서는 대화의 모든 단계가 목표에 더 가까워지게 합니다. 목표가 "검은 원피스"라면, 모든 턴이 검은 원피스에 조금씩 더 가까워지게 하며 결코 멀어지지 않습니다.
  2. 새로운 정보: 말할 때마다 새로운 것을 추가합니다. 자신을 반복하지 않습니다. 마치 단서를 수집하는 탐정처럼 "첫째, 개입니다. 둘째, 골든 리트리버입니다. 셋째, 빨간 목걸이를 하고 있습니다"라고 말합니다. 각 단서는 가치를 더합니다.
  3. 더 넓은 지평: 그들은 의류에만 국한하지 않았습니다. CIRR 및 CIRCO 데이터셋에 있는 것과 같은 일반 항목을 포함하도록 데이터셋을 확장하여 시스템이 패션뿐만 아니라 무엇이든 검색할 수 있도록 학습시켰습니다.

구축 방법: "로봇 샵 어시스턴트"

이 데이터셋을 만들기 위해 그들은 단순히 인간에게 무작위 대화를 작성하도록 요청하지 않았습니다. 대신 스마트한 자동화 파이프라인을 사용했습니다.

  1. 시작점: 그들은 기존 단일 턴 검색 (이미지 하나 + 텍스트 하나) 을 가져왔습니다.
  2. 시뮬레이션: 강력한 AI(대형 언어 모델, LLM) 를 "샵 어시스턴트"로 역할하게 했습니다.
    • AI 는 검색 결과를 봅니다.
    • 완벽한 항목이 상단에 없으면, AI 가 찾은 가장 가까운 항목을 선택합니다.
    • 그런 다음 AI 는 그 "가장 가까운 항목"을 "완벽한 항목"으로 바꾸는 방법에 대한 새로운 지시를 작성합니다.
    • 예시: "원피스는 빨간색이지만 검은색이 필요해요. 또한 벨트도 추가해 주세요."
  3. 품질 관리 (필터): 이것이 가장 중요한 부분입니다. 그들은 대화의 품질을 보장하기 위해 네 가지 엄격한 필터를 통과시켰습니다.
    • 성공 필터: 검색이 결국 항목을 찾았습니까? 그렇지 않다면 폐기합니다.
    • 멀티턴 필터: 실제로 한 단계 이상 걸렸습니까? 답이 즉시 발견되었다면 그것은 "멀티턴" 대화가 아니므로 폐기합니다.
    • 순위 일관성 필터: 검색 결과가 중간에 나빠졌습니까? 대화 중간에 "완벽한 항목"이 상위 10 개 목록에서 사라졌다면 대화는 깨진 것입니다. 폐기합니다.
    • 반복 금지 필터: AI 가 단순히 같은 단어를 반복했습니까? 새로운 지시가 이전 지시와 너무 유사하다면 폐기합니다.

결과: 방대하고 고품질의 놀이터

최종 결과는 22,608 개의 대화(세션) 를 가진 데이터셋입니다.

  • 이전 최고의 데이터셋보다 약 두 배 더 큽니다.
  • 20 만 개 이상의 이미지를 포함하고 있습니다.
  • 패션(원피스, 셔츠)과 일반 항목(동물, 사물)을 모두 다룹니다.
  • 대화는 2 턴에서 6 턴까지 다양하며, 평균은 약 2.5 턴입니다.

왜 이것이 중요한가

저자들은 이 새로운 데이터셋에서 여러 기존 AI 방법을 테스트했습니다. 그들은 다음과 같은 사실을 발견했습니다.

  • 텍스트가 왕이다: 이러한 멀티턴 대화에서 사용자가 주는 텍스트 지시는 보여주는 참조 이미지보다 훨씬 더 중요합니다.
  • 점진적 학습: 가장 좋은 시스템은 마지막에 말한 것뿐만 아니라 전체 대화 기록을 기억할 수 있는 시스템입니다.
  • 새로운 표준: CIRCLED 는 일관되고 고품질이므로, 연구자들이 새로운 "검색 로봇"이 실제로 더 똑똑해지고 있는지 아니면 단순히 추측하고 있는지 공정하게 테스트할 수 있는 방법을 제공합니다.

요약하자면, CIRCLED는 AI 가 혼란스러워하거나 자신을 반복하지 않고 당신이 찾는 것을 정확히 찾기 위해 논리적이고 단계적인 대화를 하도록 학습시키는 새로운 고품질 훈련장입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →