← 最新论文
💻 computer science

CIRCLED: A Multi-turn CIR Dataset with Consistent Dialogues across Domains

本文介绍了 CIRCLED,这是一个大规模、高质量的多轮组合图像检索(MTCIR)数据集,涵盖九个领域,通过确保对话一致性并提供面向未来研究的稳健基准,解决了现有局限于时尚领域的数据集所存在的局限性。

原作者: Tomohisa Takeda, Yu-Chieh Lin, Yuji Nozawa, Youyang Ng, Osamu Torii, Yusuke Matsui

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Tomohisa Takeda, Yu-Chieh Lin, Yuji Nozawa, Youyang Ng, Osamu Torii, Yusuke Matsui

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在一家巨大且无边无际的百货商店里寻找一套特定的服装,但你无法用一句话完美地描述它。你知道自己想要一条“红色连衣裙”,但当你看到结果时,你会想:“不,那太亮了。我想要深一点的,要有长袖,也许还要加一条腰带。”

在计算机科学领域,这被称为多轮组合图像检索(Multi-Turn Composed Image Retrieval, CIR)。这是一种系统,你从一张图片和一段文字描述开始,然后逐轮不断细化你的搜索,直到找到你真正想要的东西。

这篇论文介绍了一种名为CIRCLED的新工具,旨在帮助研究人员构建更好的此类搜索系统。以下是他们所做工作的分解,使用了简单的类比。

问题:“破碎的地图”

在这篇论文之前,研究人员拥有一个名为Multi-turn FashionIQ的数据集(即练习问题集合)。但作者指出,这个旧数据集就像一张破碎的地图

  • 问题所在: 在旧数据集中,找到答案的步骤并不总是合乎逻辑。想象一下你在寻找一条“黑色连衣裙”。
    • 第一轮: 你要求找一条“红色连衣裙”。
    • 第二轮: 系统向你展示了一条“色彩缤纷的派对连衣裙”。
    • 第三轮: 你要求找一条“黑色连衣裙”。
    • 故障点: 旧数据集有时包含那些实际上让搜索离目标更远的步骤,或者指令是重复的废话(比如连续三次说“把它变红”)。这就像是一个 GPS,指示你先向北开,然后向南,再向北,却从未让你更接近目的地。
  • 局限性: 旧数据集仅包含服装(时尚类)。它没有测试系统是否能找到狗、汽车或风景。

解决方案:CIRCLED(“完美的指南针”)

作者构建了CIRCLED,这是一个新数据集,它就像一把完美的指南针

  1. 一致的进展: 在 CIRCLED 中,对话中的每一步都让你更接近目标。如果目标是“黑色连衣裙”,每一轮都会让你稍微更接近黑色连衣裙,绝不会偏离。
  2. 新信息: 每次你说话时,你都会添加一些新内容。你不会重复自己。这就像侦探在收集线索:“首先,它是一只狗。其次,它是一只金毛寻回犬。第三,它戴着红色的项圈。”每个线索都增加了价值。
  3. 更广阔的视野: 他们不仅局限于服装。他们将数据集扩展到了通用物品(如 CIRR 和 CIRCO 数据集中的物品),以便系统能够学习搜索任何东西,而不仅仅是时尚。

构建过程:“机器人店员”

为了创建这个数据集,他们并没有只是让人类编写随机的对话。他们使用了一个智能的自动化流程:

  1. 起点: 他们采用了现有的单轮搜索(一张图片 + 一段文字)。
  2. 模拟: 他们利用强大的 AI(一个大语言模型)来扮演“店员”。
    • AI 查看搜索结果。
    • 如果完美的物品不在顶部,AI 会挑选它找到的最接近的物品。
    • 然后,AI 会写出一条新指令,说明如何将那个“最接近的物品”变成“完美的物品”。
    • 示例: “这条裙子是红色的,但我需要黑色的。另外,加一条腰带。”
  3. 质量控制(过滤器): 这是最重要的一环。他们将对话通过了四个严格的过滤器以确保质量:
    • 成功过滤器: 搜索最终是否找到了物品?如果没有,就丢弃它。
    • 多轮过滤器: 它是否真的需要超过一步?如果答案立即被找到,这就不是“多轮”对话,因此予以丢弃。
    • 排名一致性过滤器: 搜索结果在中间是否变差了?如果“完美物品”在聊天中途从前十名列表中消失,那么这段对话就是断裂的。将其丢弃。
    • 无重复过滤器: AI 是否只是重复了相同的词语?如果新指令与旧指令过于相似,就将其丢弃。

结果:一个庞大且高质量的游乐场

最终结果是一个包含**22,608 个对话(会话)**的数据集。

  • 它的大小大约是之前最佳数据集的两倍
  • 它包含超过200,000 张图像
  • 它涵盖了时尚(连衣裙、衬衫)和通用物品(动物、物体)。
  • 对话轮数从 2 轮到 6 轮不等,平均约为 2.5 轮。

为什么这很重要

作者在这个新数据集上测试了几种现有的 AI 方法。他们发现:

  • 文字为王: 在这些多轮对话中,你给出的文字指令比你展示的图片参考重要得多。
  • 渐进式学习: 最好的系统是那些能够记住整个对话历史,而不仅仅是你最后说了什么。
  • 新标准: 由于 CIRCLED 具有一致性和高质量,它为研究人员提供了一种公平的方式来测试他们的新型“搜索机器人”是否真的变得更聪明了,还是仅仅在猜测。

简而言之,CIRCLED是一个新的、高质量的训练场,它确保 AI 学会进行合乎逻辑的、循序渐进的对话,以找到你正在寻找的精确目标,而不会感到困惑或重复自己。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →