← 最新论文
💻 computer science

ChatSearch: a Dataset and a Generative Retrieval Model for General Conversational Image Retrieval

本文提出了名为 ChatSearch 的开放域多轮对话图像检索数据集,并设计了名为 ChatSearcher 的端到端生成式检索模型,该模型能够利用多模odal 上下文和世界知识进行推理,在对话图像检索及相关任务中展现出卓越性能。

原作者: Zijia Zhao, Longteng Guo, Tongtian Yue, Erdong Hu, Shuai Shao, Zehuan Yuan, Hua Huang, Jing Liu

发布于 2026-03-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Zijia Zhao, Longteng Guo, Tongtian Yue, Erdong Hu, Shuai Shao, Zehuan Yuan, Hua Huang, Jing Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个非常有趣的项目,我们可以把它想象成给搜索引擎装上了一个“会聊天、能看图、懂人心”的超级大脑。

为了让你更容易理解,我们把整个故事分成三个部分:痛点(为什么需要它)新玩具(ChatSearch 数据集)新大脑(ChatSearcher 模型)

1. 痛点:以前的找图方式太“死板”了

想象一下,你想找一张照片,但你的脑海里只有一个模糊的概念。

  • 以前的做法:你得像填表格一样,输入关键词(比如“红色的猫”),或者上传一张参考图。如果结果不对,你只能再换个词,或者手动点“相关度低”来反馈。这就像是在和一个只会听指令、不懂变通的机器人对话,非常生硬。
  • 现在的痛点:人类找东西通常是聊天式的。你会说:“我要找一张像刚才那张图,但是背景要换成海滩,而且猫要戴个墨镜。”这种多轮、混合了图片和文字的复杂交流,以前的系统根本听不懂。

2. 新玩具:ChatSearch(给 AI 准备的“找图练习册”)

为了让 AI 学会这种高级聊天找图,作者们自己造了一本超级练习册,叫 ChatSearch

  • 它是怎么造出来的?
    这就好比请了一位“超级助教”(大语言模型,如 GPT-4)。

    1. 助教先看一张图(比如“一只在草地上的狗”)。
    2. 助教发挥想象力,编造一段对话:“我想找一张图,跟这张很像,但狗要在水里,而且要是黑色的。”
    3. 然后,助教去大海(互联网图库)里真的找到那张“黑色的狗在水里”的图作为答案。
    4. 最后,人类专家像老师批改作业一样,检查这些对话和答案是否合理。
  • 它的厉害之处
    这本练习册里不仅有文字对话,还有“看图说话”。有的题目是纯文字聊天,有的是“看图 + 文字”混合。最重要的是,它要求 AI 不能只靠死记硬背,必须推理。比如,用户说“把刚才那个场景的色调变冷一点”,AI 得先理解“刚才的场景”是什么,再理解“变冷”意味着什么,最后才能找到图。

3. 新大脑:ChatSearcher(能“边聊边找”的生成式检索员)

有了练习册,作者还训练了一个叫 ChatSearcher 的 AI 模型。它不像传统的搜索引擎那样只是去数据库里“匹配”关键词,它更像是一个会创作的艺术家

  • 它是如何工作的?

    • 混合输入:你可以给它发一段文字,也可以发一张图,或者“图 + 文”混着发。就像你跟它发微信,可以发语音、发图片、发文字,它都能懂。
    • 生成式检索:这是最酷的地方。传统的搜索是“从一堆东西里挑一个”,而 ChatSearcher 是直接“生成”答案
      • 想象一下,它脑子里有一个巨大的“图片词汇表”。
      • 当你跟它聊天时,它不是在搜索,而是在“造句”。只不过它造的“句子”里,有些词是文字,有些词直接就是图片
      • 当它觉得“哦,用户想要这张图”时,它就直接把这张图“写”进对话里给你看。
  • 它的超能力

    1. 懂潜台词:如果你说“我要找那种感觉像梵高画风的猫”,它能理解“梵高风格”是什么意思,并找到对应的图,而不需要你描述具体的笔触。
    2. 记性好:它能记住你们之前的对话。如果你第一轮说“找只猫”,第二轮说“把猫换成狗”,它能立刻反应过来,是基于第一轮的猫来换,而不是重新找一只狗。
    3. 举一反三:虽然它是专门练“聊天找图”的,但作者发现,把它放到普通的“看图说话”或者“文字找图”任务里,它依然表现得很强,像个全能选手。

总结:这就像什么?

如果把以前的图片搜索比作去图书馆查字典(你必须知道确切的词才能查到),那么 ChatSearch 和 ChatSearcher 就像是请了一位博学的私人向导

你可以跟这位向导说:“我想找一张照片,要像昨天我们聊过的那张夕阳,但是要把太阳换成月亮,而且海面上要有帆船。”
向导会:

  1. 回想昨天的对话(理解上下文)。
  2. 理解“夕阳变月亮”、“加帆船”的复杂指令(多模态推理)。
  3. 直接把你想要的照片拿给你看(生成式检索)。

这篇论文的核心贡献就是:

  1. 造了一套高难度的“聊天找图”教材(ChatSearch 数据集)。
  2. 训练了一个能像人一样聊天、推理并直接给出图片的 AI 助手(ChatSearcher)。

这标志着人机交互从“人适应机器(输入关键词)”向“机器适应人(自然对话)”迈出了一大步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →