← 最新论文
💻 computer science

TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval

本文提出了 TIGER-FG,这是一个文本引导的隐式细粒度定位框架,它利用商品文本生成以目标为导向的表示而无需目标检测,在 newly constructed 的 realistic 基准测试上显著提升了电商图像到多模态的检索性能。

原作者: Xinyu Sun, Huangyu Dai, Lingtao Mao, Zexin Zheng, Zihan Liang, Ben Chen, Chenyi Lei, Wenwu Ou

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyu Sun, Huangyu Dai, Lingtao Mao, Zexin Zheng, Zihan Liang, Ben Chen, Chenyi Lei, Wenwu Ou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在网上购物,寻找一件特定的商品,比如“一条带开叉的红天鹅绒连衣裙”。你拍下了杂志上看到的这件连衣裙的照片,但只裁剪出了裙子本身,切掉了模特、背景和家具。

现在,想象一下这家网店搜索引擎需要在它的目录中找到这件连衣裙。问题在于,商店的目录不仅仅展示连衣裙;它展示的是目录页上的整张照片。那张照片可能包含模特、华丽的背景、衣架上其他的衣服,甚至一只路过的猫。

这给试图找到你裙子的计算机带来了两个大难题:

  1. “苹果对橘子”问题:你给计算机的是一张只包含裙子的微小、干净的照片。计算机必须将这张微小照片与一张充满杂物的巨大、凌乱的照片进行比较。
  2. “干扰”问题:如果计算机只是查看整张目录照片,它可能会被背景或那只猫搞糊涂,心想:“哦,这张照片是关于猫的!”而不是关于裙子的。

旧方法(以及它们为何失败)

该论文解释说,以前的方法试图通过两种方式解决这个问题,但两者都有缺陷:

  • “侦探”方法:计算机首先尝试扮演侦探的角色。它扫描凌乱的目录照片,在裙子周围画一个框,将其裁剪出来,然后再与你的照片进行比较。
    • 缺陷:这既缓慢又昂贵,而且如果侦探犯了错误(比如把框画在了猫身上),整个搜索就会失败。
  • “超级大脑”方法:计算机使用一个巨大的 AI 模型(就像一个超级聪明的学生),将整张照片和文字描述结合起来查看。
    • 缺陷:即使是超级聪明的模型也会分心。如果背景很亮或者有很多物体,模型可能会关注错误的地方,就像人类在试图阅读时会被巨大的噪音分散注意力一样。

新解决方案:TIGER-FG

作者提出了一种名为TIGER-FG的新系统。把它想象成一位聪明的图书管理员,他不需要先从照片中裁剪出裙子。相反,图书管理员利用文字描述(标题、类别和属性)作为“手电筒”来找到图像的正确部分。

以下是它的工作原理,使用了简单的类比:

1. 文字作为手电筒

系统不是试图仅通过查看像素来寻找裙子,而是读取商品的标题:“一条带开叉的红天鹅绒连衣裙。”
它利用这段文字在凌乱的目录照片上“照亮”特定区域。它告诉计算机:“忽略背景,忽略猫,忽略鞋子。专门看红天鹅绒部分。”
这使得系统能够构建出仅关于裙子的心理表征,而无需实际裁剪图像或画框。这是一种隐式定位——通过理解上下文而非物理隔离来找到物体。

2. “教师 - 学生”训练

为了确保这位图书管理员真的很擅长忽略干扰,作者使用了一种称为蒸馏的特殊方法对其进行了训练。

  • 教师:想象一位严厉、专业的教师,他已经在干净的照片中完美学会了如何识别裙子。
  • 学生:这就是新系统。
  • 课程:教师向学生展示:“当我看到这张凌乱的照片时,我专注于这里。”学生尝试模仿这种专注。系统还通过接受具有迷惑性的、令人困惑的示例测试,学会忽略“虚假”匹配(例如,一张看起来像裙子但实际上颜色不同的照片)。

3. “马赛克”训练

作者意识到,仅在干净的照片上训练是不够的。因此,他们创建了一个名为ECom-RF-IMMR的特殊训练集。

  • 他们拿正常的照片制作了**“马赛克”**版本。他们将目标裙子粘贴到一张充满其他随机物品(烤面包机、鞋子、植物)的照片中,创造出极度杂乱的场景。
  • 他们迫使系统仅使用文字描述在这些凌乱的场景中找到裙子。这就像训练一只狗,让它在一间充满其他零食的房间里,仅凭口头指令找到特定的零食。

结果

该论文声称,这种新方法是一个巨大的进步:

  • 速度与效率:它不需要先画框这种缓慢的“侦探”步骤。它快速且轻量级。
  • 准确性:在他们新的“杂乱”测试中,旧的最佳方法只有约 40% 的答案正确。TIGER-FG 达到了75%。在干净测试中,它从约 74% 提高到了80%
  • 鲁棒性:当背景杂乱或有许多物体时,TIGER-FG 不会感到困惑。它坚持使用文字描述来找到正确的商品。

总结

简而言之,TIGER-FG 是一种更智能的在线商品搜索方式。它不是试图先从凌乱的照片中裁剪出商品,而是利用商品的名称和描述在心理上“放大”图像的正确部分。它通过在极度杂乱的图片上进行练习来学会忽略干扰,使其在目录照片凌乱的情况下,也能更好地找到你正在寻找的确切物品。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →