Reducing Bias and Variance: Generative Semantic Guidance and Bi-Layer Ensemble for Image Clustering
原作者: Feijiang Li, Zhenxiong Li, Jieting Wang, Zizheng Jiu, Saixiong Liu, Liang Du
原作者: Feijiang Li, Zhenxiong Li, Jieting Wang, Zizheng Jiu, Saixiong Liu, Liang Du
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:用于图像聚类的 GSEC
问题陈述
图像聚类旨在通过构建和利用先验知识,将无标签图像数据集划分为不同的组。虽然最近的方法已从仅依赖数据内在先验转向利用外部语义描述(通常通过 CLIP 等视觉 - 语言模型),但仍存在显著局限性:
- 适应性有限:现有方法通常依赖使用预定义词汇表(如 WordNet)的基于匹配的技法。这种受限的匹配空间限制了适应性,因为复杂视觉语义与固定词集之间的强制对齐可能导致语义不一致。
- 忽视方差:当前策略主要侧重于通过引入语义先验来减少偏差以提高性能。然而,它们经常忽视方差减少的关键作用。在机器学习理论中,估计误差源于偏差、方差和噪声的联合效应;因此,解决方差对于实现稳健且稳定的聚类至关重要。
方法论:GSEC 框架
作者提出了GSEC(基于生成式语义引导和双层集成的图像聚类),这是一个旨在同时减少偏差和方差的框架。
1. 生成式语义引导(偏差减少)
为了克服基于匹配的语义先验的局限性,GSEC 采用多模态大语言模型(MLLMs)来生成自适应的语义描述。
- 流程:首先对图像嵌入进行聚类(例如通过 K-means)。将每个聚类中的代表性图像输入 MLLM(具体为 Llama-3.2-Vision-11B),并附带提示以生成结构化的自然语言描述(例如,“该图像包含一个具有 [属性] 特征的 [物体]")。
- 嵌入合成:将这些生成的文本描述编码为类别嵌入。对于每张图像,通过所有类别嵌入的加权平均推导出特定的文本嵌入,其中权重由图像与类别文本之间的余弦相似度决定。这创建了一个丰富且自适应的语义先验,避免了固定词汇表的语义不一致性。
2. 双层集成(方差减少)
为了缓解方差,GSEC 引入了一种两阶段集成策略:
- 内层集成:该层使用BatchEnsemble整合跨模态信息(图像和文本)。它由两个独立的分支(图像和文本)组成,它们共享权重但利用成员特定的低秩调制参数。该层采用跨模态互蒸馏损失以双向对齐图像和文本表示,同时结合置信度损失和平衡损失以确保训练稳定。
- 外层集成:在内层收敛后,采用对齐机制。任务编码器将拼接的图像和文本嵌入作为输入。外层通过最小化其预测与内层集成平均输出之间的交叉熵损失来优化该编码器。这种对齐确保最终的聚类结果既整合了内层稳健的多模态引导,又整合了任务编码器的综合推理。
主要贡献
该论文概述了三项主要贡献:
- 生成式语义引导:一种利用 MLLM 生成自适应语义描述的偏差减少策略,有效克服了基于匹配方法固有的语义不一致性。
- 双层集成机制:一种方差缓解框架,其中内层集成通过 BatchEnsemble 整合多模态数据,外层集成将内层预测与外部输出对齐,从而增强整体的鲁棒性和稳定性。
- 全面的实证验证:广泛的实验表明 GSEC 优于最先进的方法,具体的偏差 - 方差分解分析证实了同时减少了这两种误差成分。
实验结果
作者在11 个基准数据集上评估了 GSEC,包括 CIFAR-10、CIFAR-100、STL-10、ImageNet-10、ImageNet-Dogs、Food101、StanfordCars、OxfordPets、FGVC Aircraft、Country211 和 ImageNet-1K。
- 性能:GSEC 在六个基准数据集上优于18 种最先进的方法(包括单模态和多模态方法)。在大规模ImageNet-1K数据集上,它超越了四种领先的多模态方法,在准确率(62.5%)、NMI(81.3%)和 ARI(52.8%)方面取得了最佳结果。
- 偏差 - 方差分析:与仅使用图像特征、基于匹配的文本和生成式文本的配置进行的对比实验表明:
- 集成策略有效减少了方差。
- 生成式文本引导减少了偏差,但可能引入方差。
- GSEC实现了偏差和方差的同步减少,从而带来更优越且更稳定的性能。
- 消融研究:结果证实,在各种骨干网络(CLIP-ViT-B/32、RN50、RN101、RN50x4)上,生成式语义嵌入(G-Text)始终优于基于匹配的嵌入(M-Text)。同样,双层集成策略始终比双层线性架构带来性能提升。
意义与主张
该论文主张,GSEC 通过解决图像聚类中偏差和方差的双重挑战,代表了重大进步,而这一组合在以往工作中常被忽视。通过从受限的、基于匹配的语义先验转向生成式语义引导,该方法能更有效地适应复杂的视觉语义。此外,引入双层集成明确针对方差减少,从而产生更稳健的聚类框架。作者认为,联合优化这两个因素对于实现高性能图像聚类至关重要,这一主张已通过他们的分解分析和在多样化数据集上的优越结果得到证实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。