← 最新论文
💻 computer science

PI-H2T: Enhancing Long-Tailed Visual Recognition with Permutation-Invariant and Head-to-Tail Feature Fusion

PI-H2T 是一种即插即用的方法,它通过采用置换不变特征融合来优化表示空间,并利用头尾特征融合来传递语义信息,从而纠正分类器偏差并提升尾部类别的性能,进而增强长尾视觉识别。

原作者: Mengke Li, Zhikai Hu, Yang Lu, Weichao Lan, Yiu-ming Cheung, Hui Huang

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Mengke Li, Zhikai Hu, Yang Lu, Weichao Lan, Yiu-ming Cheung, Hui Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

巨大的不平衡:为什么人工智能会困在“热门事物”上

想象一下,你正在教一名新学生如何识别动物。你给他们看了 1,000 张金毛寻回犬的照片,但只给了一张稀有的红熊猫照片。如果让这个学生参加考试,他们很可能会成为识别狗的专家,但每当看到红熊猫时,他们很可能会直接猜是“狗”,仅仅是因为他们见过的这类例子最多。这就是人工智能中“长尾”数据的核心问题。在现实世界中,数据很少是完美平衡的;我们拥有一些拥有海量样本的“头部”类别(如常见的路标或热门动物),以及一个由极少数样本组成的漫长“尾部”类别(如稀有类别)。

深度学习模型——即现代人工智能背后的“大脑”——在处理这种不平衡时表现得很吃力。它们往往在识别常见事物方面变得极其出色,却完全遗忘了那些稀有的事物。这主要有两个原因:首先,模型的内部“世界地图”被挤压和扭曲了,因为它看到的稀有物品样本不够多,以至于不知道这些物品应该归属于何处;其次,模型的“决策者”(分类器)产生了偏差,总是倾向于选择那些热门的选项。解决这个问题至关重要,因为如果我们希望人工智能能在现实世界中发挥作用——那里存在着罕见疾病、晦涩物种和分众目标——它就必须对稀有事物公平,而不仅仅是对热门事物公平。

解决方案:两步走的魔术技巧

研究人员在论文中提出了一种名为 PI-H2T(置换不变特征融合与头尾融合)的新方法来解决这种不公平性。你可以将他们的这种方法看作是一个两步走的魔术技巧,旨在帮助 AI 学生像学习金毛寻回犬一样更好地学习红熊猫。

第一步:“洗牌与混合”(置换不变特征融合)
首先,团队解决了扭曲的“地图”问题。当 AI 查看一张图像时,它会将图像分解成细小的信息碎片(特征)。通常情况下,这些碎片的顺序很重要,但对于某些稀有物体,AI 会被像素的具体排列方式所迷惑,将其视为噪声。研究人员引入了一个名为 PIF(置换不变特征融合)的步骤。想象一下,拿着一副代表图像细节的扑克牌并进行洗牌。如果“手牌”的“含义”(物体)在洗牌后保持不变,那么 AI 就知道它找到了一个可靠且稳固的线索。

通过将这些洗牌后的线索与原始线索进行混合,AI 创建了一个更强大的“心理地图”。这一步非常高效;它几乎不会给系统增加额外的计算量或内存负担(仅需两个微小的可调参数)。结果如何?AI 开始将相似的稀有物体聚集在一起,并将它们推离常见物体,从而在它的脑海中创造出自然的“边界”或安全区,让稀有项目可以在那里生存而不会被挤压。

第二步:“借用”策略(头尾融合)
一旦地图修复完成,第二步就要解决带有偏差的“决策者”问题。即使有了更好的地图,AI 仍然不敢猜是“红熊猫”,因为它见过的红熊猫实在太少了。研究人员使用了一个聪明的技巧,称为 H2TF(头尾融合)。他们提取了 AI 对常见“头部”类别(如金毛寻回犬)所学到的丰富且详细的知识,并将其温柔地融入到“尾部”类别(如红熊猫)中。

这就像是一个精通狗知识的学生去帮助一个对红熊猫一无所知的学生。他们不会只说:“这是一张熊猫的照片。”相反,他们会说:“把熊猫想象成一种狗,但具有这些特定的差异。”这种对语义信息的“借用”填补了 AI 心智中那些空旷、稀疏的空间。至关重要的是,这种“借用”只发生在 AI 学习(训练)期间。当 AI 进行最终测试(推理)时,它使用的是自己干净、无偏差的知识。这确保了 AI 在进行实际识别时,不会因为混合了动物的身份而产生混乱。

他们的发现

团队在几个著名的数据集上测试了这种方法,包括包含 100 种不同物体的图像(CIFAR100-LT)、数百万张真实世界照片(ImageNet-LT)以及自然摄影照片(iNaturalist 2018)。

结果表明,PI-H2T 的效果非常好。当我们将这种方法添加到现有的 AI 模型中时,稀有“尾部”类别的准确率显著提升。例如,在 CIFAR100-LT 数据集上,我们的方法比之前的顶尖方法将标准模型的准确率提高了 3% 以上。在庞大的 ImageNet-LT 数据集上,它将单模型方法的性能提升到了通常需要更复杂的多模型系统才能达到的水平。

论文明确反对了“需要构建巨大的、复杂的全新网络或海量的额外数据来解决此问题”的观点。相反,他们展示了通过一种轻量级的、“即插即用”的添加方式——即重新排列现有特征并借鉴常见类别的知识——就足以产生巨大的改变。他们还发现,虽然该方法在大多数数据集上表现出色,但在图像本身已经非常相似(如场景照片)的数据集上,其效果略显逊色,这表明“洗牌”步骤在 AI 需要理清杂乱、稀疏数据时最为有效。

简而言之,PI-H2T 并不是试图强迫 AI 去死记硬背更多内容,而是教会 AI 如何更好地组织已有的知识,以及如何利用对常见世界的认知来理解稀有世界。这是一种简单、高效的方式,让人工智能对每个人都更加公平和准确,而不仅仅是对那群“热门群体”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →