← 最新论文
🤖 machine learning

Contrastive Order Learning: A General Framework for Ordinal Regression

本文提出了 ConOrd,一种用于序数回归的新颖对比学习框架,该框架通过软亲和力和差异权重,将全局批次级样本利用率与细粒度的序数建模相结合,在人脸年龄和质量评估等多种任务中实现了最先进的性能。

原作者: Chaewon Lee, BeomJun Shim, Kwang Pyo Choi, Chang-Su Kim

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Chaewon Lee, BeomJun Shim, Kwang Pyo Choi, Chang-Su Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人,不仅要让它通过将事物分类到不同的框中(比如“猫”或“狗”)来理解世界,还要让它理解事物的光谱。想想年龄:一个10岁的孩子比一个12岁的孩子更接近12岁,而不是更接近60岁。或者想象判断照片的质量:一张略微模糊的照片比一张清晰的照片“差”,但比一张完全黑屏的照片“好”。这被称为序数回归(ordinal regression)——学习事物的顺序以及排名之间的距离。

长期以来,AI研究人员一直尝试用两种主要方式来教授这一点,而这两种方式在逻辑上都存在缺陷。

旧方法:“全或无”与“硬性切分”

首先是监督对比学习(Supervised Contrastive Learning)。想象一位老师向学生展示一张24岁的人的照片。老师说:“这是一个24岁。其他所有人都不属于24岁。”学生学习将24岁的人与其他所有人推开。但问题在于,学生对待一个25岁的人(非常相似)和对待一个75岁的人(完全不同)的方式是一模一样的。老师忽略了24岁和25岁是邻居,而24岁和75岁是陌生人这一事实。

随后出现了更“聪明”一点的 RnC (Rank-N-Contrast) 方法。这位老师更聪明了。他们说:“好吧,24岁是锚点。25岁是一个‘正向’的朋友。但任何比25岁大的人呢?他们都是‘负向’的敌人。”老师在沙地上画了一道硬性的界限。如果你比25岁大,你就是敌人。但是,等等——这位老师对待一个26岁的人和一个100岁的人的方式是完全一样的。他们都会被同样程度地推开。老师忘记了100岁的人比26岁的人要远得多,而且这种距离是至关重要的。

新英雄:ConOrd (Contrastive Order Learning,对比序数学习)

ConOrd,由Chaewon Lee及其团队提出的新框架,登场了。他们意识到,要真正理解顺序,你不能使用硬性的界限或忽略距离。你需要一种对事物距离有着软性的、模糊的理解。

想象一位使用特殊磁铁的新老师:

  • 软磁铁: 当机器人观察一个24岁的人时,它不仅仅是推开其他人。它看着一个25岁的人并说:“你很近,所以我只会轻轻地把你拉近一点点。”它看着一个30岁的人并说:“你稍远一些,所以我拉你的力会小一点。”
  • 排斥力: 现在,看看一个75岁的人。老师说:“你离得太远了!我需要用力地把你推开!”

这就是ConOrd的魔力。它不再使用“朋友或敌人”的二元列表,而是根据每个样本与其锚点之间的排名距离,为其分配一个软权重(soft weight)

  • 间隙小? 温和的吸引。
  • 间隙中等? 中度的排斥。
  • 间隙巨大? 强烈的排斥。

ConOrd认为,之前的研究方法之所以失败,是因为它们将这些间隙视为“全或无”的关系。ConOrd通过让每一个样本都能根据其真实的排名差异来贡献学习过程,从而解决了这个问题。这就像是在调频收音机,你可以听到远处电台的杂音,但最近电台的信号是非常清晰的。

它奏效了吗?事实胜于雄辩

团队并不仅仅是靠猜测;他们在现实世界的排序问题上进行了测试。他们在以下领域进行了实验:

  • 猜测年龄: 他们在包括MORPH II和CLAP2015数据集在内的六个不同数据集上进行了测试。在CLAP2015数据集上,他们的方法实现了2.46的平均绝对误差(MAE),击败了之前的最佳方法,如NumCLIP(得分为2.55)和OrdinalCLIP(得分为3.20)。除了CACD数据集外,ConOrd在所有数据集的MAE指标上都取得了最佳性能,证明了其在多样化年龄估计基准测试中的强大泛化能力。
  • 判断照片质量: 他们在五个盲测图像质量数据集上进行了测试。在BID数据集上,ConOrd获得了0.913的斯皮尔曼等级相关系数(SRCC)和0.925的皮尔逊线性相关系数(PCC),超越了包括QCN和VISGA在内的所有列出的复杂方法。
  • 判断视频质量: 他们在LSVQ和KoNViD-1k等视频数据集上进行了测试。在LSVQ-TEST集上,ConOrd达到了0.904的SRCC和0.904的PCC,再次击败了竞争对手。

作者之所以对这些结果充满信心,是因为他们控制了变量。他们在对比的所有方法中使用了完全相同的“大脑”(一个ViT-B编码器)。这意味着获胜并不是因为他们使用了更高级的计算机,而是因为他们的“软磁铁”教学风格确实更好。

他们排除了什么

论文明确反对了“必须对谁是‘正向’、谁是‘负向’”做出硬性决定”的观点。他们表明,依赖硬性阈值(如RnC)或忽略排名距离(如标准对比学习)的方法会损失性能。他们还测试了一个使用简单数学技巧(正对数)的“天真”版本,发现这会导致训练不稳定且不可靠,因此他们放弃了该方法,转而采用他们特定的“软权重”公式。

底线

ConOrd表明,通过将排名差异视为一个平滑的、连续的尺度,而不是一个类别列表,我们可以构建出能更好地理解世界细微差别的AI。这不仅仅是关于知道顺序;更是关于知道它们之间到底有多远。实验表明,这种方法一致地带来了最先进的性能,使其成为处理从估计人的年龄到评判视频质量等任务的强大新工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →