← 最新论文
🤖 AI

APEX: Assumption-free Projection-based Embedding eXamination Metric for Image Quality Assessment

APEX 是一种新颖且无需假设的图像质量评估框架,它利用开放词汇基础模型(CLIP 和 DINOv2)的切片 Wasserstein 距离,克服了传统特征分布指标的局限性,在多种数据集上展现出卓越的鲁棒性和稳定性。

原作者: Caterina Gallegati, Monica Bianchini, Franco Scarselli, Vittorio Murino, Barbara Toniella Corradini

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Caterina Gallegati, Monica Bianchini, Franco Scarselli, Vittorio Murino, Barbara Toniella Corradini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位烹饪比赛的评委。厨师们(生成式 AI 模型)正在创作令人惊叹的新菜肴(图像),这些菜肴看起来几乎与真实食物无法区分。你的任务是品尝它们并决定:“这道菜好吗?它比上一道更好吗?”

很长一段时间里,评委们使用一份非常古老、僵化的检查清单来给这些菜肴打分。他们会查看食材(像素),并检查它们是否符合一本 1990 年代烹饪书中的特定食谱(在 ImageNet 上训练的 Inception-v3)。

问题所在:
该论文指出,这份旧检查清单存在两大缺陷:

  1. “封闭菜单”问题: 旧检查清单只了解其特定 1990 年代烹饪书中出现的食材。如果厨师用旧书从未见过的食材制作了一道未来主义的菜肴,即使这道菜美味可口,检查清单也会感到困惑或给出低分。
  2. “僵化数学”问题: 旧检查清单假设所有菜肴都遵循完美、可预测的钟形曲线形状。但真实的烹饪(以及真实的 AI 图像)是混乱且复杂的。将混乱的现实强行塞入僵化的形状中,会导致评分错误。

最近,一些评委尝试使用更新、更精致的烹饪书(基础模型,如 CLIP 和 DINOv2)来理解现代食材。但他们仍然使用相同的僵化数学来评分。这就像拥有现代菜单,却仍在使用一把会弯曲错误的 1990 年代尺子。

解决方案:APEX

作者提出了APEX(无假设投影嵌入检查)。将 APEX 想象为一个全新的、超级聪明的评判系统,拥有两大核心优势:

1. “皮影戏”技巧(基于投影)
APEX 不试图一次性测量菜肴的整个 3D 形状(这很难且需要僵化的假设),而是使用一个巧妙的技巧。想象将光照射在一座复杂的雕塑上,使其在墙上投下影子。

  • APEX 从数千个不同角度照射光线(投影)。
  • 它每次测量影子(一维切片)。
  • 它平均所有这些影子,以获得对形状的真实感知。
  • 这为何重要: 这种方法不假设雕塑是完美的球体或立方体。它只是如实测量形状,无论其多么怪异或复杂。它是“无假设”的。

2. “通用翻译器”(基础模型)
APEX 不使用旧的 1990 年代烹饪书,而是使用两种现代、超级智能的翻译器:

  • CLIP: 一种理解图像与语言关系的翻译器(非常适合判断“这看起来像猫吗?”)。
  • DINOv2: 一种理解纹理、形状和细微细节的翻译器(非常适合判断“这皮毛看起来真实吗?”)。
    APEX 利用这些翻译器来理解图像的“风味”,然后使用“皮影戏”技巧将生成的图像与真实图像进行比较。

论文发现(味觉测试)

作者将 APEX 与旧评委(FID、KID)以及较新但仍僵化的评委(CMMD)进行了测试。他们在以下领域进行了测试:

  • 自然照片(如公园)。
  • 人脸(如名人)。
  • 医学扫描(如 X 光片)。
  • 卫星照片(如从太空俯瞰城市)。

结果:

  • 稳定性: 旧评委的手像颤抖一样;如果你向他们展示同一张图片两次,仅做微小改动,他们可能会给出截然不同的分数。APEX 则像岩石一样稳定且一致。
  • 跨领域公平性: 旧评委在评分人脸方面表现出色,但在评分 X 光片或卫星照片方面却糟糕透顶。APEX 在评判所有这些内容时同样出色。它不会因主题的变化而感到困惑。
  • 敏感性: 当 AI 厨师逐步改进他们的菜肴(逐步添加更多细节)时,只有 APEX 注意到了最后那些微小而细微的改进。旧评委经常陷入停滞,甚至认为菜肴变差了,而实际上它变好了。
  • 人类一致性: 当真实人类对图像进行评分时,APEX 的分数与人类意见几乎完美匹配,通常优于既定的“黄金标准”(FID)。

核心结论

该论文声称,APEX 是一种更好的 AI 生成图像评分方法,因为它不再强迫图像进入旧有的僵化框架。相反,它利用现代、灵活的工具从所有可能的角度审视图像,确保分数反映图像的实际外观,无论是人脸、肿瘤还是卫星视图。它是面向未来 AI 艺术更诚实、更稳定且更符合人类价值观的评委。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →