← 最新论文
🤖 machine learning

Epistemic Uncertainty Quantification for Pre-trained VLMs via Riemannian Flow Matching

本文介绍了 REPVLM,这是一种利用黎曼流匹配在预训练视觉 - 语言模型嵌入的双曲流形上计算概率密度的方法,从而实现有效的认知不确定性量化、分布外检测以及自动化数据筛选。

原作者: Li Ju, Mayank Nautiyal, Andreas Hellander, Ekta Vats, Prashant Singh

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Li Ju, Mayank Nautiyal, Andreas Hellander, Ekta Vats, Prashant Singh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《REPVLM:通过黎曼流匹配对预训练视觉语言模型进行认知不确定性量化》的通俗解释,辅以富有创意的类比。

核心问题:“过度自信”的机器人

想象你有一个超级聪明的机器人(即视觉语言模型,VLM),它几乎读遍了互联网上的每一本书,看遍了每一张图片。它能完美地描述一张猫或日落的照片。

然而,这里隐藏着一个缺陷:这个机器人过度自信。

如果你给它看一张看起来像猫的烤面包机,或者一句毫无意义的句子,它仍然会以 100% 的确定性给出答案。它不知道“自己不知道什么”。在人工智能领域,这被称为缺乏认知不确定性(或“模型无知”)。机器人需要一种方式来表示“我不确定这个”,以便人类介入并检查。

解决方案:“拥挤派对”类比

作者提出了一种名为REPVLM的新方法来解决这个问题。为了理解其工作原理,不妨将机器人的大脑想象成一个巨大、无形的派对房间(一个被称为“超球面”的数学空间)。

  1. 人群:当机器人接受训练时,它学习了常见的事物(猫、狗、汽车、“你好”等)。在我们的派对类比中,这些常见事物就像拥挤的舞池。大家都在紧密的群体中一起跳舞。
  2. 空角落:如果你给机器人看一些奇怪的东西(比如像猫的烤面包机或胡言乱语),该输入会被映射到房间中没有人跳舞的地方。那是一个空旷、孤独的角落。
  3. 洞察:论文认为,如果输入落在拥挤区域,机器人就是自信的;如果它落在空旷区域,机器人就是无知的,应当表现出不确定性。

魔法工具:“流匹配”

困难之处在于精确测量某个特定位置到底有多拥挤。你不能只是数人数,因为房间太大且太复杂。

作者使用了一种名为黎曼流匹配的数学技巧。以下是类比:

  • 水流:想象房间的空角落充满了水,而拥挤的舞池是岛屿。
  • 洋流:REPVLM 学习水的“洋流”。它学习水如何自然地从未被占据的空地流向拥挤的岛屿。
  • 测量:通过追溯一滴水的路径以查看它来自何处,系统可以精确计算该区域的“密度”(拥挤程度)。
    • 如果水流很容易从密集的人群中流出,则该输入是安全的。
    • 如果水流必须从空旷的虚无中经过漫长而孤独的距离,则该输入是“不确定的”。

这种方法之所以特殊,是因为它尊重房间的形状。大多数数学试图用直尺测量直线距离,但这个房间像球体一样是弯曲的。REPVLM 使用测地线(弯曲表面上的最短路径,就像地球仪上的飞行路径)来准确测量距离。

他们的发现(结果)

团队在几项标准测试中测试了这个新的“人群计”:

  1. 发现错误:当他们要求机器人忽略其最“不确定”的答案(即那些位于空角落的答案)时,剩余的答案几乎总是正确的。该方法在识别机器人何时感到困惑方面几乎完美。
  2. 发现奇怪事物:他们在“分布外”数据(与机器人训练数据截然不同的图像)上进行了测试。REPVLM 成功将这些标记为“低密度”(空角落),并表示“我不认识这个”。
  3. 清洗数据:他们表明,这种方法可以自动在大型数据集中发现糟糕、模糊或无意义的图像,充当过滤器,在训练未来机器人之前清理数据。

为什么这很重要

以往让机器人承认不确定性的方法要么太慢(需要机器人运行同一测试 100 次),要么不适用于这些特定类型的模型。

REPVLM 是:

  • 快速:它不需要多次运行机器人。
  • 原生:它直接在机器人大脑的形状上工作,无需重建机器人。
  • 准确:它在“低人群密度”和“高错误率”之间建立了近乎完美的联系。

关于局限性的说明

作者诚实地指出了局限性:

  • 代理问题:为了学习“人群”在哪里,系统需要一个数据样本(代理),该样本看起来像机器人最初训练的数据。如果机器人是在干净数据上训练的,但你试图将其用于杂乱的数据,“人群地图”可能会略有偏差。
  • 公平性警告:由于系统将“罕见”事物标记为“不确定”,它可能会意外地将罕见但有效的事物(例如代表性不足群体的图像)标记为“错误”,仅仅因为它们在训练数据中较少见。作者建议人类应审查这些被标记的项目,而不是自动删除它们。

总结

简而言之,REPVLM 赋予超级聪明的机器人一种“直觉”。它通过将机器人的知识映射到一个拥挤的派对房间来实现这一点。如果机器人处于拥挤的位置,它就是自信的;如果它处于空旷的位置,它就知道自己无知。这让我们能够更信任机器人,因为我们确切知道它何时是在猜测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →