← 最新论文
🤖 AI

Weakly supervised concept Bottleneck Learning for Robust Two stage Object centric visual reasoning

本文介绍了动态正交概念瓶颈(D-OCB),这是一种以对象为中心的槽位变分自编码器(slot-VAE)框架,通过动态优化超参数、强制概念独立性以及自适应重新分配潜在维度以防止表示崩溃,在极弱监督下实现了鲁棒的两阶段视觉推理。

原作者: Sparsh Tiwari, Gesina Schwalbe, Bettina Finzel

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Sparsh Tiwari, Gesina Schwalbe, Bettina Finzel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在构建能够真正理解世界的机器的过程中,科学家们长期以来一直面临着一个根本性的分歧。一方面是感知能力:深度神经网络可以观察照片并以惊人的速度识别出猫或汽车。另一方面是推理能力:即人类将这些观察结果并应用逻辑的能力,例如提出诸如“如果这辆车是红色的,它是否也很快?”或“为什么那个物体被遮住了?”之类的问题。几十年来,这两种能力一直处于相互独立的领域。擅长视觉感知的机器往往无法解释其推理过程,而擅长逻辑推理的机器则在没有大量人类指导的情况下,难以解释原始视觉数据。神经符号人工智能的目标就是弥合这一差距,创造出既能感知物理世界,又能对其应用逻辑规则的系统,就像人类观察一个场景并推断正在发生什么时那样。

挑战在于,教机器将视觉图像与特定的逻辑概念联系起来,通常需要海量的标注数据。想象一下,试图通过向一个孩子展示成千上万张照片来教他什么是“红色的立方体”,且每一张照片都需要人工手动标记为“这是红色的”和“这是一个立方体”。这个过程缓慢、昂贵,且对于复杂任务而言往往是不切实际的。研究人员一直在寻找一种方法,让这些系统在仅依赖极少量标签的情况下进行学习,转而依靠机器自主学习模式的能力,仅在偶尔受到纠正时进行调整。这正是来自吕贝克大学、乌尔姆大学和巴姆伯格大学研究人员的一项新研究所解决的核心问题,他们开发出了一种方法,让机器能够使用极小比例的常规数据来学习视觉与推理。

研究人员引入了一个名为“动态正交概念瓶颈”(Dynamic Orthogonal Concept Bottleneck)的新框架。要理解它的工作原理,请想象一台机器正在观察一个充满各种物体的繁忙场景。传统的系统可能会尝试直接猜测最终答案,因此经常被数据中的捷径或巧合模式所迷惑。这种新方法迫使机器先停下来,将场景分解为基本的构建模块。它识别单个物体,然后针对它们提出具体问题:“形状是什么?”“颜色是什么?”“材质是什么?”这些问题充当了一个检查点,或者说是一个“瓶颈”,机器必须在此阐明其理解,然后才被允许解决最终的谜题。创新的核心在于,当机器只有极少示例进行引导时,它是如何学习这些概念的。

通常,当机器尝试在数据如此匮乏的情况下进行学习时,它会崩溃。它可能会开始忽略重要的细节而关注随机噪声,或者可能会混淆不同的概念,认为“红色”总是意味着“正方形”,因为它看到的几张图片恰好如此。新系统通过一种巧妙的平衡机制解决了这个问题。它结合了机器从其内部笔记中重建图像的自然能力,以及一条保持不同概念独立的严格规则。如果机器开始混淆“大小”的概念与“颜色”的概念,系统会轻轻地将它们推开,确保每个概念保持独特且清晰。这防止了机器依赖数据中的简单捷径。

或许最显著的突破在于系统如何管理自身资源。在许多计算机程序中,分配给每个概念的内存或“脑力”量是预先固定的。这是低效的,因为有些概念很简单,只需要很少的空间,而有些概念很复杂,需要更多空间。新框架通过允许系统在训练期间动态转移资源来改变这一点。如果机器在学习“材质”这一概念时遇到困难,它可以从已经掌握的“形状”等概念中借用空间,以给予挣扎中的概念所需的关注。这种自适应过程确保了没有任何一个想法会被遗弃,并且系统能够学习到平衡且稳健的世界理解,而无需人类不断调整设置。

研究人员在多个不同的数据集上测试了这种方法,包括包含几何形状的合成场景和真实的皮肤病变医学图像。他们发现,即使系统展示的数据量仅为其他系统通常所需标注数据的1%到15%,它仍能高精度地识别概念。在涉及复杂逻辑规则(例如判断一个场景是否包含特定排列的物体)的测试中,该系统的表现与全监督训练的模型一样出色。至关重要的是,由于系统被强制要求在进行推理之前先分别学习各个概念,它在面对误导性模式的诱惑时表现出了更强的抵抗力。当研究人员在通常捷径失效的新场景中测试该系统时,它保持了准确性,而其他系统则失败了。

这项工作证明了机器可以在不需要大量人类标注的情况下,将抽象符号锚定在视觉现实中。通过通过将感知与推理分离并允许系统自我修正关注点来构建学习过程,研究人员为实现更高效、更可靠的人工智能开辟了一条路径。该系统不仅仅是记忆答案,它学会了以不同且可理解的属性来观察世界,使得将逻辑规则应用于新情况变得充满信心。这种方法预示着一个未来,即AI系统可以在更小、更易于管理的数据库上进行训练,同时仍能实现复杂现实任务所需的稳健且类人的理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →