Weakly Supervised Concept Learning for Object-centric Visual Reasoning
本文提出了一种弱监督神经符号框架,该框架将基于槽位的以对象为中心的感知与变分自编码器相结合,以将符号锚定用于逻辑推理,在仅需 1% 标注数据的情况下实现了高性能与领域泛化,并超越了最先进的基础模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教机器人理解世界,但没有预算雇佣一支人类教师团队来标注它看到的每一张图片。这正是本文要解决的问题。
作者提出了一种“两阶段”系统,它像一个翻译器和一个逻辑谜题求解器在协同工作。
问题:“标注”瓶颈
通常,要教会计算机“看”,你需要成千上万张图片,并且人类需要在这些图片上画出物体框并准确写下它们是什么(例如,“这是一个红球”,“这是一个蓝立方体”)。这既昂贵又缓慢。
本文问道:我们能否仅利用极少量的这些标注来教机器人理解物体?(他们测试时仅使用了通常标注量的 1%)。
解决方案:两阶段团队
第一阶段:“槽位”翻译器(感知)
想象机器人的大脑里有一组空的槽位(就像空停车位)。
- 旧方法:标准 AI 查看图片时试图一次性猜测整个场景。如果光线变化或角度奇怪,它往往会感到困惑。
- 新方法:该系统使用一种称为**槽位注意力(Slot Attention)**的特殊架构。想象机器人看着一个杂乱的房间说:“好吧,我有 10 个空槽位。我会尝试将每个物体放入一个槽位中。”
- 槽位 1 抓取“红球”。
- 槽位 2 抓取“蓝立方体”。
- 槽位 3 抓取“背景”。
机器人使用**变分自编码器(VAE)**来完成这项工作。它就像一个生成艺术家,试图根据它认为槽位里有什么来重绘图片。如果它重绘的图片质量很差,它就知道自己没有正确理解物体,于是再次尝试。
魔法技巧(弱监督):
为了确保机器人学习的是正确的东西(如“颜色”或“形状”),而不是随机噪声,研究人员给了它一个微小的提示。他们只展示1% 的图片并附上正确的标签。
- 类比:想象教一个孩子整理洗衣物。你不是给他们看每一只袜子,而是给他们看 10 只袜子并说:“这些是红色的。”孩子然后利用这个微小的提示,自己找出剩余的一堆袜子。
- 机器人学会了很好地分离“结构性”事物(形状、大小),即使只有 1% 的帮助。然而,“表面”事物(如特定颜色或纹理)在如此少的帮助下较难学习。
第二阶段:逻辑谜题求解器(推理)
一旦机器人将物体分类到槽位中并命名(例如,“物体 A 是一个大的蓝色球体”),它会将此转换为简单的符号语言(如 blue(sphere))。
然后,这份符号列表被交给一个逻辑引擎(像侦探或数学求解器)。
- 逻辑引擎不看图片;它只看符号列表。
- 它试图寻找规则。例如:“如果有一个蓝色球体 AND 一个黄色立方体,那么答案是 YES。”
他们的发现(结果)
"1% 奇迹”:仅使用 1% 的标签,他们的系统几乎完美地学会了识别形状和大小。它在泛化到新的、未见过的图像类型方面(例如,从合成 3D 方块转移到现实世界的医学皮肤图像)表现得令人惊讶地好。
- 对比:当他们将此系统与庞大的预训练“基础模型”(如 DINOv2,它们就像巨大的知识库)进行对比测试时,他们这个微小的、仅 1% 标注的模型在识别新类型图像方面实际上做得更好。庞大的模型过于专注于其训练数据,面对新事物时感到困惑。
“专家型”求解器:论文发现,不同的逻辑引擎擅长不同的事情:
- ILP(归纳逻辑编程):这是“组合专家”。它极其坚韧。即使机器人在描述物体时犯了一些错误(感知噪声),ILP 求解器仍然能找出正确的逻辑规则(例如,“有一个蓝色球体吗?”)。这就像一位侦探,即使证人的记忆稍有偏差,也能破案。
- 贝叶斯网络:这些是“概率专家”。它们更擅长计数或处理不确定性(例如,“有多少金属物体?”)。
瓶颈:该系统对简单规则运作良好。但是,如果你问一个需要完美掌握多个事物同时存在的复杂问题(例如,“患者背部是否有恶性斑点?”),如果“翻译器”(第一阶段)在其中一个概念上犯哪怕是很小的错误,系统就会陷入困境。如果机器人对位置不是 100% 确定,它就无法解决复杂的规则。
核心启示
本文证明,构建一个智能、逻辑的 AI 并不需要海量的标注数据。你只需要一个聪明的架构(槽位注意力)和一个微小的提示(1% 的监督),就能教会它如何将场景分解为可理解的片段。
一旦片段被分解,你就可以根据任务插入不同的“求解器”:对严格的逻辑谜题使用“组合专家”,对计数或猜测使用“概率专家”。这使得系统具有灵活性、可解释性(我们可以确切看到机器人“看到”了什么),并且即使在数据稀缺的情况下也表现出惊人的鲁棒性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。