← 最新论文
💻 computer science

Neurosymbolic Object-Centric Learning with Distant Supervision

本文介绍了 DeepObjectLog,这是一种概率神经符号模型,它通过远程监督直接从全局任务标签中学习以对象为中心的表示,从而在无需每个对象标注的情况下,实现视觉推理任务上更优越的分布外泛化能力。

原作者: Stefano Colamonaco, David Debot, Giuseppe Marra

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Stefano Colamonaco, David Debot, Giuseppe Marra

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人解决数学问题,但你只给它看最终答案,而不展示步骤或单个数字。

例如,你给机器人看一张画着"3"和"4"的图片,并告诉它:“答案是 7。”你并没有告诉机器人"3"在哪里、"4"在哪里,甚至没有告诉它图片里有多少个数字。你只是给出了图片和最终的总和。

这正是这篇论文要解决的挑战。大多数 AI 模型就像那些只背答案却不会真正做数学题的学生。一旦数字发生变化,它们就束手无策。当图片中的物品数量不同,或者物体组合出现新变化时,它们就会陷入困境。

问题所在:“黑盒”与“逻辑谜题”

当前的 AI 主要分为两派,但都存在缺陷:

  1. 纯神经网络(黑盒):这些模型擅长识别模式,却不擅长推理。如果你训练它们进行两个数字的加法,它们可能会学会识别总和"7"的形状,而不是真正执行 3 + 4 的运算。如果你给它们看 4 + 3,它们可能会感到困惑,因为模式看起来略有不同。
  2. 神经符号 AI(逻辑谜题):这些模型使用严格的逻辑规则(例如“如果 A + B = C")。它们擅长推理,但通常需要人类先明确告诉它们物体在哪里。它们无法看着一张杂乱的照片说:“啊,这里有个 3,那里有个 4。”它们需要物体被预先分割好并交给它们。

解决方案:DeepObjectLog(侦探)

作者创造了一个名为DeepObjectLog的新系统。把它想象成一名侦探,通过观察犯罪现场和最终判决来学习破案,而无需被告知嫌疑人是谁。

以下是它的工作原理,使用一个简单的类比:

1. “槽位”系统(侦探的放大镜)
想象 AI 拥有一组无形的“槽位”或放大镜,可以放置在图像的任何位置。它不知道有多少个物体,所以它可能会铺开,比如说,5 个放大镜。

  • 有些放大镜落在了"3"上。
  • 有些落在了"4"上。
  • 有些落在了空白的背景区域。

2. “物体性”问题(这是嫌疑人吗?)
对于每一个放大镜,AI 会问:“这实际上是一个物体,还是仅仅是背景噪音?”

  • 如果是背景,AI 会说:“忽略这个。”
  • 如果是物体,它就说:“这是个嫌疑人!”并尝试猜测它是什么(例如:“这看起来像个 3")。

3. “逻辑层”(法官)
这是神奇的部分。AI 将其所有猜测(“嫌疑人 A 是 3,嫌疑人 B 是 4,嫌疑人 C 什么都不是”)输入到一个严格的逻辑程序(如数学规则手册)中。

  • 规则手册规定:“如果你将真实嫌疑人的数字相加,结果必须与我们得到的最终答案(7)相符。”
  • 如果 AI 猜错了(例如,它认为背景是一个 5),数学结果就不会等于 7。逻辑层会说:“这说不通”,并向侦探发送信号让其改变想法。

4. 从错误中学习
AI 不断调整它的放大镜。它学会了,当最终答案是 7 时,它必须找到一个 3 和一个 4。它学会了忽略背景噪音,因为将其包含在内会导致数学计算出错。

为什么这很重要

论文声称这种方法更优越,因为它学习的是结构,而不仅仅是记忆

  • 泛化能力(“新谜题”测试):如果你用包含 2 个或 3 个数字的图片训练 AI,然后给它看包含 5 个数字的图片,它仍然能解决。为什么?因为它学会了加法的规则,而不仅仅是“两个数字”的模式。它可以激活更多的“放大镜”来处理额外的数字。
  • 无需标签:AI 不需要人类在数字周围画框。它仅仅通过尝试满足最终答案,就推断出了物体的位置。
  • 优于“超级大脑”模型:作者将他们的系统与庞大的预训练 AI 模型(如那些与你聊天的模型)进行了测试。即使是那些巨大的模型在这个特定的逻辑谜题上也表现挣扎,答错了答案。而 DeepObjectLog 虽然更小且更专业,却能在 90% 的情况下答对。

核心结论

DeepObjectLog 就像通过展示答案钥匙并让孩子自己找出数字来教孩子做数学。通过将“看见”物体(感知)的能力与“检查数学”(逻辑)的能力相结合,AI 学会了以一种灵活、合乎逻辑的方式理解世界,并且当情况发生变化时不会崩溃。

该论文表明,这种方法在数字加法、识别扑克牌手牌以及在复杂场景中数物体等任务上行之有效,证明了即使没有被告知具体是什么物体,AI 也能学会“思考”物体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →