Bongards at the Boundary of Perception and Reasoning: Programs or Language?
本文提出了一种神经符号方法,该方法结合了用于生成参数化程序的语言大模型与用于参数拟合的贝叶斯优化来解决 Bongard 问题,从而弥合了视觉感知与抽象推理之间的鸿沟。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大局观:视觉谜题挑战
想象一下,你面前有 12 幅图画。其中 6 幅是“好”的(正例),另外 6 幅是“坏”的(负例)。你的任务是找出区分这两者的秘密规则。
这被称为 Bongard 问题。这些不仅仅是简单的“找不同”游戏,其规则可能极其复杂。
- 例子: 也许“好”图中的形状都拥有一个“水平”的“脖子”,而“坏”图中的形状则是“垂直”的脖子。或者,“好”图中的形状是“扭曲”的,而“坏”图中的形状是“平滑”的。
这篇论文提出了一个宏大的问题:人工智能(AI)能否像人类一样解决这些谜题? 人类擅长观察全新的情境,即时创造出一个新概念(比如“水平脖子”),并将其应用其中。目前的 AI 擅长识别它以前见过的东西(比如“这是一只猫”),但在需要从零开始发明新概念时,往往会显得力不从心。
问题所在:AI 要么太死板,要么太模糊
研究人员发现,AI 在解决这些谜题时有两种主要的思考方式,但这两种方式都各有缺陷:
“聊天机器人”法(自然语言):
- 运作方式: AI 观察图片,并尝试用文字描述规则,就像侦探在写调查报告一样。
- 缺陷: 它擅长宏观概念,但缺乏精确度。它可能会说,“好形状有点尖锐”,但它无法区分“稍微尖锐”和“非常尖锐”之间的区别。这就像一位厨师知道食谱里说要“加一撮盐”,却不知道确切的分量是多少。
“程序员”法(代码):
- 运作方式: AI 编写一段计算机程序来检查图像。它可以测量精确的距离、角度和计数。
- 缺陷: 它擅长精确度,但缺乏创造力。如果规则是“形状看起来像一张忧伤的脸”,计算机程序很难用数学来定义什么是“忧伤”。这就像一个机器人可以精确到毫米地测量房间,却无法理解什么是“温馨”的概念。
解决方案:“翻译官”团队
作者构建了一个新的系统,它就像是一个由两名专家组成的协作团队。他们称之为“神经符号”(neurosymbolic)方法(即将神经网络/AI 与符号逻辑/程序相结合)。
以下是这个团队的工作步骤:
第一步:创意生成器(“聊天机器人”)
首先,他们要求一个强大的 AI(视觉语言模型)观察谜题,并用直白的英语猜想出几个可能的规则。
- 类比: 想象一场头脑风暴会议,一位创意作家提议:“也许规则是关于形状的‘脖子’!”
第二步:翻译官(“程序员”)
接下来,系统会将这些英语猜想转化为计算机代码。
- 转折点: AI 不仅仅是编写代码,它还会为棘手的数字留下“空格”。例如,如果规则是“脖子长度大于 X 的形状”,AI 会编写代码,但将 X 作为一个未知变量留白。
- 类比: 作家说:“脖子必须比 [空格] 长。” 程序员搭建好了测量脖子的机器,但仍在等待那个确切的数字。
第三步:调优器(贝叶斯优化)
这是核心秘诀。系统通过一个“试错”过程来找到那些空格中的完美数字。它会测试不同的数字(比如 5 像素、10 像素、15 像素),看看哪一个能完美地将“好”图与“坏”图分开。
- 类比: 想象你在调收音机。你知道电台在 90 到 100 之间,但不知道确切的频率。你会慢慢转动旋钮,直到杂音消失,音乐变得清晰完美。系统通过数学手段进行这种操作,以找到规则的精确“临界点”。
第四步:裁判(验证器)
最后,系统会检查:“这段代码在所有训练图片上都能正常工作吗?”
- 如果代码完美运行,系统就会接受该规则。
- 如果代码失败,系统会回到“聊天机器人”那里,告诉它:“这个想法行不通,再试一次,” 然后循环往复。
他们的发现是什么?
研究人员将这个“团队协作法”与现有的顶尖 AI 模型(如 GPT-4o 和 Claude 3.7)甚至普通人类的表现进行了对比测试。
- 团队获胜: 通过结合“聊天机器人”的创造力和“程序员”的精确性,他们的系统解决了 100 个 Bongard 问题中的 51 个。
- 超越人类: 在之前的研究中,人类的平均得分约为 47 分。他们的 AI 团队解决了 51 个,这标志着 AI 首次在这一特定测试中超越了人类的平均水平。
- 不同的优势:
- 当问题涉及几何与数学(如“这些线是否平行?”)时,“程序员”部分是英雄。
- 当问题涉及抽象概念(如“这个形状是‘开放’还是‘封闭’的?”)时,“聊天机器人”部分是英雄。
- 如果他们只使用“聊天机器人”或只使用“程序员”,表现都会变差。他们需要两者兼备。
“记忆化”检查
研究人员担心 AI 可能会通过从互联网上“作弊”(因为这些谜题很经典且流行)来直接背诵答案。为了测试这一点,他们反转了规则:他们告诉 AI “坏”图其实才是“好”图。AI 依然表现出色,这证明它并非在背诵记忆中的答案,而是在真正理解逻辑。
核心结论
这篇论文表明,要解决复杂的视觉谜题,AI 不应仅仅尝试像人类一样“思考”,也不应仅仅像计算机一样“计算”。它需要两者兼具。通过让富有创造力的 AI 提出想法,并让精确的计算机用精确的数学进行验证,我们可以构建出几乎能像人类一样(有时甚至比人类更好)学习新视觉概念的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。