Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction
本文介绍了 ZendoWorld,这是一个用于评估智能体通过主动实验推断隐藏视觉规则能力的交互式环境,研究表明,尽管当前的 AI 模型在观测数据上的预测准确率很高,但在真正的归纳推理和假设优化方面仍然存在困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在玩一场高风险的“猜猜秘密规则”游戏,对手是一位神秘且隐形的裁判。你不能只是坐在那里盯着线索看;你必须用彩色的积木、楔形块和棱锥块搭建出属于你自己的小场景,然后询问裁判:“这个是否符合规则?”如果你猜对了,你就可以继续玩下去。如果你猜错了,裁判会向你展示一个“反例”——即一个违反了你当前理论但实际上符合秘密规则的场景。你的目标是比任何人都更快地识破那个秘密规则。
这就是 ZendoWorld,一个由研究人员创建的数字游乐场,旨在测试 AI 智能体在学习、实验和像人类一样思考方面的表现。他们不仅仅想看 AI 能否“识别”模式,更想看 AI 能否通过构建实验来“主动发现”模式。
巨大的惊喜:做对并不意味着你理解了
研究人员设置了 22 种不同的秘密规则,从简单的“必须至少有三个红积木”到复杂的“件数必须是奇数”或“楔形块的数量多于棱锥块”。他们观察了不同类型的 AI 如何进行游戏,从简单的神经网络到试图将人类逻辑与机器视觉结合的复杂“神经符号”系统。
这里有一个令团队感到震惊的转折:仅仅因为一个 AI 擅长给图片贴标签,并不意味着它真的理解了规则。
想象一个学生,他能在关于重力的选择题中完美地回答“正确”或“错误”。这很棒!但如果你要求同一个学生设计一个新的实验来测试重力,他可能只会随手扔出一块石头,然后碰运气。研究发现,许多 AI 智能体就像这个学生。它们能观察一个场景并正确地说:“是的,这符合规则”或“不,它不符合”,准确率很高。但当轮到构建一个新场景来测试自己的理论时,它们表现得很糟糕。它们不断构建出与之前见过的场景极其相似的场景,无法提供任何新信息。这就像是在试图解开一个谜团,却只通过询问那些你已经知道答案的问题来尝试。
三大瓶颈:眼睛、大脑和双手
研究人员将游戏分解为三个部分,以观察 AI 在哪里卡住了:
- 感知(眼睛): AI 能看到积木并知道它们是红色、蓝色还是黄色吗?
- 归纳(大脑): AI 能通过观察线索并猜出秘密规则吗?
- 实验(双手): AI 能构建一个有助于它学习新知识的新场景吗?
他们发现不同的 AI 智能体卡在了不同的路段:
- “纯视觉”智能体: 这些由能够看图的大型语言模型驱动的智能体,很难正确猜出规则,在超过一半的环节中失败了。它们在构建实验方面也非常糟糕。它们提出的场景是“近乎无信息的”,意味着它们无法帮助缩小可能性范围。它们就像一个侦探,即使已经检查过图书馆十次了,还在不停地问:“管家在图书馆吗?”
- “符号化”智能体: 这些智能体更擅长逻辑,但有时难以正确“看清”世界。当研究人员给它们纯文本形式的场景描述(跳过了图像部分)时,这些智能体的表现变得更好。这表明对于某些 AI 来说,问题不在于逻辑,而在于它们的“眼睛”很模糊。
- 人类: 当真实的人类进行游戏时,他们明显比标准的 AI 智能体更出色,尤其是在处理棘手、复杂的规则时。人类能解决大约 73.3% 的游戏,而表现最好的标准 AI 智能体(VLM)仅解决了 44.5%。(注意:拥有完美视觉和逻辑的“先知/Oracle”智能体解决了 95.5%,但它拥有巨大的优势)。更有趣的是,人类能够理解一个完全超出标准游戏规则的“通配符”规则,而一个特定的 AI 智能体(VLP)也成功解决了这个“通配符”任务,其他视觉智能体均未能做到。
“过度修正”陷阱
研究人员发现的一个非常有趣的现象是,人类和 AI 都犯了同样的愚蠢错误。当一个 AI(或人类)认为自己掌握了正确的规则,但提交猜测后,裁判展示了一个反例(一个打破了其特定规则假设但仍符合真实秘密规则的场景)时,他们往往会感到恐慌,并向相反的方向过度摆动。
想象一下,你认为规则是“所有积木必须是红色的”。你提交了这个规则,结果裁判展示了一个带有蓝色积木的场景并说:“不对,不是这个。”你不仅没有把“红色”改为“蓝色”,反而突然决定规则变成了“所有积木必须是蓝色的,并且必须恰好有三个”。你过度修正了!研究发现,人类和 AI 智能体都会这样做,在一次错误的猜测后,反而离真相越来越远。
这对未来意味着什么
这篇论文并不声称解决了如何让 AI 像人类一样聪明的问题。事实上,它表明目前的 AI 仍然是非常专业化的。有些擅长看,有些擅长逻辑,但很少有能将“看、思考、实验”这三者流畅地循环结合在一起。
研究人员建议,要变得更好,AI 需要停止将“看”和“思考”视为两个独立的步骤。相反,AI 当前对规则的最佳猜测应该能帮助它决定下一步该看什么。这就像一个侦探,不再是随机地观察一切,而是利用当前的理论来决定下一个要检查的线索。
简而言之,ZendoWorld 向我们展示了,虽然 AI 在识别模式方面已经做得非常出色,但它在成为一名好奇的科学家方面仍有待提高。它能告诉你它看到了什么,但它还没有学会如何通过提出正确的问题来弄清楚“为什么”会看到它。在它学会构建更好的实验之前,它将只能通过重复那些旧有的场景来反复猜测秘密规则。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。