GEB-Bench: Abstract Structures Told in Many Voices
GEB-Bench 引入了一种新颖的基准测试,用于评估人工智能模型在不同模态中识别和映射抽象结构特征的能力,揭示了单声部识别与跨声部抽象之间存在着一致且符合规律的差距,这种差距即使在尖端模型中依然存在。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
伟大的变形者测试
想象你正在观察一个向海洋扩散的河口三角洲。现在,想象你正在观察一道划破天空的锯齿状闪电。对人类来说,它们看起来完全不同:一个是水与沙,另一个是火与气。但如果你眯起眼睛,观察那些分支的“形状”,你可能会意识到它们共享着同一个秘密蓝图。它们都遵循着一种分裂与扩散的模式,数学家称之为“分形”或一种特定类型的分支结构。这种能够看透混乱表面、洞察其下隐藏的隐形骨架的能力,就是我们所说的抽象推理。这是一种超能力,让我们能够理解一个关于国王的故事和一个关于计算机程序的故事,本质上都在讨论“权力”,即便它们的措辞完全不同。
长期以来,科学家们一直在思考人工智能(AI)是否也拥有这种超能力。我们已经构建了能够识别照片中猫咪或写关于月亮诗歌的模型,但它们真的能“看见”连接河流、故事、数学方程和计算机代码之间那些深层且隐藏的结构吗?这是一个重大问题。如果 AI 做不到这一点,它就只是一个非常高级的鹦鹉,只会模仿模式,却不理解其背后的“为什么”或“如何做”。这就像是一个机器人虽然能背诵蛋糕的食谱,却并不理解什么是“烘焙”。
“多重声音”挑战
于是有了 GEB-BENCH,一个旨在测试 AI 模型能否识别这些隐藏形状的复杂新测试。设计者以一本著名的书《哥德尔、艾舍尔、巴赫》(Gödel, Escher, Bach)命名,这本书探讨了数学、艺术和音乐中如何呈现相同的奇特循环思想。该测试基于一个简单但狡黠的想法:取一个单一的抽象形状(如环、螺旋或镜像),然后用四种完全不同的“声音”来讲述关于它的同一个故事。
把它想象成一场“传声筒”游戏,只不过你不是在传递信息,而是在翻译一个形状。
- 场景之声(The Scene Voice): 一幅自然事物的图片,例如鹦鹉螺壳或河口三角洲,其中形状隐藏在构图之中。
- 故事之声(The Story Voice): 一个短篇民间传说,其中形状隐藏在故事的“叙述方式”中。例如,故事可能是一个“蟹卡农”(crab canon),即故事的后半部分是前半部分逐字倒读。
- 数学之声(The Math Voice): 一个精确、简洁的数学定理,利用符号来描述该形状。
- 骨架之声(The Skeleton Voice): 一个纯粹的线条画,类似于线框图,展示出形状而不带任何华丽细节。
陷阱在于?测试者抹去了所有的“修饰”。他们确保河口三角洲和闪电在颜色或纹理上并不共有。他们确保故事使用的词汇并不相同。唯一重要的只有那看不见的结构。AI 必须看着一张河流的照片并说:“啊,这和那个数学定理是同一种形状!”或者“这个故事在结构上的逻辑梗与那张线条画是一样的。”
研究结果:“翻译税”
研究人员测试了 37 种不同的 AI 模型,从微小的开源模型到来自大型科技公司的庞大、极其聪明的“前沿”模型。他们发现了一些迷人但也令人失望的事实:AI 擅长识别单一“声音”中的形状,但极不擅长将其转移到另一种“声音”中。
想象一下,你非常擅长通过一件心爱的红夹子(“数学之声”)来认出你的朋友。但如果这位朋友穿上了小丑服(“故事之声”)或迷彩服(“场景之声”),你可能完全认不出他。AI 模型通常能在呈现为清晰的数学方程或简单的线条画时识别出形状。但一旦它们需要将该形状转化为自然场景或民间传说时,它们的表现就会大幅下滑。
论文称之为**“映射税”(mapping tax)**。无论多么强大的模型,都必须缴纳这种税。即使是那些通常被视为 AI 前沿水平的最先进模型,在连接图像与故事之间的联系时也显得力不从心。研究发现,虽然这些模型在“数学之声”中识别形状的成功率约为 86%,但将同一形状匹配到“故事之声”的能力却降到了 44% 左右。这是一个巨大的差距。
“形式几何”陷阱
这里还有一个非常奇妙的部分:AI 并不是在瞎猜。当它们出错时,其错误遵循着一种逻辑模式。论文称之为**“形式几何”(formal geometry)**。
想象你正在尝试区分“环”(circle)和“怪圈”(strange loop,即一个在混乱中自我扭曲回来的圆圈)。AI 模型经常混淆这两者。它们之所以混淆,并不是因为图片看起来相似,而是因为定义这两个形状的“数学规则”在逻辑上是邻居。这就像你在学习驾驶时,总是把“停止标志”和“让行标志”搞混,因为它们都是红色的八角形,尽管使用它们的规则是不同的。
研究表明,AI 的错误比起人类眼中的视觉外观,更多是基于这些数学规则的可预测性。如果你给 AI 展示一张看起来像“怪圈”的图片,它往往会称其为“环”,因为在数学世界里,这两个概念紧挨在一起。这表明 AI 不仅仅是在“看”图像,它是在试图将其匹配到数学概念库中,但它卡在了细微的差别上。
“表面”问题
研究人员还发现,“噪声”的存在让现实世界变得更难处理。他们使用从简单的线条画(非常干净)到杂乱真实的摄影照片(非常混乱)的图像进行测试。随着图像变得更加写实和“嘈杂”,AI 的表现也随之变差。
这就像是在安静的房间里听一首歌,与在嘈杂拥挤的音乐会上听一首歌的区别。AI 能在安静的房间里听到旋律(结构),但在嘈杂的音乐会中,人群的喧闹声(照片的表面细节)会淹没旋律。研究发现,拥有更大、更强大的模型并不能让 AI 免受这种噪声的影响;它只是给了它更多的“余量”来应对混乱。它并没有解决问题,只是延迟了崩溃。
核心结论
本文最重要的启示是:识别一种结构与将其跨越不同领域进行翻译是两种不同的技能。 我们现有的 AI 模型在面对清晰呈现的结构(如数学或简单图表)时正变得越来越出色。但它们仍然难以将这种理解应用到自然场景和故事这些复杂、多样且混乱的世界中。
论文并不是说 AI “坏掉了”或者永远学不会。它只是指出,目前存在一个特定的、可衡量的差距。模型可以看懂数学书里的形状,但它们还无法在河口三角洲或民间传说中看到同样的形状。在它们能够弥合这一差距之前,它们仍缺少那种真正的“顿悟”时刻——即那种能看透河流、故事与数学其实都在以不同声音唱着同一首歌的抽象推理能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。