想象一下,你正试图教会一个机器人如何观察世界。你给了它一个庞大的照片库,并让它不断研究,直到它成为识别“事物”的专家。但有一个限制:当你向机器人提问时,你不让它重新看整张图片。相反,你强迫它眯起眼睛,将一切模糊地揉在一起,然后递给你一张单一且模糊的总结笔记。如果机器人的回答错了,你可能会认为它根本没有学会细节。但如果那些细节其实一直都在,只是隐藏在那份模糊的总结之中呢?这就是现代计算机视觉核心处的谜题。科学家们一直在构建“基础模型”——在数百万张图像上训练出的超级智能 AI 大脑——它们非常擅长说出“那是条狗”或“那是辆车”。然而,这些模型在面对棘手问题时往往会显得力不从心,比如:“这两条狗中,哪一条戴着红色的项圈?”或者“左边的三角形是红色还是蓝色?”多年来,研究人员一直认为这些失败意味着 AI 根本无法理解如何将特定特征(如颜色和形状)与特定物体绑定。他们认为 AI 的大脑在空间感知上过于“盲目”,无法在拥挤的场景中追踪单个项目。
来自莱斯大学和昆士兰大学的一个研究小组决定通过一个聪明的实验来测试这一假设。他们提出了一个简单而深刻的问题:信息是真的缺失了,还是仅仅因为我们“提问的方式”而丢失了?为了找出答案,他们让 AI 的“大脑”(即看图的部分)保持完全冻结且不发生改变。他们没有改变 AI,而是改变了用来倾听它的“麦克风”。他们将标准的倾听方式(对整张图片的单一、模糊的总结)与一种新的“注视式(foveated)”方法进行了对比。把这种新方法想象成给了 AI 一副神奇的眼镜,让它能够放大并聚焦于与问题相关的特定图像部分,从而忽略其余部分。
结果具有变革意义。当研究人员使用标准的“模糊总结”方法时,AI 在需要从人群中挑选特定物体的任务中表现极差,通常只能靠随机猜测来获得正确答案。它看起来完全对细节视而不见。然而,当他们切换到“神奇眼镜”方法,允许 AI 在回答之前聚焦于正确的地点时,其表现大幅飙升。在一项涉及隐藏在五十个其他形状中的红色三角形的测试中,标准方法仅有 3.5% 的正确率,而聚焦方法却达到了 93.5% 的正确率——几乎与人类注视特定位置的表现不相上下。
这表明 AI 实际上并不“盲目”,也没有丢失信息。细节一直都在那里,存储在 AI 处理的图像微小区块中。问题在于,用标准的方式读取 AI 的思维,就像是在飓风中试图听清一声低语;重要的信号被画面中其他所有事物的噪音淹没了。通过使用聚焦式的读取方式,研究人员证明了 AI 的“视觉”比我们想象的要敏锐得多,只要我们能让它在正确的时间观察正确的事物。这并不意味着 AI 现在已经完美了,但它证明了失败不在于“看”,而在于“听”。