← 最新论文
🔬 materials science

Separating perception from reasoning in vision-language models: a model-free render ceiling for crystal structures

本文引入了“渲染天花板”(render ceiling),这是一种利用已知晶体结构的逆向相机渲染技术,旨在明确区分视觉感知错误与视觉语言模型中的推理失败,从而揭示许多模型在几何提取而非逻辑推理方面存在困难的无模型基准测试方法。

原作者: Can Polat, Mustafa Kurban, Erchin Serpedin, Hasan Kurban

发布于 2026-09-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Can Polat, Mustafa Kurban, Erchin Serpedin, Hasan Kurban

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在材料科学领域,研究人员每天都在致力于理解原子如何排列以形成构成我们世界的固体。这些被称为晶体结构的排列方式,通常被可视化为三维图形,其中球体代表原子,棒状结构代表将它们连接在一起的化学键。几十年来,科学家一直依赖这些图像来传达复杂的空间关系,但新一代人工智能现在正被要求去“阅读”这些图像。这些视觉语言模型旨在观察图像并回答相关问题,充当计算机所见与人类理解之间的桥梁。人们希望这些系统最终能够通过像人类研究员一样解读科学图表,从而帮助设计新材料。然而,一个持久的问题使得人们很难判断这些机器是真的学会了“看”,还是仅仅根据文本中的模式进行猜测。当模型给出错误答案时,几乎无法判断它是由于无法正确解读图片,还是因为无法利用逻辑来解决谜题。如果无法分离这两项技能,科学界就无法知道该将精力集中在何处以改进这些工具。

一组研究人员现在引入了一种新的衡量模型的方法,这种方法完全避开了猜测的需求。他们没有依赖另一个计算机程序来充当评判者,而是创建了一个基于最初绘制图像所使用的精确数学规则的系统。他们从一组已知的晶体结构出发,这些结构的原子位置是完美定义的,并使用标准的摄像机设置生成了数千张图像。由于他们准确知道摄像机的角度以及原始物体的情况,因此可以进行数学上的逆向过程。通过反转摄像机角度并从不同的视角重新计算原子的位置,他们可以精确地恢复出原始结构。这个过程创造了一个“天花板”式的完美准确度,即一个代表图像中所包含信息的绝对最大值的基准。如果图像本身包含了答案,这种方法就能证明这一点。如果模型无法找到答案,那么失败的原因必然在于模型本身,而非图片。

研究人员在两千多个晶体结构上测试了这种方法,并确保没有两个原子会以会导致计算混乱的方式出现重叠。他们发现,对于所有这些结构,数学逆向过程都运行得非常完美,每次都能恢复正确的答案。这意味着这个“天花板”是稳固的;图像承载了完整的真相。随后,他们要求十四种不同的视觉语言模型识别这些图像的晶体系统。结果令人警醒。虽然在给予模型精确的原子坐标作为文本辅助时,它们的表现有所提升,但即便有了这些额外帮助,其成绩仍远未达到完美水平。对于大多数模型而言,它们表现与完美天花板之间的差距并非由无法观察图像引起,而是在它们“理应”理解图片之后的推理阶段发生的。研究表明,对于十四个模型中的十三个,难点在于其逻辑能力,而非视觉能力。

为了证明图像本身是可读的,研究人员训练了一个没有任何语言能力的简单计算机视觉系统。该系统仅观察图像的像素,不具备任何文本或化学知识。令人惊讶的是,这个简单的系统得分高于测试的所有视觉语言模型,在近百分之九十的情况下都能正确识别晶体结构。这一发现表明,图像对于机器来说并不复杂,难点在于这些复杂的模型难以处理它们所看到的信息。研究还揭示了这些系统运作中的一个隐藏缺陷。当被要求从图像中提取原子坐标时,一个功能强大的模型生成的数字列表格式看起来非常完美,但内容却完全错误,与图片中的实际原子几乎没有匹配。在标准测试中,这类错误会被归咎于推理能力差,但这种新方法表明,这实际上是视觉能力的失效。该模型在伪造数据,创造了一个表面看起来正确但实则空洞的虚假现实。

这项工作的意义不仅限于评分。研究人员证明,摄像机围绕物体的放置方式比摄像机的数量更重要。他们发现,五种视角的特定排列足以消除歧义,而较少的视角则会留下误差空间。这为创建基准测试的科学家们提供了一条明确的规则:视角的质量比数量更重要。更重要的是,这项研究为审计人工智能在科学工作流中的应用提供了一种新工具。未来,当这些模型被用于设计新材料时,这种方法可以作为一个检查机制,以确保其推理的中间步骤是基于真实数据,而非幻觉产生的数字。通过将机器“看到了什么”与它“如何思考”分离开来,研究人员提供了一种构建更可靠工具的方法,确保当一个模型声称理解某种晶体时,它确实是在“看”它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →