← 最新论文
💻 computer science

Do Vision-Language Models Agree on the Affective Qualities of Shape? A Cross-Model Audit for Generative Design Interfaces

本文审计了六个视觉语言模型,以评估它们在按情感感性(Kansei)描述符对3D物体进行排序时的一致性,结果表明,尽管这些模型表现出高于随机水平的部分一致性,但它们的收敛程度因物体类别和语义对齐程度的不同而显著变化,从而促使开发了一个UI原型,用以指导生成式设计界面中可靠语义控制的选择。

原作者: Luca Bux, Thiago Rios, Ingo Scholtes, Stefan Menzel

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Luca Bux, Thiago Rios, Ingo Scholtes, Stefan Menzel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在设计的早期阶段,无论是绘制一张新椅子的草图还是建模一辆汽车,创作者往往依赖语言来引导他们的工具。他们可能会要求“更优雅”、“更不臃肿”或“更极简”。如今,人工智能系统正开始理解这些请求,利用强大的计算机程序(能够识别图像并阅读文本)根据此类描述生成新的形状。这些被称为“视觉-语言模型”的系统,充当了设计师模糊的想法与具体三维物体之间的桥梁。然而,一个关键问题仍然存在:这些不同的计算机程序是否真的对这些词汇的含义达成了一致?如果一个程序认为高瘦的瓶子是“优雅”的,而另一个程序却认为矮胖的瓶子才是“优雅”的,那么这个工具就会变得不可靠。设计师需要在信任它来塑造作品之前,了解这个数字助手是否具有一致性。

来自本田研究中心欧洲分部(Honda Research Institute Europe)和维尔茨堡朱利叶斯·马克西米利安大学(Julius-Maximilians-Universität Würzburg)的研究团队致力于回答这个问题,他们审计了六个目前最先进的视觉-语言模型。他们想看看这些由不同公司构建、并在不同数据上进行训练的独立程序,在被要求判断物体的感官或“情感”特质时,是否会对相同的物体进行相同的排序。为此,他们剥离了所有可能干扰计算机的因素。他们提取了数千个日常用品(如椅子、灯具和罐子)的三维模型,并将它们渲染成纯色的灰色形状。通过去除颜色、材质和纹理,研究人员确保模型仅基于形态进行判断,就像雕塑家在为粘土模型上色之前观察其造型一样。

研究人员随后要求这六个计算机模型沿着各种尺度对这些灰色形状进行排序。其中一些尺度是直观的物理描述,例如“高与矮”或“方正与圆润”,作为控制变量以测试模型是否甚至能在基础几何学上达成一致。其他则是更复杂的、具有人类特征的描述词,即设计师实际使用的词汇,例如“现代与传统”或“优雅与凌乱”。最后,他们加入了一组无意义的配对,如“响亮与安静”,以建立一个随机一致性的基准。如果模型在这些无关的配对上也达成了一致,那就意味着它们的排序仅仅是噪声。

结果呈现出一幅细致入微的共识图景。模型在判断简单的物理特征时表现得非常一致;它们在判断物体的高矮方面基本达成了一致。当涉及到更抽象的情感特质时,模型的共识程度处于中等水平,虽然显著高于随机概率,但尚未达到完美。平均而言,模型在情感术语上的物体排序一致率约为36%,而对于无意义术语的一致率仅为14%。这表明,尽管计算机已经发展出了一种关于形状如何关联感受的共同感知,但它们尚未实现完美的对齐。

至关重要的是,研究发现这种一致性在不同类型的物体之间并不统一。对于某些类别,如罐子,模型在判断什么是“优雅”或“奢华”时表现出很强的共识,一致率超过了50%。而对于其他类别,如书架,模型则难以找到共同点,一致率低至21%。研究人员发现,这种差异与其说是取决于物体之间外观的不同,不如说是取决于该类别中的特定形状变化是否真正符合该词汇所指向的方向。例如,如果一组椅子主要在高度上有所变化,模型可以很容易地就哪个“高”达成一致;但如果这一组椅子在细微的曲线变化上有所不同,且这些变化并不符合“优雅”的概念,模型就会产生分歧。

研究人员还测试了这些一致性是针对特定物体的类型,还是仅仅是文本的通用特性。他们发现,像“柔软与坚硬”这样适用于沙发、但在应用于瓶子时显得不协调的描述词,效果并不理想。这证实了模型并非仅仅在应用一种通用的规则,而是在实际解读特定物体的形状与所用描述词之间的关系。

为了使这些发现对现实世界的工程设计产生价值,团队构建了一个可视化这种一致性的原型界面。在这个工具中,设计师可以选择一个物体并看到一系列潜在的控制项,例如“使其更现代”。在每个控制项旁边,系统都会显示一个分数,指示不同计算机模型对该指令的认同程度。如果分数很高,设计师就可以确信该工具的表现是可预测的。如果分数很低,界面会提示该控制项对于该特定物体可能并不可靠,从而可以将其撤回或替换为更有保障的替代方案。

这项工作并不声称计算机已经学会了人类的情感,也不代表它们的一致性证明了它们是正确的。相反,它提供了一种实用的方法,用于在将数字工具交给用户使用之前,检查其稳定性。通过将不同计算机模型之间的一致性视为一种质量控制手段,设计师可以识别哪些情感描述符是安全可用的,哪些可能会导致困惑。这项研究表明,尽管人工智能正在成为设计的强大伙伴,我们仍必须仔细审计其对世界的理解,以确保当设计师要求“优雅”时,机器看到的正是设计师所想的那样。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →