为视频游戏或电影制作逼真的3D物体,往往感觉就像是在一张平坦的纸上绘画,然后试图将其完美地包裹在一个复杂且不规则的形状上,而不让图像发生撕裂或拉伸。这就是3D模型纹理贴图的核心挑战。几十年来,艺术家们一直通过手动绘制这些表面,这是一个缓慢且高度依赖技能的过程。近年来,计算机已经学会了使用人工智能来生成这些纹理,但结果往往会出现明显的接缝、扭曲的图案,或者在计算机难以理解物体真实形状的地方缺乏细节。现代研究的目标是教机器创造出不仅在视觉上令人惊叹,而且在几何上完美的纹理,这意味着图案能像在现实世界中一样,精确地贴合物体的曲线。
在2026年8月发表的一项研究中,来自中国宁夏机构的研究人员赵世杰(Shijie Zhao)和高鸿娟(HongJuan Gao)介绍了一种名为FM-TeD的新方法,以解决这些长期存在的问题。他们的方法不再采用传统的简单将2D图像投影到3D表面的方式(这种方式往往会导致前文提到的扭曲),而是构建了一个系统,使其表现得像一位观察力极强的艺术家:它同时观察着一个3D物体、阅读一段关于该物体外观的文字描述,并研究一张参考照片。通过结合这三种不同类型的信息——物体的形状、文本描述和视觉示例——该系统能够学习生成一种既尊重物体物理几何结构,又能填补单张参考照片中缺失细节的纹理贴图。
研究人员发现,以往的方法在处理具有深凹处或复杂曲线的物体时经常遇到困难,导致不同部分的图像无法匹配,产生“接缝”,或者出现同一个面在物体上出现两次的“雅努斯”(Janus)问题。他们的新系统通过使用双重扩散过程解决了这个问题。想象一下这样一个过程:计算机从一张空白且带有噪声的画布开始,并以3D形状作为引导,逐步进行清理,以确保纹理正确地遵循曲线。与此同时,它利用文本和参考图像来决定添加什么样的颜色和图案。这使得计算机能够“幻觉”或发明参考照片中隐藏的纹理部分,从而确保最终结果从各个角度看都显得完整且一致。
当团队使用大量的3D椅子模型和其他物体对他们的系统与现有方法进行测试时,结果非常明确。这种新方法生成的纹理在真实感和多样性方面都显著提高。在用于衡量图像质量的技术测量中,他们的系统比之前的最佳工具在视觉保真度方面有了大幅提升。具体而言,生成的图像更接近真实世界的照片,在图案如何与3D形状对齐方面误差更少。该系统还能够为同一个物体创造各种各样的独特纹理,表明它能够生成许多不同的设计,而不仅仅是重复同一种图案。
尽管取得了这些成功,研究人员也指出,他们的系统并非没有代价。生成这些高质量纹理需要大量的计算能力和时间。该模型需要运行数千个步骤来精炼细节,这意味着它比简单的方法需要更长的训练和运行时间。作者建议,未来的工作将集中在提高系统的效率上,例如寻找更智能的数据组织方式,以便在更短的时间内达到同样的高质量。然而,就目前而言,这项工作代表了在教计算机理解3D形状与其覆盖表面之间关系方面迈出的重要一步,为创造更真实的、自动生成的3D世界铺平了道路。
技术摘要:基于多模态几何感知的双扩散网格纹理生成
1. 问题陈述
现有的 3D 纹理生成方法通常将 2D 图像纹理映射到 3D 网格表面,这类方法在实际应用中面临显著的局限性。其中包括:
- UV 映射畸变: 在具有高深度变化或高曲率的表面上投影渲染图像时产生的变形问题。
- 几何不一致性: 难以保持生成的纹理与底层 3D 几何结构之间的对齐。
- 接缝与伪影: 当合并来自不同视角的图像时,会出现可见的拼接伪影,特别是当相邻像素源自不同的视角时。
- 分辨率与细节限制: 当前的方法往往难以生成具有细粒度细节的高分辨率纹理,或无法准确捕捉复杂的拓扑特征。
- 效率低下: 许多方法依赖于耗时的逐实例优化或基础的启发式方法(例如简单的 RGB 平均),这阻碍了计算效率和全局一致性。
2. 方法论:FM-TeD
本文提出了 FM-TeD(多模态纹理扩散融合),这是一个旨在实现高分辨率、高保真 3D 表面 UV 纹理生成的创新框架。该方法集成了 3D 几何信息、2D 图像和文本描述,以生成几何一致且视觉真实的纹理图。
核心架构
该框架通过以下阶段运行:
多模态数据表示:
- 3D 几何: 3D 网格 M={V,F} 由顶点和三角形片组成。
- 条件输入: 单张图像(I)和文本提示词(T)作为多模态条件。
- 特征提取: 利用 BLIP-2 模型进行视觉-语言表示学习。使用可训练的查询矩阵(Q-Former)提取图像特征,文本特征则由语言模型处理。这些特征通过跨模态注意力机制进行对齐。
- 融合: 多层感知器(MLP)和条件嵌入模块将 3D 几何特征与 2D 视觉-语言特征进行融合。
注意力增强的双扩散模块:
- 双扩散模块: 受 DiffusionNet 启发,该模块结合了热扩散模块、时间步感知 MLP 和最远点采样注意力层。
- 热扩散: 这作为流形上的几何特征提取器。它使用混合网格拉普拉斯算子(LmixR)及其特征值分解来计算热扩散算子。通过控制扩散距离 h(从时间步中学习),模型能够捕获局部几何细节(短程)和全局几何特征(长程),同时保持几何一致性。
- 特征融合模块: 该混合 2D-3D 模块通过以下方式处理输入:
- UV 头(UV Head,2D 卷积): 在 UV 空间高效提取局部特征。
- 3D 点云模块: 通过光栅化将 UV 特征映射回 3D 网格。
- 时间步感知编码器(Time-Step-Aware Encoder,MLP)。
- 最终融合特征(fout=fuvout+fpointin)引导去噪过程,确保 2D 纹理模式与 3D 几何对齐,从而避免拉伸和接缝。
纹理生成流水线:
- 过程始于在 UV 空间中用纯高斯噪声初始化纹理图。
- 使用条件输入(图像和文本),模型迭代地对图进行去噪。
- 在训练期间,单视图图像中的像素信息被投影到 UV 空间以形成部分初始化的图,从而引导模型填充不可见区域。
- 最终生成的 2D 纹理图被映射回 3D 网格表面。
3. 主要贡献
本文概述了三个主要贡献:
- 注意力增强的双扩散模块: 一种专门的 3D 几何特征提取器,旨在捕获网格表面上细粒度的局部几何依赖关系,从而简化纹理生成过程。
- 多模态特征融合: 一个去噪模块,通过集成 2D 图像处理能力与来自点云的 3D 几何信息,优化 UV 空间中的纹理特征,促进多模态数据的协同去噪。
- 端到端高分辨率框架: 一个能够实现从点云数据直接映射到高分辨率纹理图的系统,消除了传统方法中复杂的中间处理步骤,并提高了工作流效率。
4. 实验结果
作者在 ShapeNet Chair 数据集和 Amazon Berkeley Objects (ABO) 数据集上对 FM-TeD 进行了评估,并将其与四个基准模型进行了比较:PointUVDiff (基于 UV)、PointUVDiff (基于 PCL-texture)、DiffusionNet with DDPM 以及 UV3-TeD。
定量性能 (ShapeNet Chair)
FM-TeD 展现出优于现有方法的显著改进:
- FID (Fréchet Inception Distance): 达到 46.54(越低越好),优于 UV3-TeD (54.20) 和 DiffusionNet DDPM (116.58)。
- KID (Kernel Inception Distance): 达到 30.14(越低越好),明显优于 UV3-TeD (42.17) 和 DiffusionNet DDPM (468.09)。
- LPIPS (Learned Perceptual Image Patch Similarity): 达到 0.23(越高代表多样性越好),与 UV3-TeD (0.21) 相当,且优于 PointUVDiff 各变体 (0.08–0.09)。
定性观察
可视化结果表明,FM-TeD 生成的纹理具有更大的多样性和更丰富的语义信息。该方法能有效捕获局部语义细节,在不需要额外分割信息的情况下产生精细且真实的纹理。
消融实验
在 ABO 数据集上的实验证实了所提组件的必要性:
- 去除优化的 2D-3D 混合去噪模块会导致 FID(52.16 vs. 46.54)和 KID(40.91 vs. 30.14)升高。
- 去除注意力增强的双扩散模块会导致质量大幅下降(FID 98.40 vs. 76.08),验证了双扩散设计的重要性。
5. 重要性与局限性
重要性:
论文声称 FM-TeD 有效缓解了由 UV 映射引起的几何畸变,并生成了与网格几何结构高度一致的精细纹理。通过集成多模态输入,该方法能够生成比主流方法具有更逼真视觉效果和更精细细节的 3D 模型。报告的改进包括相比现有方法在 FID 上提升了 14.13%,在 KID 上提升了 28.53%。
局限性:
作者坦诚地承认了一个显著的局限性,即在学习高频纹理细节方面的效率问题。该模型需要大量的计算资源和训练时间,通常需要数千次迭代才能有效地捕获和生成细粒度特征。这导致了显著的训练开销和漫长的训练周期。
未来工作:
作者建议未来的研究应专注于开发更高效的网络架构,例如先进的特征聚合或下采样策略(例如优化的池化),以便更有效地处理高分辨率纹理信息,并在保持保真度的同时缩短训练时间。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。